lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

ยังห่างไกลจากการแทนที่โปรแกรมเมอร์จริง ๆ: เมื่อ Agent เข้าสู่โค้ดส่วนตัวขององค์กร อัตราการผ่านสูงสุดก็เพียงสี่สิบเปอร์เซ็นต์เท่านั้น

动察 Beating ข่าวด่วน AI บริษัทข้อมูล AI ที่บ่มเพาะโดย YC อย่าง Specific Labs เปิดตัวการประเมินการเขียนโปรแกรม Real-SWE ซึ่งใช้โค้ดส่วนตัวของบริษัทจริงในการทดสอบ Coding Agent โดยตรง ภารกิจมาจากสภาพแวดล้อมการผลิตขององค์กรโดยตรง รวมถึงการคำนวณภาษี การย้ายข้อมูลบิล การเรียกเก็บเงินผ่าน API และการย้ายข้อมูลลูกค้า ทั้งโค้ดและคำตอบไม่ได้เปิดเผยบนอินเทอร์เน็ต Agent ต้องค้นหากฎทางธุรกิจและโครงสร้างโค้ดของบริษัทด้วยตนเอง


ผลปรากฏว่า Fable 5.1 อยู่อันดับหนึ่ง แต่มีอัตราผ่านเพียง 38.8%; GPT-6 Astra อยู่ที่ 33.8%, Gemini 3.8 Flash อยู่ที่ 31.2% GLM 5.3 อยู่อันดับสี่ด้วย 28.8% สูงกว่า Grok 4.6, Kimi K3 และ GPT-5.6 Sol ในภารกิจ 10 รายการที่เปิดเผยในปัจจุบัน มี 6 รายการที่มีอัตราผ่านโดยรวมต่ำกว่า 15% และยังมีอีกหนึ่งภารกิจที่โมเดลทั้งหมดล้มเหลว


สิ่งที่ทำให้ประหลาดใจที่สุดคือ GLM 5.3 Real-SWE ทดสอบความสามารถของ Agent ในการอ่านโค้ดอย่างต่อเนื่อง ค้นหากฎ และทำงานหลายขั้นตอนให้สำเร็จในโครงการที่ไม่คุ้นเคยได้ดีกว่า นักวิจัยของ Zhipu อย่าง Xiaopu Peng ตอบกลับว่า พวกเขาเริ่มฝึกภารกิจระยะยาวตั้งแต่ GLM-5.1 และ Real-SWE ใกล้เคียงกับความสามารถประเภทนี้มากกว่ากระดาน SWE ที่เปิดเผยต่อสาธารณะ ซึ่งสามารถอธิบายได้บางส่วนว่าทำไม GLM 5.3 จึงโดดเด่นบนกระดานนี้

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น