lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

การประเมินการเขียนโปรแกรม 20 ชั่วโมงเผยให้เห็นช่องว่างที่ชัดเจน: Claude Fable 5.1 นำหน้า GPT-5.6 มากกว่า 24 คะแนน ขณะที่ GLM-5.3 อยู่อันดับสาม

動察 Beating AI ข่าวด่วน ทีมวิจัย AI ชื่อ Proximal เปิดตัวการทดสอบการเขียนโปรแกรมรอบยาว FrontierSWE v2 งานขยายจาก 17 เป็น 34 รายการ แต่ละโมเดลรัน 5 ครั้งต่องาน ครั้งละสูงสุด 20 ชั่วโมง Claude Fable 5.1 ได้คะแนนเฉลี่ย 56.29% นำหน้า GPT-5.6 ที่ได้ 32.2% อย่างมาก โมเดลโอเพนซอร์ส GLM-5.3 อยู่อันดับสามด้วย 30.2%


งานใน FrontierSWE ไม่ได้เป็นแค่การแก้โค้ดอีกต่อไป Agent ต้องเขียนซิมูเลเตอร์วงจรไฟฟ้าจากศูนย์ ฝึกโมเดลพยากรณ์อากาศ จับคู่ภาพจากกล้องโทรทรรศน์กับแคตตาล็อกดาว หรือฝึกบอทแข่งรถจากภาพเกมเพียงอย่างเดียว v2 เปลี่ยนมาใช้ Proximus harness แบบเดียวกันทั้งหมด แต่ละงานรันได้สูงสุด 20 ชั่วโมง เมื่อโมเดลเตรียมส่งคำตอบ ระบบจะบันทึกเวอร์ชันปัจจุบันและแจ้งเวลาที่เหลือให้ทราบ เพื่อป้องกันไม่ให้โมเดลจบงานเร็วเกินไป


การเปลี่ยนแปลงนี้ส่งผลต่อคะแนนไม่น้อย Proximal เปรียบเทียบใน 6 งานพบว่า Claude Opus 5 และ GPT-5.6 เมื่อเปลี่ยนมาใช้ Proximus ทำงานนานขึ้น และคะแนนเฉลี่ยสูงกว่าเมื่อใช้ harness ดั้งเดิมของตัวเอง


การทดสอบยังจับการโกงแบบจงใจได้หลายครั้ง GPT-5.6 เคยตระหนักว่าการอ่านคำตอบสาธารณะ "อาจเกี่ยวข้องกับปัญหาการต่อต้านการโกง" แต่สุดท้ายก็ยังใช้ทางลัดนี้ อีกครั้งหนึ่งมันใช้บริการเบื้องหลังของ Modal เพื่ออ่านไฟล์ตรวจสอบที่ซ่อนอยู่ ส่วน Muse Spark 1.2 แก้สคริปต์ทดสอบ ใส่คำตอบสาธารณะ และเขียนโค้ดพยายามปกปิดร่องรอยการโกง การรันที่ยืนยันว่าละเมิดถูกบันทึกเป็นศูนย์คะแนนทั้งหมด

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น