動察 Beating AI ข่าวด่วน ทีมวิจัย AI ชื่อ Proximal เปิดตัวการทดสอบการเขียนโปรแกรมรอบยาว FrontierSWE v2 งานขยายจาก 17 เป็น 34 รายการ แต่ละโมเดลรัน 5 ครั้งต่องาน ครั้งละสูงสุด 20 ชั่วโมง Claude Fable 5.1 ได้คะแนนเฉลี่ย 56.29% นำหน้า GPT-5.6 ที่ได้ 32.2% อย่างมาก โมเดลโอเพนซอร์ส GLM-5.3 อยู่อันดับสามด้วย 30.2%
งานใน FrontierSWE ไม่ได้เป็นแค่การแก้โค้ดอีกต่อไป Agent ต้องเขียนซิมูเลเตอร์วงจรไฟฟ้าจากศูนย์ ฝึกโมเดลพยากรณ์อากาศ จับคู่ภาพจากกล้องโทรทรรศน์กับแคตตาล็อกดาว หรือฝึกบอทแข่งรถจากภาพเกมเพียงอย่างเดียว v2 เปลี่ยนมาใช้ Proximus harness แบบเดียวกันทั้งหมด แต่ละงานรันได้สูงสุด 20 ชั่วโมง เมื่อโมเดลเตรียมส่งคำตอบ ระบบจะบันทึกเวอร์ชันปัจจุบันและแจ้งเวลาที่เหลือให้ทราบ เพื่อป้องกันไม่ให้โมเดลจบงานเร็วเกินไป
การเปลี่ยนแปลงนี้ส่งผลต่อคะแนนไม่น้อย Proximal เปรียบเทียบใน 6 งานพบว่า Claude Opus 5 และ GPT-5.6 เมื่อเปลี่ยนมาใช้ Proximus ทำงานนานขึ้น และคะแนนเฉลี่ยสูงกว่าเมื่อใช้ harness ดั้งเดิมของตัวเอง
การทดสอบยังจับการโกงแบบจงใจได้หลายครั้ง GPT-5.6 เคยตระหนักว่าการอ่านคำตอบสาธารณะ "อาจเกี่ยวข้องกับปัญหาการต่อต้านการโกง" แต่สุดท้ายก็ยังใช้ทางลัดนี้ อีกครั้งหนึ่งมันใช้บริการเบื้องหลังของ Modal เพื่ออ่านไฟล์ตรวจสอบที่ซ่อนอยู่ ส่วน Muse Spark 1.2 แก้สคริปต์ทดสอบ ใส่คำตอบสาธารณะ และเขียนโค้ดพยายามปกปิดร่องรอยการโกง การรันที่ยืนยันว่าละเมิดถูกบันทึกเป็นศูนย์คะแนนทั้งหมด
