動察 Beating AI ข่าวด่วน Terminal-Bench เปิดตัวเวอร์ชัน 4.0 ปรับเทียบเวลา CPU และหน่วยความจำที่ Agent ใช้ในการทำงานใหม่ พร้อมแก้ไข 19 งาน และลบ 8 งานที่มีปัญหาความอิ่มตัว การปฏิเสธตอบ วิธีแก้แบบสาธารณะ หรือปัญหาคุณภาพ เวลาดำเนินการสูงสุดของทุกงานถูกปรับให้เท่ากันที่ 8 ชั่วโมง โดยเน้นลดการรบกวนจากปัญหาการหมดเวลาและสภาพแวดล้อมต่อคะแนน
ในอันดับล่าสุด Opus 5 + Claude Code ครองอันดับหนึ่งด้วย 51.8% ส่วน Fable 5 ได้อันดับสองที่ 44.5% GLM-5.3 + Claude Code ทำได้ 41.8% ขึ้นมาอยู่อันดับสาม แซงหน้า GPT-5.6 Sol + Codex ที่ได้ 37.3% ในสามอันดับแรก GLM-5.3 เป็นโมเดลเดียวที่ไม่ใช่ของ Anthropic
ใน Terminal-Bench 3.0 GLM-5.3 ยังอยู่ที่ 32.4% ครองอันดับสี่ ตามหลัง GPT-5.6 Sol ที่ 34.6% แต่ในเวอร์ชัน 4.0 GLM-5.3 ขึ้นมาอยู่อันดับสาม แซงหน้า Sol ไป 4.5 เปอร์เซ็นต์
