ตามการติดตามของ Beating ทีม Hunyuan ของ Tencent ร่วมกับมหาวิทยาลัยหลายแห่งได้เปิดตัว LHTB ซึ่งเป็นเกณฑ์มาตรฐานที่ออกแบบมาเพื่อทดสอบว่า AI Agent สามารถทำงานที่ซับซ้อนในเทอร์มินัลได้อย่างต่อเนื่องหรือไม่
เกณฑ์มาตรฐานประกอบด้วย 46 ภารกิจ ครอบคลุมด้านวิศวกรรมซอฟต์แวร์ การจำลองการทดลอง การคำนวณทางวิทยาศาสตร์ และการวิเคราะห์หลายรูปแบบ แต่ละภารกิจใช้เวลาสูงสุด 90 นาที และมักต้องดำเนินการหลายร้อยขั้นตอนอย่างต่อเนื่อง
LHTB ไม่ได้ดูแค่ผลลัพธ์สุดท้ายเท่านั้น หากภารกิจสำเร็จบางส่วน ก็จะให้คะแนนตามความคืบหน้าจริง ตัวตรวจสอบที่ซ่อนอยู่จะตรวจสอบไฟล์ ผลการทดสอบ และผลลัพธ์ของโปรแกรม การที่ Agent อ้างว่าสำเร็จด้วยตัวเองไม่นับ
เอกสารวิจัยฉบับแรกทดสอบโมเดล 15 ตัว GPT-5.5 ทำภารกิจสำเร็จ 7 ภารกิจ อยู่อันดับหนึ่ง แต่ละโมเดลดำเนินการหนึ่งภารกิจ ใช้ Token เฉลี่ยประมาณ 9.9 ล้าน ใช้เวลาประมาณ 85 นาที
ปัจจุบันผลลัพธ์ที่เปิดเผยต่อสาธารณะได้ขยายเป็น 20 โมเดล Grok 4.5 ขึ้นอันดับหนึ่งด้วยคะแนนเฉลี่ย 0.505 ทำภารกิจสำเร็จ 13 ภารกิจ จาก 46 ภารกิจ ยังมี 29 ภารกิจที่ไม่มีโมเดลใดถึงเกณฑ์สำเร็จ
Agent ส่วนใหญ่สามารถทำบางขั้นตอนสำเร็จ แต่มักหมดเวลา 90 นาที หรือหยุดก่อนที่ภารกิจจะเสร็จสมบูรณ์ ไม่สามารถทำงานที่ซับซ้อนให้เสร็จสมบูรณ์ได้จริง
