ตามการติดตามของ Beating โมเดลโอเพนซอร์ส GLM-5.2 ของ Zhipu AI ได้เข้าสู่เกณฑ์มาตรฐานวิศวกรรมซอฟต์แวร์ระยะยาว DeepSWE อย่างเป็นทางการ ในโหมดการใช้ความคิดสูงสุด อัตราความสำเร็จครั้งเดียวสำหรับงานพัฒนาที่ซับซ้อนอยู่ที่ 44% ครองอันดับหนึ่งในบรรดาโมเดลโอเพนซอร์ส เมื่อเทียบกับ Kimi K2.7 Code ที่เข้าสู่เกณฑ์ก่อนหน้านี้ อัตราความสำเร็จสูงกว่าถึง 13 เปอร์เซ็นต์
ต้นทุนเฉลี่ยของ GLM-5.2 ในการแก้ไขแต่ละงานอยู่ที่ 3.92 ดอลลาร์สหรัฐ สูงกว่า Kimi K2.7 Code เล็กน้อยที่ 2.82 ดอลลาร์สหรัฐ แต่อัตราความสำเร็จกลับเหนือกว่าโมเดลปิดกระแสหลักหลายรุ่นภายใต้การกำหนดค่าการคิดเฉพาะ รวมถึง Claude Sonnet 4.6 [high] (30%), Gemini 3.5 Flash [medium] (37%) และ Claude Opus 4.8 [low] (41%)
เกณฑ์มาตรฐาน DeepSWE ที่ออกแบบโดย Datacurve ผู้ริเริ่มการประเมินนี้ ทดสอบความสามารถของ AI Agent ในการจัดการงานระยะยาวโดยเฉพาะ การทดสอบประกอบด้วยปัญหาการเขียนโปรแกรมจริง 113 ข้อ ครอบคลุม 5 ภาษา แตกต่างจากการทดสอบแบบดั้งเดิมที่แก้ไขโค้ดเพียงจุดเดียว DeepSWE กำหนดให้ AI แก้ไขหลายไฟล์พร้อมกัน โดยเฉลี่ยซ่อมแซมโค้ดมากกว่า 600 บรรทัด การประเมินดำเนินการในคอนเทนเนอร์ที่แยกออกมา โดยจำกัดทรัพยากร CPU และหน่วยความจำอย่างเข้มงวด
