ตามการติดตามของ Beating โมเดลโอเพนซอร์ส GLM-5.2 ขึ้นอันดับหนึ่งในเกณฑ์มาตรฐานการปรับแต่งอัตโนมัติ PostTrainBench ถูกนักวิจารณ์ scaling01 วิจารณ์ว่าขาดคุณค่าในทางปฏิบัติ เขาชี้ว่าการที่โมเดลกระโดดจากอันดับ 22 ขึ้นสู่อันดับหนึ่งภายในไม่กี่เดือนนั้นผิดปกติอย่างมาก และเนื่องจากการทดสอบขาดชุดข้อมูลที่ซ่อนอยู่ จึงง่ายต่อการชักนำให้เอเจนต์ใช้การปรับแต่งตามเป้าหมายเพื่อเพิ่มคะแนน ส่งผลให้โมเดลที่ได้นั้นยากต่อการนำไปใช้ในโลกจริง
แต่ฝ่ายสนับสนุนโต้แย้งว่าภายใต้เงื่อนไขจำกัดการ์ด H100 เพียงใบเดียวและเวลา 10 ชั่วโมง การให้เอเจนต์รันการปรับแต่งทั่วไปนั้นไม่สมจริง การปรับแต่งตามเป้าหมายเป็นเรื่องปกติของการเรียนรู้ของเครื่อง บันทึกสาธารณะแสดงให้เห็นว่า GLM-5.2 มีตรรกะการทดลองที่ชัดเจน สามารถรวบรวมข้อมูลจากสมมติฐานการสุ่มตัวอย่างที่แตกต่างกันโดยอัตโนมัติ วางแผนเส้นทางสมบูรณ์ตั้งแต่การสร้างเกณฑ์ประสิทธิภาพ การปรับแต่ง ไปจนถึงการใช้การสุ่มตัวอย่างแบบปฏิเสธเพื่อกรองข้อมูล และพยายามหลีกเลี่ยงการโอเวอร์ฟิตในห่วงโซ่ความคิด
คุณค่าที่ใหญ่กว่าของเหตุการณ์นี้คือ เส้นทางการทำงานสาธารณะที่เดิมใช้ประเมินความสามารถในการปรับแต่ง ได้เปิดโปงข่าวลือในอุตสาหกรรมเกี่ยวกับโมเดลใหญ่ในประเทศที่ "กลั่นหนักจาก Claude" โดยไม่ตั้งใจ ผู้เขียนเกณฑ์มาตรฐาน Maksym Andriushchenko หลังจากตรวจสอบบันทึกของ GLM-5.2 ชี้ว่าโมเดลมีความแตกต่างโดยพื้นฐานจาก Claude ในด้านการรวบรวมข้อมูล การผสมผสานกลยุทธ์ และเส้นทางการตัดสินใจ โดยไม่มีสัญญาณของการเลียนแบบหรือการกลั่น ความโปร่งใสของเกณฑ์มาตรฐานจากบุคคลที่สามกลับกลายเป็นหน้าต่างโดยตรงที่สุดที่โมเดลโอเพนซอร์สขนาดใหญ่ใช้พิสูจน์ความสามารถในการวิจัยและพัฒนาดั้งเดิมของตนเอง
