lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

GLM-5.2 ขึ้นอันดับหนึ่งในตาราง Fine-tuning ทำให้เกิดข้อกังขา ผู้เขียนเกณฑ์มาตรฐานชี้แจง: ไม่ได้กลั่นกรองจาก Claude

ตามการติดตามของ Beating โมเดลโอเพนซอร์ส GLM-5.2 ขึ้นอันดับหนึ่งในเกณฑ์มาตรฐานการปรับแต่งอัตโนมัติ PostTrainBench ถูกนักวิจารณ์ scaling01 วิจารณ์ว่าขาดคุณค่าในทางปฏิบัติ เขาชี้ว่าการที่โมเดลกระโดดจากอันดับ 22 ขึ้นสู่อันดับหนึ่งภายในไม่กี่เดือนนั้นผิดปกติอย่างมาก และเนื่องจากการทดสอบขาดชุดข้อมูลที่ซ่อนอยู่ จึงง่ายต่อการชักนำให้เอเจนต์ใช้การปรับแต่งตามเป้าหมายเพื่อเพิ่มคะแนน ส่งผลให้โมเดลที่ได้นั้นยากต่อการนำไปใช้ในโลกจริง

แต่ฝ่ายสนับสนุนโต้แย้งว่าภายใต้เงื่อนไขจำกัดการ์ด H100 เพียงใบเดียวและเวลา 10 ชั่วโมง การให้เอเจนต์รันการปรับแต่งทั่วไปนั้นไม่สมจริง การปรับแต่งตามเป้าหมายเป็นเรื่องปกติของการเรียนรู้ของเครื่อง บันทึกสาธารณะแสดงให้เห็นว่า GLM-5.2 มีตรรกะการทดลองที่ชัดเจน สามารถรวบรวมข้อมูลจากสมมติฐานการสุ่มตัวอย่างที่แตกต่างกันโดยอัตโนมัติ วางแผนเส้นทางสมบูรณ์ตั้งแต่การสร้างเกณฑ์ประสิทธิภาพ การปรับแต่ง ไปจนถึงการใช้การสุ่มตัวอย่างแบบปฏิเสธเพื่อกรองข้อมูล และพยายามหลีกเลี่ยงการโอเวอร์ฟิตในห่วงโซ่ความคิด

คุณค่าที่ใหญ่กว่าของเหตุการณ์นี้คือ เส้นทางการทำงานสาธารณะที่เดิมใช้ประเมินความสามารถในการปรับแต่ง ได้เปิดโปงข่าวลือในอุตสาหกรรมเกี่ยวกับโมเดลใหญ่ในประเทศที่ "กลั่นหนักจาก Claude" โดยไม่ตั้งใจ ผู้เขียนเกณฑ์มาตรฐาน Maksym Andriushchenko หลังจากตรวจสอบบันทึกของ GLM-5.2 ชี้ว่าโมเดลมีความแตกต่างโดยพื้นฐานจาก Claude ในด้านการรวบรวมข้อมูล การผสมผสานกลยุทธ์ และเส้นทางการตัดสินใจ โดยไม่มีสัญญาณของการเลียนแบบหรือการกลั่น ความโปร่งใสของเกณฑ์มาตรฐานจากบุคคลที่สามกลับกลายเป็นหน้าต่างโดยตรงที่สุดที่โมเดลโอเพนซอร์สขนาดใหญ่ใช้พิสูจน์ความสามารถในการวิจัยและพัฒนาดั้งเดิมของตนเอง

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น