lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

โมเดล GLM-5.2 ของ Zhipu ขึ้นอันดับหนึ่งโอเพนซอร์สบน DeepSWE: แก้ไขงานพัฒนาที่ซับซ้อนได้ 44% เอาชนะโมเดลปิดหลัก

ตามการติดตามของ Beating โมเดลโอเพนซอร์ส GLM-5.2 ของ Zhipu AI ได้เข้าสู่เกณฑ์มาตรฐานวิศวกรรมซอฟต์แวร์ระยะยาว DeepSWE อย่างเป็นทางการ ในโหมดการใช้ความคิดสูงสุด อัตราความสำเร็จครั้งเดียวสำหรับงานพัฒนาที่ซับซ้อนอยู่ที่ 44% ครองอันดับหนึ่งในบรรดาโมเดลโอเพนซอร์ส เมื่อเทียบกับ Kimi K2.7 Code ที่เข้าสู่เกณฑ์ก่อนหน้านี้ อัตราความสำเร็จสูงกว่าถึง 13 เปอร์เซ็นต์

ต้นทุนเฉลี่ยของ GLM-5.2 ในการแก้ไขแต่ละงานอยู่ที่ 3.92 ดอลลาร์สหรัฐ สูงกว่า Kimi K2.7 Code เล็กน้อยที่ 2.82 ดอลลาร์สหรัฐ แต่อัตราความสำเร็จกลับเหนือกว่าโมเดลปิดกระแสหลักหลายรุ่นภายใต้การกำหนดค่าการคิดเฉพาะ รวมถึง Claude Sonnet 4.6 [high] (30%), Gemini 3.5 Flash [medium] (37%) และ Claude Opus 4.8 [low] (41%)

เกณฑ์มาตรฐาน DeepSWE ที่ออกแบบโดย Datacurve ผู้ริเริ่มการประเมินนี้ ทดสอบความสามารถของ AI Agent ในการจัดการงานระยะยาวโดยเฉพาะ การทดสอบประกอบด้วยปัญหาการเขียนโปรแกรมจริง 113 ข้อ ครอบคลุม 5 ภาษา แตกต่างจากการทดสอบแบบดั้งเดิมที่แก้ไขโค้ดเพียงจุดเดียว DeepSWE กำหนดให้ AI แก้ไขหลายไฟล์พร้อมกัน โดยเฉลี่ยซ่อมแซมโค้ดมากกว่า 600 บรรทัด การประเมินดำเนินการในคอนเทนเนอร์ที่แยกออกมา โดยจำกัดทรัพยากร CPU และหน่วยความจำอย่างเข้มงวด

นักสืบบนบล็อกเชนเฝ้าติดตามอย่างต่อเนื่อง
แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น