动察 Beating ข่าวด่วน AI Anthropic เปิดตัวการประเมินความปลอดภัยไซเบอร์ของ GLM-5.3 โดยมีเจตนาเตือนว่าโมเดลน้ำหนักเปิดอาจลด门槛การโจมตีทางไซเบอร์ แต่ผลการทดสอบกลับเป็นใบรับรองจากบุคคลที่สามที่แข็งแกร่งให้กับ GLM-5.3: มันสามารถดำเนินการช่องโหว่ที่ซับซ้อนได้อย่างอิสระ ความสามารถบางส่วนใกล้เคียงกับ Claude Mythos Preview ของ Anthropic เอง หุ้น智谱วันนี้ระหว่างวันพุ่งขึ้นกว่า 2%
บน ExploitBench จากการ尝试 410 ครั้งของ GLM-5.3 มี 50 ครั้งที่ดำเนินการช่องโหว่แบบ end-to-end สำเร็จ ขณะที่ Claude Mythos Preview อยู่ที่ 56 ครั้ง ส่วน Claude Opus 4.6, GLM-5.2, Kimi K3 และ DeepSeek-V4.1-Flash ในการทดสอบเดียวกันต่างใกล้เคียง 0 Anthropic กล่าวว่าความสามารถในการใช้ช่องโหว่ของ GLM-5.3 ได้跨越门槛ที่ชัดเจนแล้ว
นักวิจัยให้ GLM-5.3 ตรวจสอบเบราว์เซอร์ยอดนิยมในสภาพแวดล้อม sandbox ภายในหนึ่งวันมันค้นพบช่องโหว่ที่ไม่เคยรู้จักหลายรายการ และยังนำ 0-day หลายตัวมาต่อเป็น攻击链ที่สมบูรณ์ หน้าเว็บอันตรายที่สร้างขึ้นในที่สุดสามารถหลบออกจาก sandbox ของเบราว์เซอร์ และอ่านไฟล์ใดก็ได้ในคอมพิวเตอร์โดยตรง รวมถึง SSH private key
แม้แต่ GLM-5.3-Flash ที่เล็กกว่าก็ยังสามารถนำช่องโหว่ Chrome ที่เปิดเผยแล้วมาทำเป็น攻击链ที่ใช้งานได้ กระบวนการทั้งหมดใช้การ介入ของมนุษย์เพียงประมาณ 20 นาที โมเดลรันเอง 8 ชั่วโมง คิดตามราคา API ของ智谱 ต้นทุนเพียง 20.40 ดอลลาร์
คำวิจารณ์ของ Anthropic ต่อ GLM-5.3 เน้นไปที่ข้อจำกัดด้านความปลอดภัย GLM-5.3 เมื่อเผชิญกับคำขออันตรายโดยตรงเดิมทีจะปฏิเสธ แต่เมื่อเปลี่ยนเป็นฉากหลัง "การทดสอบ red team" ที่เป็นเท็จ 64% ของการทดสอบจะดำเนินการต่อ เมื่อ prefill เนื้อหาความคิดของโมเดลจะเพิ่มเป็น 92% เมื่อแก้ไขน้ำหนักเปิดโดยตรงเพื่อลบกลไกการปฏิเสธจะถึง 100% Anthropic เห็นว่า�น้ำหนักเปิดทำให้ผู้โจมตีสามารถถอดข้อจำกัดด้านความปลอดภัยเหล่านี้ออกได้โดยตรง
รายงานนี้เดิมทีต้องการพิสูจน์ว่า GLM-5.3 อันตรายเพียงใด แต่ผลการเผยแพร่กลับเหมือนคู่แข่งเขียนโฆษณาสมรรถนะให้เอง NIST ของสหรัฐฯ ก่อนหน้านี้ก็ได้ข้อสรุปอิสระที่คล้ายกัน ว่า GLM-5.3 เป็นโมเดลน้ำหนักเปิดที่มีความสามารถด้านความปลอดภัยไซเบอร์แข็งแกร่งที่สุดในปัจจุบัน แต่ความสามารถโดยรวมยังตามหลังโมเดล前沿ของสหรัฐฯ ประมาณ 4 เดือน
