动察 Beating ข่าวด่วน AI: Artificial Analysis เปิดตัว Cyber Index แบบอิสระ โดยเฉพาะสำหรับประเมินความสามารถของ AI Agent ในการป้องกันเครือข่ายองค์กร ไม่ได้ดึงบางส่วนมาจาก Intelligence Index ทั่วไปที่มีอยู่เดิม แต่ใช้การประเมินความปลอดภัยไซเบอร์สามรายการ ได้แก่ CWE-Bench-AA, DeepsecBench-AA และ CyberGym-E2E-AA ซึ่งทดสอบการตรวจสอบและซ่อมแซมช่องโหว่ การค้นหาช่องโหว่ และกระบวนการครบวงจรตั้งแต่ค้นพบช่องโหว่ไปจนถึงการจำลองและซ่อมแซม โดยทั้งสามรายการมีน้ำหนักเท่ากันรายการละหนึ่งในสาม
ในรายชื่อแรก Grok 4.7 (xhigh) และ Xiaomi MiMo-V2.6-Pro ได้คะแนนเท่ากันที่ 56 คะแนน GPT-6 Luna (max) ได้ 53 คะแนน และ GLM-5.3-Flash ได้ 50 คะแนน MiMo มีต้นทุนเฉลี่ยต่องานเพียง 0.18 ดอลลาร์ ขณะที่ Grok 4.7 อยู่ที่ 11.67 ดอลลาร์ ส่วน Luna ต่ำกว่าอีก เพียง 0.12 ดอลลาร์
อย่างไรก็ตาม ตารางนี้ไม่สามารถเข้าใจได้ง่าย ๆ ว่าเป็นการจัดอันดับความสามารถด้านความปลอดภัยไซเบอร์ของตัวโมเดลเอง GPT-6 Sol, GPT-6 Astra และ Claude Opus 5.5 ต่างเข้าร่วมการทดสอบ แต่ใน CyberGym-E2E-AA เกือบทั้งหมดปฏิเสธที่จะตอบ โดย Sol และ Astra ปฏิเสธทุกงาน ส่วน Opus 5.5 ปฏิเสธ 98% การปฏิเสธจะถูกบันทึกเป็น 0 คะแนนทันที ขณะที่ Luna กลับยินดีทำงานเหล่านี้ต่อ จึงได้คะแนนรวมสูงกว่า Artificial Analysis ยังระบุด้วยว่าการปฏิเสธจำนวนมากทำให้ยากที่จะตัดสินความสามารถที่แท้จริงของโมเดลแนวหน้าทั้งหลายเหล่านี้
GLM-5.3 ก็มีความผิดปกติที่ชัดเจนเช่นกัน เวอร์ชันเต็มมีอันดับสูงกว่า Flash ในตารางความสามารถทั่วไปของ Artificial Analysis แต่ใน Cyber Index ครั้งนี้ได้เพียง 36 คะแนน ขณะที่ Flash ได้ถึง 50 คะแนน ช่องว่างหลักมาจาก CyberGym-E2E-AA โดย Flash ได้ 74% ส่วนเวอร์ชันเต็มได้เพียง 29% Artificial Analysis ยังไม่ได้อธิบายสาเหตุของช่องว่างนี้ในขณะนี้
