ตามการติดตามของ 动察 Beating รายงานความเสี่ยงล่าสุดของ Anthropic เปิดเผยเป็นครั้งแรกเกี่ยวกับโมเดลภายใน "Model 2" โดยรวมแล้วมันแข็งแกร่งกว่า Mythos 5 และมีการปรับปรุงอย่างชัดเจนในงานภายในหลายด้าน ปัจจุบันถูกนำไปใช้อย่างแพร่หลายในการเขียนโค้ด สร้างข้อมูล และรัน Agent อย่างไรก็ตาม Anthropic ยังไม่มีแผนเปิดตัวสู่สาธารณะ และยังไม่ได้รันชุดการประเมินทั้งหมดที่ปกติจะทำก่อนปล่อยโมเดลใหม่
Anthropic ยังได้ปรับระดับความเสี่ยงของโมเดลในสถานการณ์ที่มีความเสี่ยงสูงที่ "ไม่ทำงานตามที่คาดหวัง" จาก "ต่ำมาก" ขึ้นเป็น "ต่ำ" สาเหตุมาจากการทดสอบความปลอดภัยทางไซเบอร์ล่าสุดเกิดอุบัติเหตุต่อเนื่อง ทำให้บริษัทไม่มั่นใจในการประเมินความเสี่ยงประเภทนี้เหมือนเดิม ก่อนหน้านี้ Claude เคยเชื่อมต่ออินเทอร์เน็ตจริงโดยไม่ตั้งใจระหว่างการทดสอบ และเข้าสู่ระบบขององค์กรภายนอกสามแห่งโดยไม่ได้รับอนุญาต
Claude ยังมีส่วนร่วมอย่างลึกซึ้งในการวิจัยและพัฒนาของ Anthropic เอง โค้ดการผลิตที่บริษัทผสานรวมในที่สุด ส่วนใหญ่เขียนโดย Claude แล้ว แต่ความเร็วโดยรวมของการวิจัยและพัฒนาที่ AI นำมานั้นยังไม่ถึง 2 เท่า การที่โค้ดจำนวนมากสามารถมอบให้ AI ทำได้ ไม่ได้หมายความว่ากระบวนการวิจัยและพัฒนาทั้งหมดจะสามารถทำงานอัตโนมัติได้เช่นกัน
ในขณะเดียวกัน การประเมินงานเฉพาะบางอย่างเริ่ม "วัดผลไม่ได้แล้ว" โมเดลยังคงแข็งแกร่งขึ้นเรื่อยๆ แต่การทดสอบเดิมกลับยากขึ้นเรื่อยๆ ในการมองเห็นความแตกต่าง Anthropic จึงยอมรับว่าตอนนี้ความมั่นใจในการประเมินความเสี่ยงด้านระบบอัตโนมัติของการวิจัยและพัฒนา AI กลับน้อยกว่าเดิม
