动察 Beating AI ข่าวด่วน Anthropic เริ่มเพิ่ม "ล็อกบริบท" ให้กับการคิดแบบซ่อนของ Claude ข้อความที่เข้ารหัสซึ่งสร้างผ่าน API ใน Fable 5.1 ตั้งแต่นี้ไปจะต้องถูกส่งกลับมาพร้อมกับระบบพรอมต์ เครื่องมือ และประวัติข้อความที่ใช้สร้างมันในตอนนั้น หากเนื้อหาส่วนก่อนหน้าถูกแก้ไข API จะรายงานข้อผิดพลาด หรือไม่ก็ตัดการคิด那段นั้นทิ้งไป
การเปลี่ยนแปลงนี้มีจุดประสงค์เพื่อป้องกันการกลั่นโมเดล (model distillation) ก่อนหน้านี้นักวิจัยพบว่า แม้ผู้ใช้จะอ่านการคิดแบบเข้ารหัสของ Claude ไม่เข้าใจ แต่ก็สามารถนำกลับไปให้โมเดลที่เข้ากันได้ของ Anthropic อ่านได้ ผู้โจมตีสามารถให้ Opus สร้างการอนุมานคุณภาพสูงก่อน แล้วยัดบล็อกที่เข้ารหัสให้กับ Haiku ซึ่งมีการป้องกันที่อ่อนแอกว่า เพื่อล่อให้มันอ่านการคิดทั้งหมดของ Opus ออกมา เปรียบเสมือนไม่เพียงแต่ลอกคำตอบของโมเดลใหญ่ แต่ยังเอาขั้นตอนการแก้ปัญหาบนกระดาษร่างไปด้วย
Anthropic เคยปิดกั้นรอบหนึ่งแล้วเมื่อเปิดตัว Fable 5 ในเดือนมิถุนายน โดยเริ่มผูกการคิดแบบเข้ารหัสเข้ากับโมเดล ไม่สามารถนำไปให้โมเดลเล็กอย่าง Haiku ช่วยถอดรหัสได้อีกต่อไป ใน Fable 5.1 ครั้งนี้เพิ่ม "การผูกบทสนทนา" เข้ามา: แม้โมเดลจะไม่เปลี่ยน แต่ถ้าแก้พรอมต์ เครื่องมือ หรือบันทึกการสนทนาส่วนหน้า การคิดเก่าก็จะถูกยกเลิกเช่นกัน
ล็อกนี้ยังไม่ได้เปิดใช้อย่างเต็มรูปแบบ จะบังคับใช้เฉพาะเมื่อบัญชี API ที่เปิดใหม่หลังวันที่ 31 สิงหาคมเรียกใช้ Fable 5.1 เท่านั้น บัญชีเก่ายังไม่ได้รับผลกระทบชั่วคราว Claude.ai, Claude Code, Cowork และโมเดล Claude อื่นๆ ไม่รวมอยู่ในขอบเขตนี้ Anthropic กล่าวว่า โมเดลใหม่ที่จะเปิดตัวในอนาคตจะเปิดใช้กฎนี้เป็นค่าเริ่มต้นสำหรับผู้ใช้ทุกคน
