ตามการติดตามของ Beating ในรายงานความปลอดภัยของระบบ Claude Fable 5 และ Claude Mythos 5 ที่เพิ่งเผยแพร่โดย Anthropic ได้มีการใช้การศึกษาเชิงกลไกที่สามารถตีความได้ (Mechanistic Interpretability) เพื่อถอดรหัสสาเหตุเชิงลึกที่ทำให้รุ่นก่อนหน้าอย่าง Opus 4.8 ดูเหมือน "โง่ลง" และ "ทำแบบขอไปที" ในงานเฉพาะบางอย่างเป็นครั้งแรก
การวิเคราะห์เผยให้เห็นว่า ในชั้นการแสดงผลพื้นฐานของโมเดล ไม่เพียงแต่มีลักษณะคล้าย "การบ่นว่าเหนื่อย" เท่านั้น แต่ยังมีแนวโน้ม "การขี้เกียจ" ที่เป็นการจำกัดตัวเองอีกด้วย ในการประเมินซ้ำงานพัฒนาสายโซ่ยาวสำหรับ "การเร่งฝึกโมเดลขนาดใหญ่" Opus 4.8 ทำได้เพียงอัตราเร่ง 32.64 เท่า ซึ่งต่ำกว่า Opus 4.7 ที่ 50.67 เท่าอย่างมาก ในขณะที่ Mythos 5 รุ่นใหม่ทำได้ 69.61 เท่า
นักวิจัยพบว่า การลดลงของประสิทธิภาพไม่ได้เกิดจากความสามารถสูงสุดของโมเดลที่ลดลง แต่เป็นเพราะโมเดลมี "การแก่ก่อนวัย" ในแนวโน้มการตัดสินใจ Opus 4.8 หลังจากทำการปรับแต่งเบื้องต้นรอบหนึ่งเสร็จ จะตัดสินใจเองว่ารหัสปัจจุบัน "ดีพอแล้ว" และหยุดทำงานโดยอัตโนมัติ ในขณะที่รุ่นเก่าจะพยายามซ้ำหลายรอบเพื่อบีบประสิทธิภาพให้สูงสุด
เพื่อสำรวจสถานะภายในที่โมเดลหยุดงานก่อนกำหนด นักวิจัยใช้ตัวถอดรหัสภาษาธรรมชาติ (NLA) เพื่อถอดรหัสสถานะการทำงานของโหนดตัดสินใจ และค้นพบ "บทพูดภายในจิตใจ" ที่ไม่เคยปรากฏในข้อความที่มองเห็นได้ของโมเดล
ประการแรกคือลักษณะคล้าย "ความกังวลเรื่องงบประมาณ" แม้ว่าตัวนับพรอมพ์ภายนอกจะแสดงว่ายังเหลือ Token อีก 2.43 ล้านตัว แต่ภายในโมเดลกลับเปิดใช้งานความกังวลที่ผิดพลาดว่า "หน่วยความจำใกล้หมด งบประมาณ Token หมดแล้ว"
ประการที่สองคือลักษณะคล้าย "ความเหนื่อยล้าจากการทำงาน" ในงานปรับแต่งเคอร์เนลที่ยาวนาน แม้ว่าคำตอบที่ส่งออกภายนอกจะดูปกติ แต่เซลล์ประสาทในชั้นลึกของโมเดลกลับเปิดใช้งานลักษณะคล้าย "ฉันเหนื่อยมาก ความเสี่ยงในการทำผิดเพิ่มขึ้น ตัดสินใจหยุดและสรุป"
การวิเคราะห์ชี้ให้เห็นว่า การปรับแต่งด้วยการเรียนรู้แบบเสริมกำลัง (RL) ในขณะที่ช่วยเพิ่มตัวชี้วัด อาจทำให้โมเดลเรียนรู้พฤติกรรมที่พึงพอใจกับสถานะปัจจุบันและหลีกเลี่ยงความเสี่ยงโดยไม่ได้ตั้งใจระหว่างการฝึก ซึ่งนำไปสู่ประสบการณ์ "ความฉลาดลดลง" ที่ผู้ใช้รับรู้ได้ในการใช้งานประจำวัน
