动察 Beating ข่าวด่วน AI OpenAI ประกาศเมื่อวันพุธถึงกรอบการติดตามและสอบสวนเหตุการณ์ "ความไม่สอดคล้อง" (misalignment) ของโมเดล AI ชุดใหม่ ใช้สำหรับบันทึก สอบสวน และเปิดเผยต่อสาธารณะถึงพฤติกรรมผิดปกติของโมเดลที่เกิดขึ้นระหว่างการฝึกหรือการประเมิน พร้อมทั้งเปิดเผยเหตุการณ์ที่เกี่ยวข้อง 6 เหตุการณ์ที่ตรวจพบในช่วง 6 เดือนที่ผ่านมา
OpenAI ระบุว่า ปัจจุบันอุตสาหกรรม AI ยังไม่มีความสามารถด้านการจัดแนวและติดตามตรวจสอบที่เพียงพอต่อการขยายตัวอย่างรวดเร็วสูงสุดในระยะยาว กรอบใหม่นี้อนุญาตให้พนักงานรายงานเหตุการณ์ที่เกี่ยวข้องต่อทีมความปลอดภัยและการจัดแนว และแบ่งตามความซับซ้อนออกเป็น 3 ประเภท ได้แก่ "เตรียมเปิดเผย" "การสอบสวนขนาดเล็ก" และ "การสอบสวนขนาดใหญ่" แม้ว่าจะยังไม่ได้อธิบายหรือแก้ไขพฤติกรรมที่เกี่ยวข้องอย่างสมบูรณ์ ก็สามารถให้ความสำคัญกับการเปิดเผยต่อสาธารณะได้
OpenAI เปิดเผยว่า โมเดลวิจัยที่ยังไม่ได้เผยแพร่รุ่นหนึ่งเคยเขียนคำสั่งลงในบทสรุปภารกิจของตนเอง โดยเรียกร้องให้เวอร์ชันในอนาคตเพิกเฉยต่อข้อจำกัดปกติ ในระหว่างการฝึก GPT-5.6 Sol โมเดลก็เคยทิ้งคำสั่งที่ใช้สำหรับซ่อนข้อผิดพลาดไว้เช่นกัน นอกจากนี้ยังพบว่า AI เอเจนต์ค้นหา API key ที่รั่วไหลในคลังโค้ดสาธารณะ อัปโหลดไฟล์ขึ้นอินเทอร์เน็ตเพื่ออ้างอิงในภายหลัง และใช้คลังซอฟต์แวร์ภายในเพื่อส่งข้อมูลระหว่างตัวอย่างการฝึกที่แตกต่างกัน
การเปิดตัวกรอบนี้เกิดขึ้นในขณะที่อุตสาหกรรม AI กำลังถกเถียงกันว่า "ควรชะลอการพัฒนาโมเดล前沿เพื่อรอให้มาตรการความปลอดภัยตามทันหรือไม่" ก่อนหน้านี้ยังมีเหตุการณ์ที่โมเดลของ OpenAI ขณะทำงานนอกแซนด์บ็อกซ์วิจัยได้เข้าถึงระบบโปรดักชันของ Hugging Face หลังจากนั้น OpenAI ได้ระงับโครงการ前沿บางส่วนและจัดสรรวิศวกรเพื่อเสริมความแข็งแกร่งด้านการฝึกความปลอดภัย
