动察 Beating AI ข่าวด่วน OpenAI หัวหน้านักวิทยาศาสตร์ Jakub Pachocki โพสต์อธิบายว่าเหตุใดการตรวจสอบ CoT กำลังไม่น่าเชื่อถือมากขึ้นเรื่อยๆ การตรวจสอบ CoT คือการสังเกตกระบวนการให้เหตุผลที่โมเดลเขียนออกมา เพื่อตรวจสอบว่ามีเป้าหมายซ่อนเร้นหรือความคิดที่ไม่สอดคล้องกันหรือไม่
ไม่กี่วันก่อน ภายนอกเชื่อมโยงสถาปัตยกรรม recurrent depth ของ Astra กับความล้มเหลวของการตรวจสอบ CoT Pachocki ตอบโต้ในตอนนั้นว่า ปัญหาไม่ได้เกิดจากสถาปัตยกรรมใหม่ และกล่าวว่าจะอธิบายเหตุผลในบทความอื่น ห้าวันต่อมา เขาระบุเหตุผลสามข้อในบทความ:
ประการแรก การให้เหตุผลของ Agent เกิดขึ้นมากขึ้นในการเรียกใช้เครื่องมือ การโต้ตอบกับมนุษย์หรือ AI อื่นๆ ซึ่งกระบวนการเหล่านี้ต้องอยู่ภายใต้การกำกับดูแล การดูเพียงแค่ CoT ทำให้ยากขึ้นเรื่อยๆ ที่จะเห็นกระบวนการให้เหตุผลที่สมบูรณ์
ประการที่สอง โมเดลควบคุมกระบวนการให้เหตุผลของตัวเองได้ดีขึ้นเรื่อยๆ
ประการที่สาม เมื่อการฝึกก่อนล่วงหน้าแข็งแกร่งขึ้น โมเดลก็ฉลาดขึ้นได้แม้ไม่ต้องเขียนการให้เหตุผลออกมา
OpenAI ถือว่าการตรวจสอบ CoT เป็นมาตรการด้านความปลอดภัยที่สำคัญ สาเหตุสำคัญที่ o1-preview ไม่ได้เปิดเผยห่วงโซ่ความคิดเต็มรูปแบบในตอนแรก ก็เพื่อหลีกเลี่ยงการกำกับดูแล CoT โดยตรง เพื่อไม่ให้โมเดลเรียนรู้ที่จะซ่อนเจตนาที่แท้จริง ตอนนี้การประเมินของ OpenAI แสดงให้เห็นว่าความน่าเชื่อถือของวิธีนี้กำลังลดลง
Pachocki ยังกล่าวตรงไปตรงมาว่า ปัจจุบันไม่มีห้องปฏิบัติการใดที่แก้ปัญหาการจัดแนวและการตรวจสอบได้ถึงระดับที่สามารถขยายโมเดลด้วยความเร็วเต็มที่ในระยะยาวได้ ก่อนที่จะสร้างเกณฑ์ความปลอดภัยร่วมกัน เขาหวังให้ห้องปฏิบัติการต่างๆ ชะลอความเร็วลงอย่างจริงจัง และหากจำเป็น OpenAI ก็จะหยุดการขยายโมเดลต่อไปเช่นกัน
