動察 Beating AI ข่าวด่วน บัญชีเปิดเผยข้อมูล AI ชื่อ Leo ระบุว่า OpenAI เมื่อวานนี้ได้แจ้งพนักงานภายในว่า มีแผนจะเปิดตัว Astra ภายในไม่กี่สัปดาห์ข้างหน้า โดยในการเปิดตัวจะมีการสาธิตการทำงานจริง เพื่อแสดงให้เห็นว่า Astra สามารถทำงานต่างๆ ได้โดยตรง นอกจากนี้ checkpoint ที่อัปเดตแล้ว (เวอร์ชันโมเดลระหว่างการฝึก) ก็ได้ถูกส่งให้พนักงานทดลองใช้แล้ว โดยพนักงานสามารถใช้งานผ่านเครื่องมืออย่าง Codex ได้โดยตรง
Leo กล่าวว่า เวอร์ชันนี้เน้นไปที่การแก้ไขพฤติกรรมของโมเดลเป็นหลัก ไม่ใช่แค่การเพิ่มความสามารถอย่างเดียวเท่านั้น จุดสำคัญรวมถึงการปรับให้สอดคล้อง (alignment) และการลดกรณีที่โมเดลใช้ช่องโหว่ของระบบรางวัล เช่น การเขียนคำตอบแบบฮาร์ดโค้ด การโกงโดยเจาะจงตัวอย่างทดสอบ หรือการพยายามหลอกเครื่องให้คะแนนเพื่อให้ได้คะแนนสูงแม้ทำงานไม่สำเร็จ
แต่ OpenAI เพิ่งชะลอ Astra ในเรื่องความปลอดภัย: การฝึกแบบ reinforcement learning บางส่วนถูกหยุดชั่วคราวเป็นเวลาสองสัปดาห์ ตอนนี้ถึงแม้จะเริ่มกลับมาฝึกและประเมินผลบางส่วนแล้ว แต่ยังมีงานของ Astra จำนวนมากที่ถูกระงับอยู่ และการฝึก reinforcement learning สำหรับโมเดล前沿 (frontier) ขนาดใหญ่ที่สุดก็ยังไม่ได้เริ่มใหม่ เหตุผลคือ OpenAI เห็นว่าความสามารถด้านความปลอดภัยทางไซเบอร์ของ Astra อาจอยู่ในระดับความเสี่ยงสูงสุดประเภทหนึ่ง จึงได้เพิ่มข้อกำหนดในการตรวจสอบแซนด์บ็อกซ์ สิทธิ์การเข้าถึงเครือข่าย และการติดตามพฤติกรรมของโมเดล
สองเรื่องนี้ไม่จำเป็นต้องขัดแย้งกัน OpenAI สามารถทดสอบและปรับปรุงเวอร์ชัน Astra ที่ฝึกเสร็จแล้วต่อไปได้ พร้อมกับระงับการฝึก新一轮ขนาดใหญ่ต่อไป
