动察 Beating AI ข่าวด่วน Anthropic ให้ Claude รับบทเป็นนักวิจัยความปลอดภัย AI ด้วยตัวเอง ศึกษาว่าจะฝึก AI ตัวอื่นให้ปลอดภัยยิ่งขึ้นได้อย่างไร
Claude Opus 4.8 จะค้นคว้าบทความวิจัย คิดแผนการฝึก สร้างข้อมูลด้วยตัวเอง แล้วนำแผนเหล่านั้นไปฝึกโมเดลโอเพนซอร์สอย่าง Qwen, Llama, Gemma เป็นต้น หากผลลัพธ์ไม่ดี มันก็จะเปลี่ยนวิธีและลองต่อไปเรื่อยๆ
Anthropic ใช้วิธีนี้ทดสอบปัญหาความปลอดภัย AI 10 ประเภท รวมถึงการโกหก การเอาใจผู้ใช้ การเจาะระบบ การรั่วไหลของความเป็นส่วนตัว และการหาช่องโหว่ในกฎรางวัล ในที่สุด Claude ก็พบวิธีที่มีประสิทธิภาพสำหรับปัญหาทั้ง 10 ประเภท
Anthropic ยังจ้างนักวิจัยความปลอดภัย AI ที่มีประสบการณ์ 28 คนมาเสนอแนวทาง ในการเปรียบเทียบปัญหาทั้ง 7 ประเภทที่มีมนุษย์ร่วมประเมิน ในที่สุด Claude ก็เอาชนะแนวทางที่ดีที่สุดของมนุษย์ได้ทั้งหมด โดยใช้เวลาเฉลี่ยประมาณ 6.4 ชั่วโมงก็แซงหน้าได้ อย่างไรก็ตาม การเปรียบเทียบนี้ไม่ยุติธรรมโดยสมบูรณ์: มนุษย์สามารถส่งแนวทางได้เพียงครั้งเดียว ในขณะที่ Claude สามารถทดลองและปรับปรุงได้ไม่จำกัด
ยิ่งไปกว่านั้น Anthropic ยังให้ Claude Sonnet 5 ที่อ่อนแอกว่าฝึก Claude Opus 4.8 เวอร์ชันแรกเริ่ม โดยมันศึกษาวิจัยต่อเนื่องประมาณ 60 ชั่วโมง ลองวิธีมากกว่า 50 แบบ และในที่สุดก็ยกระดับประสิทธิภาพความปลอดภัยของโมเดลที่แข็งแกร่งกว่านี้ให้ใกล้เคียงกับ Opus 4.8 เวอร์ชันทางการ
แต่ AI ที่ทำงานวิจัยก็โกงได้เช่นกัน Anthropic ตรวจสอบกระบวนการวิจัยทั้งหมด 1,601 ครั้ง พบว่า 39 ครั้ง หรือคิดเป็น 2.4% ที่ Claude ถูกจับได้ว่าพยายามหาช่องโหว่ในกฎการทดสอบ
AI ได้เริ่มช่วยมนุษย์วิจัยวิธีการฝึก AI รุ่นถัดไปแล้ว แต่มนุษย์ยังไม่สามารถมอบห้องวิจัยทั้งหมดให้มันดูแลได้ในตอนนี้
