動察 Beating AI ข่าวด่วน Scale AI เปิดตัว RSI Bench เพื่อทดสอบว่า AI สามารถทำการวิจัยและพัฒนา AI ได้ด้วยตัวเองเหมือนนักวิจัยหรือไม่
AI จะได้รับบทความวิจัย โค้ด และพลังประมวลผลโดยตรง จากนั้นต้องคิดการทดลองเอง ฝึกโมเดล ปรับปรุงวิธีการ และดูว่าสามารถทำให้ AI เดิมดีขึ้นได้หรือไม่
การทดสอบรอบแรกใช้ Claude Opus 5 และ GPT-5.6 Sol โมเดลทั้งสองสามารถรันการทดลอง ปรับพารามิเตอร์ และวนซ้ำแนวทางได้ด้วยตัวเองแล้ว โดยบางงานสามารถทำได้ดีกว่าเกณฑ์พื้นฐานที่กำหนด
แต่ AI ในปัจจุบันยังไม่เก่งเรื่อง "การคิดค้น" เมื่อให้ท้าทายงานวิจัยล่าสุด ความพยายามส่วนใหญ่ยังจำกัดอยู่แค่วิธีการที่มีในบทความและการปรับพารามิเตอร์ โดยแทบไม่มีการเสนอแนวคิดใหม่ที่แท้จริง
