动察 Beating ข่าวด่วน AI บริษัท Aether AI ซึ่งก่อตั้งโดย Huang Biwei ผู้ช่วยศาสตราจารย์จาก UCSD ผู้พัฒนาโมเดลโลกเชิงสาเหตุ ได้เปิดโอเพนซอร์ส RSIAgent
นี่คือชุดเฟรมเวิร์กการปรับปรุงตนเองแบบเรียกซ้ำที่ไม่ต้องฝึกโมเดล พารามิเตอร์ของโมเดลพื้นฐานถูกตรึงไว้ตลอดทั้งกระบวนการ Agent จะค้นหาภารกิจที่คุ้มค่าแก่การฝึกฝนด้วยตนเอง ลงมือปฏิบัติจริง ตรวจสอบผลลัพธ์ แล้วบันทึกวิธีการที่สำเร็จและบทเรียนจากความล้มเหลวลงใน Memory ระยะยาว รอบถัดไปจะใช้ประสบการณ์เหล่านี้ต่อไป ค่อยๆ เติมเต็มจุดอ่อนของความสามารถ
ระบบประกอบด้วย Agent สามตัวที่ทำงานร่วมกัน Curriculum Agent ตัดสินใจว่าจะฝึกอะไรต่อไป Actor Agent ลงมือใช้งานซอฟต์แวร์จริง Verifier Agent ตรวจสอบผลลัพธ์อย่างอิสระ การสำรวจแบ่งเป็นสองขั้นตอน: ขั้นแรกทดลองภารกิจต่างๆ อย่างกว้างขวาง จากนั้นเจาะลึกต่อในจุดที่ล้มเหลว ข้อจำกัดที่ซ่อนอยู่ และกรณีขอบ สุดท้าย Memory จะถูกแช่แข็งและนำไปใช้ดำเนินภารกิจจริงโดยตรง
บน OSWorld 2.0 หลังจากเพิ่ม RSI ชุดนี้ คะแนนเฉลี่ยบางส่วนเพิ่มขึ้นจาก 71.97% เป็น 78.98%; Agents' Last Exam เพิ่มขึ้นจาก 83.75% เป็น 84.82% อย่างไรก็ตาม นี่ไม่ใช่การเปรียบเทียบ A/B ที่เข้มงวดของการทดสอบทั้งชุด OSWorld มีเพียงครึ่งหนึ่งของภารกิจที่ใช้ผลลัพธ์ใหม่หลัง RSI จริง ส่วนภารกิจที่เหลือยังคงใช้คะแนนเดิม
มันอยู่ในทิศทางเดียวกับแนวคิดการปรับปรุงตนเองแบบ Harness อย่าง Prime Agent: น้ำหนักโมเดลไม่เปลี่ยน แต่ปรับปรุงสิ่งที่อยู่ภายนอกโมเดลอย่างต่อเนื่อง จุดเด่นของ RSIAgent คือการเน้นการปรับปรุงที่ Memory แล้วใช้การตั้งโจทย์ด้วยตนเองและการตรวจสอบอย่างอิสระ ทำให้คลังประสบการณ์ภายนอกนี้สะสม不断增加
