lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

มีเส้นทาง RSI อีกเส้นทางหนึ่งปรากฏขึ้น: พารามิเตอร์ของโมเดลไม่เปลี่ยนแปลง เอเจนต์วิวัฒนาการอย่างต่อเนื่องด้วยความทรงจำ

动察 Beating ข่าวด่วน AI บริษัท Aether AI ซึ่งก่อตั้งโดย Huang Biwei ผู้ช่วยศาสตราจารย์จาก UCSD ผู้พัฒนาโมเดลโลกเชิงสาเหตุ ได้เปิดโอเพนซอร์ส RSIAgent


นี่คือชุดเฟรมเวิร์กการปรับปรุงตนเองแบบเรียกซ้ำที่ไม่ต้องฝึกโมเดล พารามิเตอร์ของโมเดลพื้นฐานถูกตรึงไว้ตลอดทั้งกระบวนการ Agent จะค้นหาภารกิจที่คุ้มค่าแก่การฝึกฝนด้วยตนเอง ลงมือปฏิบัติจริง ตรวจสอบผลลัพธ์ แล้วบันทึกวิธีการที่สำเร็จและบทเรียนจากความล้มเหลวลงใน Memory ระยะยาว รอบถัดไปจะใช้ประสบการณ์เหล่านี้ต่อไป ค่อยๆ เติมเต็มจุดอ่อนของความสามารถ


ระบบประกอบด้วย Agent สามตัวที่ทำงานร่วมกัน Curriculum Agent ตัดสินใจว่าจะฝึกอะไรต่อไป Actor Agent ลงมือใช้งานซอฟต์แวร์จริง Verifier Agent ตรวจสอบผลลัพธ์อย่างอิสระ การสำรวจแบ่งเป็นสองขั้นตอน: ขั้นแรกทดลองภารกิจต่างๆ อย่างกว้างขวาง จากนั้นเจาะลึกต่อในจุดที่ล้มเหลว ข้อจำกัดที่ซ่อนอยู่ และกรณีขอบ สุดท้าย Memory จะถูกแช่แข็งและนำไปใช้ดำเนินภารกิจจริงโดยตรง


บน OSWorld 2.0 หลังจากเพิ่ม RSI ชุดนี้ คะแนนเฉลี่ยบางส่วนเพิ่มขึ้นจาก 71.97% เป็น 78.98%; Agents' Last Exam เพิ่มขึ้นจาก 83.75% เป็น 84.82% อย่างไรก็ตาม นี่ไม่ใช่การเปรียบเทียบ A/B ที่เข้มงวดของการทดสอบทั้งชุด OSWorld มีเพียงครึ่งหนึ่งของภารกิจที่ใช้ผลลัพธ์ใหม่หลัง RSI จริง ส่วนภารกิจที่เหลือยังคงใช้คะแนนเดิม


มันอยู่ในทิศทางเดียวกับแนวคิดการปรับปรุงตนเองแบบ Harness อย่าง Prime Agent: น้ำหนักโมเดลไม่เปลี่ยน แต่ปรับปรุงสิ่งที่อยู่ภายนอกโมเดลอย่างต่อเนื่อง จุดเด่นของ RSIAgent คือการเน้นการปรับปรุงที่ Memory แล้วใช้การตั้งโจทย์ด้วยตนเองและการตรวจสอบอย่างอิสระ ทำให้คลังประสบการณ์ภายนอกนี้สะสม不断增加

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น