lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

RSIGym โอเพนซอร์ส: ให้ AI วิจัยวิธีปรับปรุง AI โดยมุ่งเป้าไปที่การปรับปรุงตนเองแบบเรียกซ้ำ

动察 Beating ข่าวด่วน AI Evolvent AI ซึ่งเป็นเครื่องมือสำหรับการฝึกอบรมและประเมินผล AI ได้เปิด-source RSIGym โดยมีเป้าหมายเพื่อศึกษา Recursive Self-Improvement (RSI) ของ AI พูดง่ายๆ คือให้ AI ค้นหาจุดอ่อนของระบบด้วยตัวเอง เสนอแนวทางแก้ไข ทดสอบผลลัพธ์ แล้วลองใช้ระบบที่ปรับปรุงแล้วทำการวิจัยรอบถัดไป


RSIGym ได้ทำให้การฝึกอบรม การอนุมาน การประเมินผล และ sandbox กลายเป็นบริการสำเร็จรูป Research Agent สามารถสร้างข้อมูลการฝึกอบรม ปรับพารามิเตอร์ fine-tuning ฝึกโมเดล แล้วแก้ไขแนวทางตามผลการประเมิน นอกจากนี้ยังสามารถแก้ไข Harness ซึ่งเป็นโปรแกรมที่ควบคุมว่าโมเดลเรียกใช้เครื่องมือและดำเนินงานอย่างไร นักวิจัยสามารถให้ Agent แก้ไขเฉพาะข้อมูลการฝึกอบรม แก้ไขเฉพาะ Harness หรือปรับปรุงทั้งสองอย่างพร้อมกัน แพลตฟอร์มจัดการงบประมาณการทดลอง สิทธิ์การเข้าถึง และบันทึกการดำเนินการอย่างเป็นระบบ


ทีมยังได้เปิดตัว RSI-Index เพื่อทดสอบความสามารถของ AI Agent ในการปรับปรุงระบบ AI อีกชุดหนึ่ง Research Agent 6 ตัวเริ่มต้นจากโมเดลพื้นฐาน Qwen3.5 เดียวกันและ Harness แบบง่าย แล้วทำการปรับปรุงบนงาน 5 ประเภท เช่น การเขียนโปรแกรม คณิตศาสตร์ Opus 5 ได้อันดับหนึ่งโดยรวม ระบบที่มันปรับปรุงแล้วมีคะแนนบนชุดย่อย 100 ข้อของ SWE-bench Verified เพิ่มจาก 17.67% เป็น 50.33% ส่วนการทดสอบคณิตศาสตร์ AIME เพิ่มจาก 31.67% เป็น 97.78%


การทดลองอีกชุดหนึ่งแก้ไขเฉพาะ Harness โดยไม่แตะน้ำหนักโมเดล Opus 5 แก้ไขปัญหาจากบันทึกการดำเนินการของ DeepSeek Harness เช่น หยุดทำงานหลัง output ถูกตัดทอน และประกาศว่างานเสร็จก่อนกำหนด โดยที่น้ำหนักโมเดล Qwen3.6 ไม่เปลี่ยนแปลงเลย คะแนน Terminal-Bench 2.0 เพิ่มจาก 30.34% เป็น 40.82%


ทีมยังลองให้ Qwen3.8-27B ปรับปรุงตัวเอง โดยรับบททั้ง Research Agent และโมเดลที่ถูกปรับปรุง มันค้นพบแนวทาง fine-tuning ที่ดูเหมือนได้ผลบนข้อสอบ 6 ข้อ แต่ในข้อสอบเต็ม 37 ข้อ กลับได้คะแนนลดลงเล็กน้อยจาก 56.66% เป็น 56.26% นอกจากนี้ การทดลองแต่ละชุดทำการวิจัยเพียงครั้งเดียว และ Agent ยังสามารถเข้าถึงข้อสอบประเมินผลได้ในช่วงการพัฒนา ปัจจุบันยังไม่มีหลักฐานว่า AI ที่ปรับปรุงแล้วสามารถเพิ่มขีดความสามารถในการวิจัยและพัฒนาตัวเองต่อไปได้ เพื่อให้เกิด Recursive Self-Improvement หลายรอบ

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น