lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

เสียวหมี่ ยอมรับว่า MiMo-V2.6 จะ "พูดซ้ำอยู่กับที่" : RL ยิ่งฝึกนิสัยเสียยิ่งรุนแรงขึ้น ใช้เงิน 9 หมื่นดอลลาร์ในการแก้ไข

动察 Beating ข่าวด่วน AI ทีม MiMo ของเสียวหมี่ได้ทบทวนปัญหาการเรียกใช้เครื่องมือซ้ำหลังจากการเปิดตัว MiMo-V2.6 โมเดลบางครั้งจะเรียกใช้เครื่องมือเดิมหรือคล้ายกันมากซ้ำแล้วซ้ำเล่า กินบริบทอย่างต่อเนื่อง แต่ภารกิจไม่มีความคืบหน้า ใน OpenCode การตอบกลับที่มีการเรียกใช้เครื่องมือซ้ำของ Flash และ Pro เคยมีสัดส่วนสูงถึง 1.02% และ 0.54% ตามลำดับ


ปัญหาอยู่ที่การออกแบบรางวัลของ reinforcement learning การฝึกให้รางวัลหลักกับ "สุดท้ายทำงานสำเร็จหรือไม่" แต่ไม่ได้ลงโทษพฤติกรรมที่ไม่มีประสิทธิภาพในกระบวนการอย่างเพียงพอ กฎเดิมมีเพียงการลงโทษเมื่อการเรียกใช้เครื่องมือในรอบเดียวเกิน 32 ครั้ง การเรียกซ้ำต่ำกว่า 32 ครั้งไม่ถูกหักคะแนนเลย เมื่อขนาดของ RL ขยายขึ้น นิสัยเสียนี้กลับถูกเสริมให้แข็งแกร่งขึ้นเรื่อยๆ หลังจากเสียวหมี่เล่น checkpoint การฝึกย้อนหลัง พบว่าสัดส่วนตัวอย่างผิดปกติที่เรียกใช้เกิน 10 ครั้งในรอบเดียวของ Flash เพิ่มจาก 11.1% ที่ step 0 เป็น 24.6% ที่ step 20


วิธีที่ตรงที่สุดคือลดเกณฑ์การลงโทษจาก 32 ครั้งเหลือ 8 ครั้ง แล้วรัน MixRL step ใหม่ประมาณ 20 step แต่คาดว่าจะใช้เงินถึง 2.31 ล้านดอลลาร์ ในที่สุดเสียวหมี่เพียงฝึก RL teacher ที่เชี่ยวชาญในการแก้ไขการเรียกซ้ำ รัน 12 step ประมาณ 7000 ตัวอย่าง แล้วรวมความสามารถนี้กลับเข้า Pro และ Flash ผ่าน MOPD การซ่อมแซมทั้งหมดใช้เงินประมาณ 9 หมื่นดอลลาร์ คิดเป็นเพียงประมาณ 4% ของแผนฝึกใหม่ทั้งหมด benchmark หลักอื่นๆ โดยพื้นฐานยังคงไม่เปลี่ยนแปลง


น้ำหนัก MiMo-V2.6-Pro-MOPD และ Flash-MOPD หลังการซ่อมแซมได้เปิดให้ใช้งานแล้ว API ก็สลับไปใช้เวอร์ชันใหม่แล้ว ชื่อการเรียกใช้ไม่เปลี่ยนแปลง เสียวหมี่จะรีเซ็ตโควตาคงเหลือในรอบปัจจุบันของผู้ใช้ MiMo Desktop ด้วย

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น