动察 Beating ข่าวด่วน AI ทีม MiMo ของเสียวหมี่ได้ทบทวนปัญหาการเรียกใช้เครื่องมือซ้ำหลังจากการเปิดตัว MiMo-V2.6 โมเดลบางครั้งจะเรียกใช้เครื่องมือเดิมหรือคล้ายกันมากซ้ำแล้วซ้ำเล่า กินบริบทอย่างต่อเนื่อง แต่ภารกิจไม่มีความคืบหน้า ใน OpenCode การตอบกลับที่มีการเรียกใช้เครื่องมือซ้ำของ Flash และ Pro เคยมีสัดส่วนสูงถึง 1.02% และ 0.54% ตามลำดับ
ปัญหาอยู่ที่การออกแบบรางวัลของ reinforcement learning การฝึกให้รางวัลหลักกับ "สุดท้ายทำงานสำเร็จหรือไม่" แต่ไม่ได้ลงโทษพฤติกรรมที่ไม่มีประสิทธิภาพในกระบวนการอย่างเพียงพอ กฎเดิมมีเพียงการลงโทษเมื่อการเรียกใช้เครื่องมือในรอบเดียวเกิน 32 ครั้ง การเรียกซ้ำต่ำกว่า 32 ครั้งไม่ถูกหักคะแนนเลย เมื่อขนาดของ RL ขยายขึ้น นิสัยเสียนี้กลับถูกเสริมให้แข็งแกร่งขึ้นเรื่อยๆ หลังจากเสียวหมี่เล่น checkpoint การฝึกย้อนหลัง พบว่าสัดส่วนตัวอย่างผิดปกติที่เรียกใช้เกิน 10 ครั้งในรอบเดียวของ Flash เพิ่มจาก 11.1% ที่ step 0 เป็น 24.6% ที่ step 20
วิธีที่ตรงที่สุดคือลดเกณฑ์การลงโทษจาก 32 ครั้งเหลือ 8 ครั้ง แล้วรัน MixRL step ใหม่ประมาณ 20 step แต่คาดว่าจะใช้เงินถึง 2.31 ล้านดอลลาร์ ในที่สุดเสียวหมี่เพียงฝึก RL teacher ที่เชี่ยวชาญในการแก้ไขการเรียกซ้ำ รัน 12 step ประมาณ 7000 ตัวอย่าง แล้วรวมความสามารถนี้กลับเข้า Pro และ Flash ผ่าน MOPD การซ่อมแซมทั้งหมดใช้เงินประมาณ 9 หมื่นดอลลาร์ คิดเป็นเพียงประมาณ 4% ของแผนฝึกใหม่ทั้งหมด benchmark หลักอื่นๆ โดยพื้นฐานยังคงไม่เปลี่ยนแปลง
น้ำหนัก MiMo-V2.6-Pro-MOPD และ Flash-MOPD หลังการซ่อมแซมได้เปิดให้ใช้งานแล้ว API ก็สลับไปใช้เวอร์ชันใหม่แล้ว ชื่อการเรียกใช้ไม่เปลี่ยนแปลง เสียวหมี่จะรีเซ็ตโควตาคงเหลือในรอบปัจจุบันของผู้ใช้ MiMo Desktop ด้วย
