动察 Beating ข่าวด่วน AI ทีม MiMo ของเสียวหมี่เปิดเผยว่า MiMo-V3 รุ่นถัดไปจะใช้สถาปัตยกรรม HySparse2 โดยแก้ปัญหาหลักที่ Agent ยิ่งทำงานยิ่งมีค่าใช้จ่ายสูง Agent แต่ละครั้งส่งคำสั่งสั้น ๆ แต่กลับได้รับเนื้อหาจำนวนมากจากเว็บเพจ เทอร์มินัล และเครื่องมือ โมเดลต้องอ่านเนื้อหาใหม่เหล่านี้ให้จบก่อน ยิ่งบริบทยาวขึ้น ขั้นตอนนี้ยิ่งใช้พลังประมวลผลมากขึ้น และ KV Cache ก็กินหน่วยความจำการ์ดจอมากขึ้น
HySparse2 แบ่งโมเดลออกเป็นสองส่วนก่อน ส่วนหน้า�รับผิดชอบประมวลผลอินพุต ส่วนหลังทำการอนุมานและสร้างต่อ ข้อมูลบริบทที่ส่วนหลังต้องการสามารถสร้างจากผลลัพธ์ที่ส่วนหน้าคำนวณไว้แล้ว ดังนั้น prefill จึงไม่ต้องรันส่วนหลังทั้งหมดอีก แนวคิดนี้มาจาก YOCO ที่ Microsoft Research เสนอในปี 2024 ชื่อหมายถึง "You Only Cache Once" แกนหลักคือให้ส่วนหลังแชร์ข้อมูลที่คำนวณไว้ข้างหน้า เก็บแคชน้อยลง และลดการคำนวณซ้ำ
นอกจากนี้ยังออกแบบ sparse attention ใหม่ โดย attention แบบเต็มทั่วไปต้องดูบริบททั้งหมดทุกครั้ง แต่ HySparse2 ให้เพียงไม่กี่เลเยอร์ทำเช่นนั้น เลเยอร์เหล่านี้เลือก 1024 token ที่เกี่ยวข้องที่สุดจากบริบทยาวก่อน เลเยอร์ถัดไปใช้ผลลัพธ์ชุดนี้ต่อ พร้อมเก็บ 128 token ล่าสุดไว้คงที่ HySparse รุ่นก่อนหน้าจัดกลุ่มทุก 64 token แล้วค่อยเลือก หากมีข้อมูลสำคัญในกลุ่มใด ต้องเก็บทั้งกลุ่ม ตอนนี้เปลี่ยนเป็นเลือกทีละ token ด้วยพลังประมวลผลเท่าเดิมสามารถเก็บเนื้อหาที่เกี่ยวข้องจริง ๆ ได้มากขึ้น หลังทดสอบการเปลี่ยนแปลงนี้แยกกัน ผลคะแนนการค้นคืนข้อความยาวสองรายการเพิ่มขึ้น 6.57 คะแนนและ 8.14 คะแนนตามลำดับ
บทความใช้โมเดลที่มีพารามิเตอร์รวม 8 หมื่นล้าน เปิดใช้งานประมาณ 3 พันล้านพารามิเตอร์ต่อครั้งเป็นกลุ่มควบคุม โมเดล 49 เลเยอร์ในขั้นตอน prefill ต้องรันเพียง 25 เลเยอร์แรก เมื่ออินพุตถึง 1 ล้าน token เมื่อเทียบกับ hybrid sliding window attention ที่ใช้ในซีรีส์ MiMo-V2 พลังประมวลผล prefill ลดลงเหลือประมาณ 1/5 และ KV Cache ลดจาก 12.09GB เหลือ 2.69GB
