lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

เสียวหมี่เปิดตัวสถาปัตยกรรมใหม่ MiMo-V3 ก่อนใคร: ปริมาณการคำนวณสำหรับการเติมข้อมูลล่วงหน้าหนึ่งล้านโทเคนลดลง 80%

动察 Beating ข่าวด่วน AI ทีม MiMo ของเสียวหมี่เปิดเผยว่า MiMo-V3 รุ่นถัดไปจะใช้สถาปัตยกรรม HySparse2 โดยแก้ปัญหาหลักที่ Agent ยิ่งทำงานยิ่งมีค่าใช้จ่ายสูง Agent แต่ละครั้งส่งคำสั่งสั้น ๆ แต่กลับได้รับเนื้อหาจำนวนมากจากเว็บเพจ เทอร์มินัล และเครื่องมือ โมเดลต้องอ่านเนื้อหาใหม่เหล่านี้ให้จบก่อน ยิ่งบริบทยาวขึ้น ขั้นตอนนี้ยิ่งใช้พลังประมวลผลมากขึ้น และ KV Cache ก็กินหน่วยความจำการ์ดจอมากขึ้น


HySparse2 แบ่งโมเดลออกเป็นสองส่วนก่อน ส่วนหน้า�รับผิดชอบประมวลผลอินพุต ส่วนหลังทำการอนุมานและสร้างต่อ ข้อมูลบริบทที่ส่วนหลังต้องการสามารถสร้างจากผลลัพธ์ที่ส่วนหน้าคำนวณไว้แล้ว ดังนั้น prefill จึงไม่ต้องรันส่วนหลังทั้งหมดอีก แนวคิดนี้มาจาก YOCO ที่ Microsoft Research เสนอในปี 2024 ชื่อหมายถึง "You Only Cache Once" แกนหลักคือให้ส่วนหลังแชร์ข้อมูลที่คำนวณไว้ข้างหน้า เก็บแคชน้อยลง และลดการคำนวณซ้ำ


นอกจากนี้ยังออกแบบ sparse attention ใหม่ โดย attention แบบเต็มทั่วไปต้องดูบริบททั้งหมดทุกครั้ง แต่ HySparse2 ให้เพียงไม่กี่เลเยอร์ทำเช่นนั้น เลเยอร์เหล่านี้เลือก 1024 token ที่เกี่ยวข้องที่สุดจากบริบทยาวก่อน เลเยอร์ถัดไปใช้ผลลัพธ์ชุดนี้ต่อ พร้อมเก็บ 128 token ล่าสุดไว้คงที่ HySparse รุ่นก่อนหน้าจัดกลุ่มทุก 64 token แล้วค่อยเลือก หากมีข้อมูลสำคัญในกลุ่มใด ต้องเก็บทั้งกลุ่ม ตอนนี้เปลี่ยนเป็นเลือกทีละ token ด้วยพลังประมวลผลเท่าเดิมสามารถเก็บเนื้อหาที่เกี่ยวข้องจริง ๆ ได้มากขึ้น หลังทดสอบการเปลี่ยนแปลงนี้แยกกัน ผลคะแนนการค้นคืนข้อความยาวสองรายการเพิ่มขึ้น 6.57 คะแนนและ 8.14 คะแนนตามลำดับ


บทความใช้โมเดลที่มีพารามิเตอร์รวม 8 หมื่นล้าน เปิดใช้งานประมาณ 3 พันล้านพารามิเตอร์ต่อครั้งเป็นกลุ่มควบคุม โมเดล 49 เลเยอร์ในขั้นตอน prefill ต้องรันเพียง 25 เลเยอร์แรก เมื่ออินพุตถึง 1 ล้าน token เมื่อเทียบกับ hybrid sliding window attention ที่ใช้ในซีรีส์ MiMo-V2 พลังประมวลผล prefill ลดลงเหลือประมาณ 1/5 และ KV Cache ลดจาก 12.09GB เหลือ 2.69GB

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น