BlockBeats รายงานว่า 19 กรกฎาคม SemiAnalysis หน่วยวิจัยอิสระด้านเซมิคอนดักเตอร์และ AI ระบุว่า แม้ว่า Kimi K3 จะใช้ KDA ในประมาณสามในสี่ของเลเยอร์เครือข่าย ซึ่งสามารถลดแบนด์วิดท์การถ่ายโอน KV cache ได้สูงสุดถึง 10 เท่าเมื่อเทียบกับโมเดล Attention แบบเต็มรูปแบบ แต่ก็ไม่ได้หมายความว่าขนาดตลาดสวิตช์เครือข่าย AI จะหดตัวอย่างมีนัยสำคัญ
Kimi K3 มีพารามิเตอร์ 2.8 ล้านล้านตัว แม้จะใช้ MXFP4 การคำนวณไปข้างหน้าแต่ละครั้งยังคงต้องใช้แบนด์วิดท์ HBM ประมาณ 1.5TB หากต้องการปรับใช้ให้ทำกำไรได้ในขณะที่รักษาความเร็วในการโต้ตอบที่สมเหตุสมผล ยังคงต้องเชื่อมต่อชิปจำนวนมากผ่านเครือข่ายแบนด์วิดท์สูง เช่น GB300 NVL72 และพึ่งพาบริการขยาย WideEP
WideEP จะกระจายโมเดลผู้เชี่ยวชาญ 896 ตัวไปยัง GPU หลายตัว และดำเนินการกระจาย Token และรวมผลลัพธ์สองครั้งในแต่ละเลเยอร์และในการคำนวณไปข้างหน้าแต่ละครั้ง โดยการคำนวณไปข้างหน้าหนึ่งครั้งต้องดำเนินการมากกว่า 120 ครั้ง ในทางตรงกันข้าม การถ่ายโอน KV cache ระหว่างการเติมข้อมูลล่วงหน้าและการถอดรหัสจะเกิดขึ้นเพียงครั้งเดียวต่อการสนทนา ดังนั้นแบนด์วิดท์การถ่ายโอนที่ประหยัดได้จาก KDA อาจน้อยกว่าความต้องการเครือข่ายที่ขยายตัวจากโมเดลผู้เชี่ยวชาญขนาดใหญ่มาก
SemiAnalysis เชื่อว่ากลไก Attention ที่มีประสิทธิภาพมากขึ้นอาจผลักดันให้ความยาวของบริบทเพิ่มขึ้นจาก 1 ล้าน Token เป็นมากกว่า 5 ล้าน Token ตามความขัดแย้งของ Jevons การปรับปรุงประสิทธิภาพอาจขยายขนาดการใช้งาน AI ซึ่งจะเพิ่มความต้องการเครือข่ายต่อไป
