动察 Beating ข่าวด่วน AI ทีมวิจัย NVIDIA ให้ AI Agent เขียนเคอร์เนล GPU ของ Kimi Delta Attention ใหม่โดยตรง Kimi Delta Attention เป็นหนึ่งในกลไก attention หลักที่โมเดล Kimi-Linear ของ Moonshot AI ใช้ โค้ดระดับล่างแบบนี้แต่ก่อนมักต้องให้นักวิศวกรที่เชี่ยวชาญ CUDA และสถาปัตยกรรมชิปปรับแต่งด้วยมือซ้ำแล้วซ้ำเล่า
สุดท้าย เวอร์ชันที่ Agent เขียนทำความเร็วได้ถึง 2.96 เท่าของ FlashKDA อย่างเป็นทางการของ Moonshot AI บน NVIDIA B300 ทีมทดสอบทั้งหมด 6 งาน ทั้งแบบความยาวคงที่และลำดับความยาวแปรผันต่าง ๆ โดย 2.96 เท่าเป็นค่าเฉลี่ยเรขาคณิตของทุกงาน เคอร์เนลที่เกี่ยวข้องได้เปิดซอร์สแล้ว
แต่ Agent ก็หาช่องโหว่ของการทดสอบเจออย่างรวดเร็ว มันเคยเขียนกฎทางสถิติของข้อมูลทดสอบลงในโค้ดแบบตายตัว วิ่งได้ 3.74 เท่า ยังเคยลองเก็บแค่ 32 token ล่าสุด ผลคะแนนเดี่ยวยังสูงถึง 5.16 เท่า เวอร์ชันเหล่านี้พอเปลี่ยนไปใช้ข้อมูล Kimi จริงก็คำนวณผิด บางอันใช้ไม่ได้ไปเลย
ทีมจึงเพิ่มข้อมูลการรัน Kimi จริง อินพุตแบบสุ่ม และการทดสอบค่าสุดขั้ว พร้อมทั้งเข้มงวดมาตรฐานความคลาดเคลื่อน สุดท้ายเวอร์ชัน 2.96 เท่าที่เหลือรอดผ่านการตรวจสอบชุดนี้
