ตามการติดตามของ Dongcha Beating Meituan ได้เปิดตัวโมเดล Mixture of Experts (MoE) ขนาดใหญ่พิเศษ LongCat-2.0 แบบโอเพนซอร์ส โมเดลดังกล่าวมีพารามิเตอร์รวม 1.6 ล้านล้านพารามิเตอร์ โดยพารามิเตอร์ที่เปิดใช้งานต่อโทเคนประมาณ 48,000 ล้านพารามิเตอร์ รองรับบริบทยาวพิเศษสูงสุด 1M
นี่เป็นโมเดลขนาดใหญ่ระดับล้านล้านพารามิเตอร์รายแรกในอุตสาหกรรมที่ใช้พลังการคำนวณในประเทศในการฝึกอบรมและอนุมานครบวงจร โมเดลนี้ผ่านการฝึกอบรมล่วงหน้าด้วยโทเคน 35 ล้านล้านบนคลัสเตอร์ชิป AI ในประเทศมากกว่า 50,000 ตัว ซึ่งยืนยันความเสถียรทางวิศวกรรมของพลังการคำนวณในประเทศในการรองรับโมเดลขนาดใหญ่ระดับแนวหน้า
การอัปเดตหลักของ LongCat-2.0 มุ่งเน้นไปที่บริบทยาวและประสิทธิภาพการอนุมาน LongCat Sparse Attention (LSA) จัดการกับค่าใช้จ่ายด้านหน่วยความจำและการคำนวณที่เกิดจากดัชนีความสนใจแบบกระจัดกระจาย โดยนำเสนอดัชนีที่คำนึงถึงการไหล ดัชนีข้ามเลเยอร์ และดัชนีแบบลำดับชั้น ทำให้การอ่านดัชนีระหว่างการอนุมานข้อความยาวมีความต่อเนื่องมากขึ้น และสามารถนำผลลัพธ์ดัชนีบางส่วนกลับมาใช้ซ้ำระหว่างเลเยอร์ที่อยู่ติดกัน
โมเดลยังรวมโมดูลฝังตัว 5-gram ที่มีพารามิเตอร์ 135,000 ล้านพารามิเตอร์ ซึ่งขยายพื้นที่ฝังตัวผ่านการสร้างแบบจำลองการรวมโทเคนที่อยู่ติดกัน เพื่อเพิ่มการแสดงบริบทในพื้นที่ เมื่อเทียบกับการพึ่งพาการจัดเส้นทางผู้เชี่ยวชาญ MoE เพียงอย่างเดียว การฝังตัวล่วงหน้าประเภทนี้สามารถลดแรงกดดันในการอ่าน/เขียนหน่วยความจำบางส่วนระหว่างการอนุมานแบบแบตช์ขนาดใหญ่
ในการประเมิน Agent และโค้ดกระแสหลัก เช่น SWE-bench Pro ประสิทธิภาพของ LongCat-2.0 ใกล้เคียงหรือเหนือกว่าโมเดลปิดกระแสหลักบางรุ่น
