lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

美团เปิดตัวโมเดลใหญ่ LongCat-2.0 แบบโอเพนซอร์สเป็นครั้งแรกที่ใช้ชิปในประเทศตั้งแต่การฝึกจนถึงการอนุมาน

ตามการติดตามของ Dongcha Beating Meituan ได้เปิดตัวโมเดล Mixture of Experts (MoE) ขนาดใหญ่พิเศษ LongCat-2.0 แบบโอเพนซอร์ส โมเดลดังกล่าวมีพารามิเตอร์รวม 1.6 ล้านล้านพารามิเตอร์ โดยพารามิเตอร์ที่เปิดใช้งานต่อโทเคนประมาณ 48,000 ล้านพารามิเตอร์ รองรับบริบทยาวพิเศษสูงสุด 1M

นี่เป็นโมเดลขนาดใหญ่ระดับล้านล้านพารามิเตอร์รายแรกในอุตสาหกรรมที่ใช้พลังการคำนวณในประเทศในการฝึกอบรมและอนุมานครบวงจร โมเดลนี้ผ่านการฝึกอบรมล่วงหน้าด้วยโทเคน 35 ล้านล้านบนคลัสเตอร์ชิป AI ในประเทศมากกว่า 50,000 ตัว ซึ่งยืนยันความเสถียรทางวิศวกรรมของพลังการคำนวณในประเทศในการรองรับโมเดลขนาดใหญ่ระดับแนวหน้า

การอัปเดตหลักของ LongCat-2.0 มุ่งเน้นไปที่บริบทยาวและประสิทธิภาพการอนุมาน LongCat Sparse Attention (LSA) จัดการกับค่าใช้จ่ายด้านหน่วยความจำและการคำนวณที่เกิดจากดัชนีความสนใจแบบกระจัดกระจาย โดยนำเสนอดัชนีที่คำนึงถึงการไหล ดัชนีข้ามเลเยอร์ และดัชนีแบบลำดับชั้น ทำให้การอ่านดัชนีระหว่างการอนุมานข้อความยาวมีความต่อเนื่องมากขึ้น และสามารถนำผลลัพธ์ดัชนีบางส่วนกลับมาใช้ซ้ำระหว่างเลเยอร์ที่อยู่ติดกัน

โมเดลยังรวมโมดูลฝังตัว 5-gram ที่มีพารามิเตอร์ 135,000 ล้านพารามิเตอร์ ซึ่งขยายพื้นที่ฝังตัวผ่านการสร้างแบบจำลองการรวมโทเคนที่อยู่ติดกัน เพื่อเพิ่มการแสดงบริบทในพื้นที่ เมื่อเทียบกับการพึ่งพาการจัดเส้นทางผู้เชี่ยวชาญ MoE เพียงอย่างเดียว การฝังตัวล่วงหน้าประเภทนี้สามารถลดแรงกดดันในการอ่าน/เขียนหน่วยความจำบางส่วนระหว่างการอนุมานแบบแบตช์ขนาดใหญ่

ในการประเมิน Agent และโค้ดกระแสหลัก เช่น SWE-bench Pro ประสิทธิภาพของ LongCat-2.0 ใกล้เคียงหรือเหนือกว่าโมเดลปิดกระแสหลักบางรุ่น

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น