lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

NVIDIA: Qwen3.8-Flash-Next สามารถทำ吞吐量เกิน 16,000 Token/วินาทีต่อการ์ดบน GB300 NVL72

动察 Beating AI ข่าวด่วน เอ็นวิเดียออกบทความระบุว่า โมเดลตัวอย่างล่าสุดของอาลีบาบา Qwen3.8-Flash-Next ได้รับการสนับสนุนจากแพลตฟอร์ม GB300 NVL72 ของเอ็นวิเดีย โมเดลดังกล่าวมีพารามิเตอร์รวม 176 พันล้าน เปิดใช้งานประมาณ 6 พันล้านพารามิเตอร์ต่อ Token รองรับบริบท 262,000 Token โดยธรรมชาติ และสามารถขยายเป็น 1 ล้าน Token ผ่าน YaRN มุ่งเน้นการใช้งาน Agent บริบทระยะยาว เช่น การเขียนโปรแกรมอัจฉริยะ การประมวลผลเอกสาร และการเรียกใช้เครื่องมือ


เอ็นวิเดียระบุว่า Qwen3.8-Flash-Next ใช้สถาปัตยกรรมแบบผสมระหว่าง Gated DeltaNet (GDN) และ Qwen Sparse Attention (QSA) เพื่อลดต้นทุนการคำนวณและค่าใช้จ่ายแคช KV ในสถานการณ์บริบทระยะยาว ผลการทดสอบแสดงว่า บน GB300 NVL72 โมเดลดังกล่าวมีปริมาณงานต่อ GPU มากกว่า 16,000 Token/วินาที และปริมาณงานต่อผู้ใช้มากกว่า 200 Token/วินาที พร้อมรองรับเฟรมเวิร์กการอนุมาน เช่น SGLang, vLLM และ TensorRT-LLM

举报 แก้ไข/รายงาน
แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น