动察 Beating AI ข่าวด่วน เอ็นวิเดียออกบทความระบุว่า โมเดลตัวอย่างล่าสุดของอาลีบาบา Qwen3.8-Flash-Next ได้รับการสนับสนุนจากแพลตฟอร์ม GB300 NVL72 ของเอ็นวิเดีย โมเดลดังกล่าวมีพารามิเตอร์รวม 176 พันล้าน เปิดใช้งานประมาณ 6 พันล้านพารามิเตอร์ต่อ Token รองรับบริบท 262,000 Token โดยธรรมชาติ และสามารถขยายเป็น 1 ล้าน Token ผ่าน YaRN มุ่งเน้นการใช้งาน Agent บริบทระยะยาว เช่น การเขียนโปรแกรมอัจฉริยะ การประมวลผลเอกสาร และการเรียกใช้เครื่องมือ
เอ็นวิเดียระบุว่า Qwen3.8-Flash-Next ใช้สถาปัตยกรรมแบบผสมระหว่าง Gated DeltaNet (GDN) และ Qwen Sparse Attention (QSA) เพื่อลดต้นทุนการคำนวณและค่าใช้จ่ายแคช KV ในสถานการณ์บริบทระยะยาว ผลการทดสอบแสดงว่า บน GB300 NVL72 โมเดลดังกล่าวมีปริมาณงานต่อ GPU มากกว่า 16,000 Token/วินาที และปริมาณงานต่อผู้ใช้มากกว่า 200 Token/วินาที พร้อมรองรับเฟรมเวิร์กการอนุมาน เช่น SGLang, vLLM และ TensorRT-LLM
