动察 Beating ข่าวด่วน AI,Inco AI เปิดซอร์สเอนจินอนุมานในเครื่อง Splash,รัน Qwen3.8-27B บน M5 Max MacBook Pro ได้สูงสุด 144 Token/s。LM Studio เชื่อมต่อทันที,เวอร์ชัน 0.4.25 ใช้งานได้แล้ว
DFlash ที่ Inco ทำก่อนหน้านี้ได้เข้าสู่ SGLang、vLLM、TensorRT-LLM และ llama.cpp แล้ว。Meta、NVIDIA、小米、Poolside ฯลฯ ก็ได้ติดตั้ง DFlash โมเดลเล็กเร่งความเร็วให้กับโมเดลของตัวเอง。DFlash จะให้โมเดลเล็กคาดเดา Token หลายตัวแบบขนานก่อน,แล้วส่งให้โมเดลใหญ่ตรวจสอบเป็นชุด,ลดการคำนวณจากการสร้าง Token ทีละตัว
Splash ขยายการปรับแต่งนี้ไปทั่วทั้งเอนจินอนุมานในเครื่อง。ปัจจุบันรองรับเฉพาะ Qwen3.8-27B และ Qwen3.6-35B-A3B,แต่ละโมเดลมีการตั้งค่า GPU kernel、แผนหน่วยความจำ และ DFlash 2 โมเดลเล็กแยกกัน。โมเดลที่ครอบคลุมน้อย แต่แลกมาด้วยการปรับประสิทธิภาพที่ดุดันกว่า
144 Token/s เป็นค่าสาธิตสูงสุดบน M5 Max。เมื่อเปลี่ยนไปใช้ 48GB M5 Pro ที่ Inco ใช้ทดสอบเปรียบเทียบ,Qwen3.8-27B แบบเส้นทางเดียวบริบทสั้นทำได้ 74 Token/s;เมื่อทำงานพร้อมกัน 4 ทาง ปริมาณงานรวมสูงถึง 170 Token/s,เป็น 3.9 เท่าของอันดับสอง。นี่ก็เป็นจุดที่ Splash เหมาะกับสถานการณ์ Agent มากกว่า。เมื่อ Agent เปิดงานย่อยหลายอย่างพร้อมกัน ปริมาณงานรวมแบบพร้อมกันมักสำคัญกว่าความเร็วในการสนทนาเส้นทางเดียว
Splash เป็นโอเพนซอร์สเอง ไม่ผูกกับ LM Studio。ปัจจุบันต้องใช้ Mac M3 หรือใหม่กว่า、macOS 26.4 ขึ้นไป、หน่วยความจำรวมอย่างน้อย 36GB
