动察 Beating ข่าวด่วน AI กรอบการอนุมาน/ปรับใช้โมเดลขนาดใหญ่ SGLang เพิ่ม API การตัดสินใจแบบเนทีฟ ทำให้ LLM สำเร็จรูปอย่าง Qwen3.8-27B และโมเดลหลายรูปแบบสามารถเลือก ตัดสินใจ และให้คะแนนได้โดยตรง โดยไม่ต้องแก้ไขน้ำหนักหรือปรับแต่งละเอียดใหม่ นักพัฒนาระบุสถานการณ์ปัจจุบันและคำตอบที่เป็นไปได้หลายตัว โมเดลจะส่งคืนความน่าจะเป็นของแต่ละตัวเลือกโดยตรง ไม่ต้องสร้างข้อความแล้วค่อยแยกวิเคราะห์อีกต่อไป
มันใช้ประโยชน์จาก "ความน่าจะเป็นของโทเค็นถัดไป" ที่โมเดลขนาดใหญ่คำนวณอยู่แล้ว ตัวอย่างเช่น หากตัวเลือกคือ A, B, C โมเดลแชททั่วไปจะสร้างข้อความต่อไป ส่วน SGLang จะอ่านความน่าจะเป็นที่โมเดลให้กับ A, B, C โดยตรง เพื่อดูว่าโมเดลโน้มเอียงไปทางคำตอบใด โมเดลเองไม่ได้เปลี่ยนแปลง เพียงแต่เปลี่ยนวิธีอ่านผลลัพธ์เท่านั้น
SGLang ใช้ Qwen3.8-27B สาธิตเกม 《โปเกมอน FireRed》 โมเดลตัดสินใจจากสถานะเกมแบบเรียลไทม์ว่าจะโจมตี เปลี่ยนโปเกมอน หรือรักษา โดยการตัดสินใจแต่ละครั้งใช้เวลาต่ำกว่า 100ms และสามารถผ่านสี่จตุราชาและแชมป์ได้ในครั้งเดียว Qwen3.8-27B รองรับการป้อนภาพอยู่แล้ว ดังนั้นวิธีนี้จึงสามารถจัดการการตัดสินใจแบบหลายรูปแบบได้ด้วย
SGLang ยังเพิ่มอินเทอร์เฟซ /v1/systemone ที่เข้ากันได้กับ TypeSafe SDK ที่ Jev ใช้งาน แอปพลิเคชันที่ใช้ SDK นี้อยู่แล้วสามารถเปลี่ยนที่อยู่บริการเป็นอินสแตนซ์ SGLang ของตนเองและเรียกใช้งานต่อได้ ฟีเจอร์ใหม่ได้เข้าสู่เวอร์ชัน nightly แล้ว และมีแผนจะเปิดตัวอย่างเป็นทางการพร้อมกับ v0.5.21
