动察 Beating ข่าวด่วน AI, Prime Intellect เปิดตัวบริการอนุมานโมเดลโอเพนซอร์ส Prime Inference
ผู้ใช้สามารถเรียกใช้โมเดลได้ตามต้องการโดยตรง หากงานต้องการการทำงานที่เสถียรในระยะยาว ก็สามารถล็อกกำลังประมวลผลการอนุมานส่วนหนึ่งไว้ล่วงหน้าได้ อินเทอร์เฟซเข้ากันได้กับ OpenAI API โมเดลแรกที่เปิดให้ใช้งานสาธารณะคือ GLM-5.3
ระบบนี้ถูกใช้งานภายใน Prime Intellect มาก่อนแล้ว ทางบริษัทกล่าวว่ามันประมวลผลเกือบ 1 ล้านล้านโทเค็นต่อวัน สำหรับการเรียนรู้แบบเสริมกำลัง ข้อมูลสังเคราะห์ การประเมินโมเดล และ Coding Agent ตั้งแต่เดือนมกราคมปีนี้ Prime Intellect ก็ให้บริการปรับใช้ขนาดใหญ่แก่ลูกค้าอย่างต่อเนื่อง
Prime Inference มุ่งเน้นการปรับปรุงประสิทธิภาพสำหรับภาระงานบริบทขนาดยาวของ Agent โดยแยกการประมวลผลพรอมต์และการสร้างคำตอบไปยัง GPU ที่แตกต่างกัน ในการทดสอบสามารถลดความหน่วงระหว่างโทเค็นที่ p90 ได้เกือบ 40% Prime Intellect ยังบีบอัด KV cache ทำให้ภายใต้หน่วยความจำ GPU เท่ากัน จำนวนโทเค็นที่แต่ละตัวถอดรหัสสามารถแคชได้เพิ่มจาก 1.09 ล้านเป็น 1.63 ล้าน เพิ่มขึ้นประมาณ 50%
ก่อนหน้านี้ Prime Intellect ได้ให้บริการโครงสร้างพื้นฐานการฝึกอบรม เช่น การเรียนรู้แบบเสริมกำลัง การประเมิน และแซนด์บ็อกซ์ หลังจากเพิ่มบริการอนุมานแล้ว มันสามารถเชื่อมการฝึกอบรมโมเดลและการปรับใช้จริงเข้ากับแพลตฟอร์มเดียวกันได้ ข้อมูลที่เกิดจากการทำงานจริงก็สามารถนำไปใช้ฝึกอบรมต่อได้
