ตามการตรวจสอบของโปรเจค Beating พบว่า JumpStar ได้เปิดตัว End-to-End Realtime โมเดลเสียงขนาดใหญ่ StepAudio 2.5 Realtime ที่เน้นการสนทนาที่มี "ความเป็นมนุษย์" รอบด้าน รองรับการปรับแต่งตัวละครทุกมิติและความรับรู้สำหรับภาษารอง (เสียงดั้ง เสียงหน่อย การหายใจ สัญญาณอะไรไม่ใช่ภาษา) โมเดลได้เข้าสู่ API ของแพลตฟอร์มแบบเปิดอย่างเต็มสำหรับข้อกำหนดแล้ว
ตามแบบการประเมินจากทางอย่างเป็นทางการ (การทดสอบเดือนเมษายน 2026) บริหารจัดการกับมิติทั้ง 5 (ทั้งหมด) ครองอันดับหนึ่ง รวมถึงการประเมินที่สะท้อนประสบการณ์จริง (การให้คะแนนการสนทนาของมือถือแอพพลิเคชั่น) ได้ 80.41 GPT-Realtime-1.5 ได้ 68.01 Gemini Live ได้ 67.16 การเซ็ตคำถามเสียงได้ 79.80 มากถึงเกือบ 1.5 เท่าของ GPT-Realtime-1.5 (53.20) การเข้าใจภาษารองได้ 82.18 การสนทนาทั่วไปได้ 86.36 อุปสรรค์ในรถยนต์ได้ 84.80
มี 3 ขั้นตอนสำคัญของเส้นทางเทคโนโลยี 1. ขึ้นอยู่กับตัวละครชาวพื้นเมืองมากกว่า 10,000 คำสร้างเมตริกซ์คุณลักษณะตัวละครเป็นล้านบนตั้งแต่อัลกอลิทึมหรือวิธีแบ่งออกยอดมาจากการฝึกฝนข้อมูลสนทนาจริงจำนวนมากทำให้โมเดลสามารถรักษาความมั่นคงของหัวข้อที่หายากในทวีปยาว 2. ขึ้นอยู่กับสนามเกมการแสดงบทบาทสร้าง RLHF (การเรียนรู้แข็งแรงของมนุษย์) เพื่อแก้ปัญหาโบราณที่เราได้ธนาะ "การทำล้อได้นำเสนอ 3. การเข้าใจและการสร้างการรวมเชื่อมรอยลึกนำ สืบไปตั้งแต่ StepAudio 2.5 TTS เมื่อแสดงความเช่นชอบในทัศนคติฉบับของทั้งหมดและรายละเอียดภายในประโยค
API ที่เข้ากันได้กับ OpenAI Realtime API สำญจนาพิธีการ (อยู่บน WebSocket) นักพัฒนาเดสเพลอเปลี่ยนแปลงเส้นทางอย่างต่ำ ราคา 10 บาทต่อสิบหมื่นโทเคนทันบทำการ (ข้อมูลข้ามการโหลด 2 บาท) โดยเอาไปผลลัพธ์ 70 บาทต่อสิบหมื่นโทเคนทันบทำการ ตามคำนวนจากทางอย่างเป็นทางการค่าใช้จ่ายในการสนทนาเสียงต่อเนื่อเวลาประมาณ 3.8 บาทต่อชั่วโมง
