动察 Beating AI ข่าวด่วน Meta Superintelligence Labs เปิดตัว Muse Voice Transcribe มันรวมการแปลงเสียงพูดเป็นข้อความแบบเรียลไทม์ การแยกแยะผู้พูดที่แตกต่างกัน และการตรวจจับว่าผู้ใช้พูดจบเมื่อใด ไว้ในโมเดลเดียว สามารถประมวลผลเสียงยาวกว่า 1 ชั่วโมงได้ พร้อมแยกแยะผู้พูดมากกว่า 20 คน
ในการทดสอบการถอดเสียงแบบเรียลไทม์ภาษาอังกฤษของ Artificial Analysis ค่า WER (อัตราคำผิด ยิ่งต่ำยิ่งดี) อยู่ที่ 3.1% GPT Live Transcribe อยู่ที่ 3.9% และ Gemini 3.5 Transcribe Live อยู่ที่ 4.0% Muse Voice Transcribe สามารถให้ข้อความสุดท้ายได้ภายในประมาณ 0.16 วินาทีหลังจากผู้พูดพูดจบ
มันไม่ได้กำหนดเวลารอคงที่เท่ากันสำหรับทุกคำ โมเดลจะอ่านเสียงทุก 80 มิลลิวินาที และตัดสินใจเองว่าจะฟังต่อหรือเริ่มส่งออก คำง่ายๆ สามารถเขียนได้เร็วขึ้น ส่วนคำยากจะฟังบริบทเพิ่มอีกเล็กน้อยก่อนจึงจะยืนยัน Meta ใช้การเรียนรู้แบบเสริมกำลังเพื่อปรับความแม่นยำและความหน่วงให้เหมาะสมพร้อมกัน
โมเดลได้รับการฝึกด้วยภาษามากกว่า 70 ภาษา โดย 25 ภาษาได้รับการตรวจสอบอย่างเข้มข้นแล้ว และยังสามารถจดจำการพูดผสมจีน-อังกฤษในประโยคเดียวได้โดยตรง ปัจจุบันได้เชื่อมต่อกับ Meta AI for Mac และ Muse Code แล้ว และเปิดใช้ Meta Model API ด้วย ราคาอยู่ที่ 3 ดอลลาร์ต่อ 1,000 นาที หรือคิดเป็น 0.18 ดอลลาร์ต่อชั่วโมง
