动察 Beating ข่าวด่วน AI ElevenLabs เปิดตัวโมเดลเสียงรุ่นใหม่ Eleven v4 และเวอร์ชันเรียลไทม์ Eleven v4 Turbo v4 เน้นการควบคุมอารมณ์และเสียงที่เป็นธรรมชาติมากขึ้น ส่วน Turbo มุ่งเป้าไปที่ Agent เสียงแบบเรียลไทม์ โดยมีความหน่วงในการประมวลผลมัธยฐานประมาณ 100ms
ในตารางทดสอบแบบ Blind Test TTS ล่าสุดของ Artificial Analysis ปัจจุบัน Eleven v4 อยู่อันดับ 1 ด้วย 1315 Elo Cartesia Sonic 3.6 อยู่ที่ 1275, Gemini 3.8 Flash TTS อยู่ที่ 1267, Qwen-Audio-3.0-TTS-Plus อยู่ที่ 1258 ส่วน Eleven v3 รุ่นก่อนหน้าปัจจุบันมีเพียง 1169 อยู่อันดับ 17
v3 รองรับแท็กเสียงอย่างเสียงหัวเราะและเสียงกระซิบอยู่แล้ว v4 เน้นทำให้ชุดการควบคุมนี้แม่นยำยิ่งขึ้น ผู้ใช้สามารถระบุโทนเสียง จังหวะ อารมณ์ และเอฟเฟกต์เสียงได้โดยตรง หรือจะใช้อธิบายด้วยภาษาธรรมชาติว่าประโยคหนึ่งควรพูดอย่างไรก็ได้ โมเดลยังขยายความครอบคลุมภาษาจากกว่า 70 ภาษาเป็นกว่า 90 ภาษา Instant Voice Clone ใช้ตัวอย่างเสียงเพียงประมาณ 10 วินาที และเพิ่มความสม่ำเสมอของเสียงในข้อความยาวและบทสนทนาหลายคน
ส่วน Turbo แก้ปัญหาเรื่องความเร็วในการสนทนาแบบเรียลไทม์โดยเฉพาะ เอกสารทางการระบุว่าความหน่วงในการประมวลผลมัธยฐานของ v3 Conversational อยู่ที่ประมาณ 280ms ส่วน v4 Turbo ลดลงเหลือประมาณ 100ms
