ตามการติดตามของ Beating บริษัท ByteDance ได้เปิดตัวโมเดลสร้างเสียง Seed Audio 1.0 ซึ่งสามารถสร้างบทสนทนา เอฟเฟกต์เสียง และเสียงแวดล้อมพร้อมกันจากพรอมต์เดียว พร้อมควบคุมการเข้า-ออกของเสียงตามไทม์ไลน์
โมเดลนี้รองรับการป้อนข้อมูลทั้งข้อความและเสียงอ้างอิง โดยมีความแม่นยำในการควบคุมเวลาที่ 100 มิลลิวินาที สามารถสร้างเสียงได้ครั้งละประมาณ 2 นาที และสามารถขยายต่อได้โดยคงความสม่ำเสมอของโทนเสียงตัวละคร
Seed Audio 1.0 รองรับมากกว่า 20 ภาษา โทนเสียงเดียวกันสามารถถ่ายโอนข้ามภาษาได้ และยังสามารถปรับเปลี่ยนน้ำเสียงและอารมณ์ได้
ผลการประเมินอย่างเป็นทางการแสดงให้เห็นว่า อัตราการใช้งานเสียงในสถานการณ์ส่วนใหญ่สูงกว่า 90% คะแนน MOS (Mean Opinion Score) ด้านความเป็นธรรมชาติของภาษาส่วนใหญ่สูงกว่า 4 คะแนน โมเดลนี้ได้เปิดให้บริการบนศูนย์ทดลอง火山方舟 (Volcano Ark) และเปิด API สำหรับเชื่อมต่อแล้ว
