动察 Beating ข่าวด่วน AI เทนเซ็นต์ Hunyuan เปิดซอร์สโมเดลสร้างและแก้ไขเสียง AuK ขนาด 1.5 พันล้านพารามิเตอร์ ทางการเรียกมันตรงๆ ว่า "Nano Banana เวอร์ชันเสียง" การโคลนเสียง เปลี่ยนคำ เปลี่ยนอารมณ์ ลบสำเนียง ปรับความเร็วและระดับเสียง ลดเสียงรบกวน แยกเสียงหลายคนและเสียงดนตรี ถูกรวมไว้ในโมเดลเดียวกัน ควบคุมด้วยภาษาธรรมชาติได้เลย
AuK สามารถแก้ไขเสียงอัดที่มีอยู่แล้วได้โดยตรง พูดผิด 몇 คำ แก้แค่คำเหล่านั้น ไม่ต้องอัดใหม่ทั้ง段落 เนื้อหาไม่เปลี่ยน ก็เปลี่ยนอารมณ์ โทนเสียง หรือสำเนียงได้ แก้เนื้อเพลง ลบเสียงหัวเราะและเสียงไอ เปลี่ยนจากการพูดปกติเป็นเสียงกระซิบก็รองรับ การโคลนเสียงก็ไม่ต้องให้ข้อความถอดเสียงอ้างอิงก่อน แค่มีเสียงหนึ่งช่วงและข้อความใหม่ก็สร้างได้
ในการทดสอบของทางการ AuK นำในหลายการประเมินด้านการสร้างเสียงและการแก้ไขเสียงทั่วไป SpeechEditBench ได้คะแนน 49.73 อันดับสอง Ming-UniAudio ได้ 28.70 เวอร์ชันเร็ว AuK-Flash หลังการกลั่นกรองใช้เพียง 4 ขั้นตอนในการอนุมาน เร็วกว่าประมาณ 4.5 เท่า อย่างไรก็ตาม งานวิจัยยอมรับว่า AuK ยังไม่สามารถเข้าใจคำสั่งภาษาธรรมชาติที่ป้อนมาแบบอิสระได้อย่างเสถียรทั้งหมด ยังต้องพึ่ง Prompt Enhancer ในการระบุงาน จัดเรียงพารามิเตอร์ และเขียนคำสั่งใหม่ โค้ดและน้ำหนักโมเดลเปิดเผยแล้ว ใช้สัญญาอนุญาต MIT
