lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

เทนเซ็นต์เปิดซอร์ส "Nano Banana เวอร์ชันเสียง": แก้คำเปลี่ยนเสียงครบวงจร การแก้ไขเสียงพูดขึ้นอันดับอย่างก้าวกระโดด

动察 Beating ข่าวด่วน AI เทนเซ็นต์ Hunyuan เปิดซอร์สโมเดลสร้างและแก้ไขเสียง AuK ขนาด 1.5 พันล้านพารามิเตอร์ ทางการเรียกมันตรงๆ ว่า "Nano Banana เวอร์ชันเสียง" การโคลนเสียง เปลี่ยนคำ เปลี่ยนอารมณ์ ลบสำเนียง ปรับความเร็วและระดับเสียง ลดเสียงรบกวน แยกเสียงหลายคนและเสียงดนตรี ถูกรวมไว้ในโมเดลเดียวกัน ควบคุมด้วยภาษาธรรมชาติได้เลย


AuK สามารถแก้ไขเสียงอัดที่มีอยู่แล้วได้โดยตรง พูดผิด 몇 คำ แก้แค่คำเหล่านั้น ไม่ต้องอัดใหม่ทั้ง段落 เนื้อหาไม่เปลี่ยน ก็เปลี่ยนอารมณ์ โทนเสียง หรือสำเนียงได้ แก้เนื้อเพลง ลบเสียงหัวเราะและเสียงไอ เปลี่ยนจากการพูดปกติเป็นเสียงกระซิบก็รองรับ การโคลนเสียงก็ไม่ต้องให้ข้อความถอดเสียงอ้างอิงก่อน แค่มีเสียงหนึ่งช่วงและข้อความใหม่ก็สร้างได้


ในการทดสอบของทางการ AuK นำในหลายการประเมินด้านการสร้างเสียงและการแก้ไขเสียงทั่วไป SpeechEditBench ได้คะแนน 49.73 อันดับสอง Ming-UniAudio ได้ 28.70 เวอร์ชันเร็ว AuK-Flash หลังการกลั่นกรองใช้เพียง 4 ขั้นตอนในการอนุมาน เร็วกว่าประมาณ 4.5 เท่า อย่างไรก็ตาม งานวิจัยยอมรับว่า AuK ยังไม่สามารถเข้าใจคำสั่งภาษาธรรมชาติที่ป้อนมาแบบอิสระได้อย่างเสถียรทั้งหมด ยังต้องพึ่ง Prompt Enhancer ในการระบุงาน จัดเรียงพารามิเตอร์ และเขียนคำสั่งใหม่ โค้ดและน้ำหนักโมเดลเปิดเผยแล้ว ใช้สัญญาอนุญาต MIT

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น