lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

Xiaohongshu เปิดตัวโมเดล TTS แบบ autoregressive ต่อเนื่องแบบโอเพนซอร์ส dots.tts รองรับการโคลนเสียงแบบ zero-shot

ตามการติดตามของ Beating ห้องปฏิบัติการ hi lab ของ Xiaohongshu ได้เปิดเผยโมเดล Text-to-Speech (TTS) แบบ end-to-end autoregressive ที่มีพารามิเตอร์ 2 พันล้านตัว ชื่อว่า dots.tts และเผยแพร่โค้ดสำหรับการอนุมานและการปรับแต่งละเอียด (fine-tuning) อย่างสมบูรณ์ภายใต้สัญญาอนุญาต Apache 2.0 น้ำหนักที่เผยแพร่ต่อสาธารณะประกอบด้วยเวอร์ชันพื้นฐานที่ผ่านการฝึกอบรมล่วงหน้า เวอร์ชันปรับแต่งละเอียดด้วย Self-Correction Alignment (SCA) และเวอร์ชันกลั่น (distillation) สำหรับการอนุมานที่มีความหน่วงต่ำ

แตกต่างจากสถาปัตยกรรม TTS แบบดั้งเดิมที่อาศัย Discrete Codec Tokens (เช่น VALL-E, CosyVoice, ChatTTS) dots.tts ใช้สถาปัตยกรรมแบบ end-to-end autoregressive flow matching ที่เป็น continuous โดยสมบูรณ์ โดยไม่ใช้ Token แบบ discrete ใดๆ ในกระบวนการทั้งหมด dots.tts รวมคุณสมบัติต่อเนื่องที่สกัดจาก AudioVAE ที่อัตราการสุ่ม 48 kHz เข้ากับตัวเข้ารหัสความหมาย (semantic encoder) โมเดลภาษาหลัก (เริ่มต้นจาก Qwen2.5-1.5B-Base ซึ่งประมวลผลข้อความ BPE โดยตรง ไม่ต้องใช้การป้อนพินอิน) และหัวเสียงแบบ autoregressive flow matching เพื่อทำนายตัวแปรแฝงต่อเนื่อง (continuous latent variables) ซึ่งจะถูกสร้างใหม่เป็นเสียงโดยตัวสร้าง (generator) เนื่องจากการทำนายคุณสมบัติต่อเนื่องโดยตรง dots.tts จึงหลีกเลี่ยงการสูญเสียคุณภาพเสียงที่เกิดจากการหาปริมาณแบบ discrete โดยคงรายละเอียดการออกเสียง ความคล้ายคลึงของเสียง และการแสดงออกทางอารมณ์ไว้

dots.tts ผ่านการฝึกอบรมล่วงหน้าด้วยข้อมูลเสียงประมาณ 1.5 ล้านชั่วโมง ในการประเมิน Seed-TTS-Eval dots.tts มีอัตราคำผิด (WER) ในชุดทดสอบภาษาจีน ภาษาอังกฤษ และภาษาจีนที่ยากอยู่ที่ 0.94% / 1.30% / 6.60% ตามลำดับ และคะแนนความคล้ายคลึง (SIM) อยู่ที่ 81.0 / 77.1 / 79.5 ซึ่งถือเป็นระดับ SOTA แบบโอเพนซอร์ส ในการทดสอบมาตรฐาน MiniMax Multilingual จำนวน 24 ภาษา ค่าเฉลี่ยความคล้ายคลึงของผู้พูดอยู่ที่ 83.9 Xiaohongshu ได้จัดเตรียมพื้นที่ทดลอง Gradio บน Hugging Face สำหรับผู้ใช้ในการทดสอบการโคลนเสียงแบบ zero-shot ออนไลน์

举报 แก้ไข/รายงาน
แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น