lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

โมเดลถอดเสียงพูดที่แข็งแกร่งที่สุดของกูเกิลมาแล้ว: ความแม่นยำติดอันดับห้า แต่ยังไม่ชนะ ElevenLabs

动察 Beating AI ข่าวด่วน Google เปิดตัว Gemini 3.5 Transcribe ซึ่งเป็นโมเดลถอดเสียงพูดเป็นข้อความที่แม่นยำที่สุดของ Google ในตอนนี้ และเป็นครั้งแรกที่ Google เพิ่มโหมด Smart ในโมเดลถอดเสียงเฉพาะทาง โมเดลนี้มีสองเวอร์ชันคือแบบเรียลไทม์และแบบถอดเสียงจากไฟล์บันทึก ขณะนี้เปิดให้ทดสอบผ่าน Gemini API สาธารณะแล้ว ในการประเมินของ Artificial Analysis ค่า WER (อัตราคำผิด ยิ่งต่ำยิ่งดี) แบบไม่สตรีมอยู่ที่ 2.6% และแบบเรียลไทม์อยู่ที่ 4.0% ความหน่วงในการถอดเสียงสุดท้ายลดลง 70% เมื่อเทียบกับรุ่นก่อนหน้าอย่าง Chirp 3


โหมด Smart ไม่ได้แค่แปลงเสียงเป็นข้อความแบบคำต่อคำอีกต่อไป เช่น ถ้าคุณพูดว่า "นัดประชุมวันอังคาร ไม่สิ วันพุธ" มันจะเก็บเฉพาะ "วันพุธ" ไว้โดยตรง คำพูดติดปากอย่าง "อืม อ่า" ก็จะถูกลบออกโดยอัตโนมัติ และยังสามารถจัดระเบียบคำพูดให้เป็นย่อหน้า รายการ วันที่ และตัวเลขได้อีกด้วย หากต้องการบันทึกการประชุมแบบคำต่อคำ ก็ยังสามารถใช้โหมดถอดเสียงแบบคำต่อคำเริ่มต้นได้ตามเดิม


โมเดลรองรับมากกว่า 85 ภาษาและสามารถสลับภาษาได้ระหว่างการใช้งาน รวมถึงเพิ่มคำศัพท์เฉพาะทางที่กำหนดเองได้ ค่าบริการถอดเสียงจากไฟล์บันทึกอยู่ที่ประมาณ 0.005 ดอลลาร์ต่อนาที หรือ 5 ดอลลาร์ต่อ 1,000 นาที ส่วนแบบเรียลไทม์อยู่ที่ประมาณ 0.009 ดอลลาร์ต่อนาที ในอันดับอิสระ โมเดลนี้แม่นยำกว่า OpenAI GPT Transcribe ที่มีค่า 3.3% แต่ยังไม่เหนือกว่า ElevenLabs Scribe v2 ซึ่งมีค่า WER อยู่ที่ 2.2% และราคาประมาณ 3.67 ดอลลาร์ต่อ 1,000 นาที


โมเดลชุดนี้ถูกนำไปใช้ใน Rambler บน Android และ Gemini เวอร์ชัน macOS แล้ว และต่อไปจะเข้าสู่ Chrome ซึ่งจะทำให้สามารถพูดแล้วพิมพ์ในช่องป้อนข้อมูลบนเว็บเพจได้โดยตรง

นักสืบบนบล็อกเชนเฝ้าติดตามอย่างต่อเนื่อง
แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น