动察 Beating AI ข่าวด่วน Google เปิดตัว Gemini 3.5 Transcribe ซึ่งเป็นโมเดลถอดเสียงพูดเป็นข้อความที่แม่นยำที่สุดของ Google ในตอนนี้ และเป็นครั้งแรกที่ Google เพิ่มโหมด Smart ในโมเดลถอดเสียงเฉพาะทาง โมเดลนี้มีสองเวอร์ชันคือแบบเรียลไทม์และแบบถอดเสียงจากไฟล์บันทึก ขณะนี้เปิดให้ทดสอบผ่าน Gemini API สาธารณะแล้ว ในการประเมินของ Artificial Analysis ค่า WER (อัตราคำผิด ยิ่งต่ำยิ่งดี) แบบไม่สตรีมอยู่ที่ 2.6% และแบบเรียลไทม์อยู่ที่ 4.0% ความหน่วงในการถอดเสียงสุดท้ายลดลง 70% เมื่อเทียบกับรุ่นก่อนหน้าอย่าง Chirp 3
โหมด Smart ไม่ได้แค่แปลงเสียงเป็นข้อความแบบคำต่อคำอีกต่อไป เช่น ถ้าคุณพูดว่า "นัดประชุมวันอังคาร ไม่สิ วันพุธ" มันจะเก็บเฉพาะ "วันพุธ" ไว้โดยตรง คำพูดติดปากอย่าง "อืม อ่า" ก็จะถูกลบออกโดยอัตโนมัติ และยังสามารถจัดระเบียบคำพูดให้เป็นย่อหน้า รายการ วันที่ และตัวเลขได้อีกด้วย หากต้องการบันทึกการประชุมแบบคำต่อคำ ก็ยังสามารถใช้โหมดถอดเสียงแบบคำต่อคำเริ่มต้นได้ตามเดิม
โมเดลรองรับมากกว่า 85 ภาษาและสามารถสลับภาษาได้ระหว่างการใช้งาน รวมถึงเพิ่มคำศัพท์เฉพาะทางที่กำหนดเองได้ ค่าบริการถอดเสียงจากไฟล์บันทึกอยู่ที่ประมาณ 0.005 ดอลลาร์ต่อนาที หรือ 5 ดอลลาร์ต่อ 1,000 นาที ส่วนแบบเรียลไทม์อยู่ที่ประมาณ 0.009 ดอลลาร์ต่อนาที ในอันดับอิสระ โมเดลนี้แม่นยำกว่า OpenAI GPT Transcribe ที่มีค่า 3.3% แต่ยังไม่เหนือกว่า ElevenLabs Scribe v2 ซึ่งมีค่า WER อยู่ที่ 2.2% และราคาประมาณ 3.67 ดอลลาร์ต่อ 1,000 นาที
โมเดลชุดนี้ถูกนำไปใช้ใน Rambler บน Android และ Gemini เวอร์ชัน macOS แล้ว และต่อไปจะเข้าสู่ Chrome ซึ่งจะทำให้สามารถพูดแล้วพิมพ์ในช่องป้อนข้อมูลบนเว็บเพจได้โดยตรง
