Meta เปิดตัว Muse Voice Transcribe โมเดล AI ถอดเสียงแบบเรียลไทม์ รองรับหลายภาษาและผู้พูดกว่า 20 คน

Meta เปิดตัว Muse Voice Transcribe โมเดล AI ถอดเสียงแบบเรียลไทม์ รองรับกว่า 70 ภาษา แยกแยะผู้พูดได้มากกว่า 20 คน พร้อมใช้งานบนแอป Mac และสำหรับนักพัฒนา
Meta เปิดตัวโมเดลเสียงแบบเรียลไทม์ตัวแรกในชื่อ Muse Voice Transcribe ซึ่งเป็นผลงานล่าสุดจาก Meta Superintelligence Lab (MSI) โดยโมเดลนี้มีความสามารถในการจัดการงานเขียนตามคำบอกและการถอดเสียงสำหรับผู้พูดมากกว่า 20 คน พร้อมทั้งรองรับการทำงานหลายภาษาพร้อมกันได้อย่างราบรื่น
มาร์ก ซักเคอร์เบิร์ก ซีอีโอของ Meta ได้โพสต์วิดีโอตัวอย่างความสามารถของโมเดลดังกล่าว ซึ่งแสดงให้เห็นถึงการถอดเสียงที่สามารถแยกแยะผู้พูดหลายคนและสลับภาษาไปมาได้อย่างอัตโนมัติ นอกจากนี้ ระบบยังสามารถตรวจจับการสลับภาษาในประโยคเดียวกัน หรือที่เรียกว่า code-switching ได้อย่างมีประสิทธิภาพ
เทคโนโลยีการฟังและการประมวลผลขั้นสูง
ซักเคอร์เบิร์กได้อธิบายถึงกลไกการทำงานว่า โมเดลนี้จะคัดเลือกช่วงเวลาในการฟังด้วยตัวเอง โดยจะรอช้าลงเล็กน้อยในคำที่ออกเสียงยาก และตัดสินใจประมวลผลให้เร็วยิ่งขึ้นในคำที่ง่าย พร้อมใช้ระบบ adaptive delay เพื่อทำนายแต่ละโทเค็นและเพิ่มความแม่นยำในการถอดเสียง
โมเดลตัวนี้ผ่านการฝึกฝนจากเสียงในสถานการณ์จริงที่มีความซับซ้อน รองรับมากกว่า 70 ภาษา โดยมี 25 ภาษาที่ผ่านการตรวจสอบความถูกต้องแล้ว ณ ช่วงเปิดตัว นอกจากนี้ยังสามารถจัดการกับการสนทนายาวนานเป็นชั่วโมงที่มีผู้พูดเกิน 20 คนได้อย่างมีประสิทธิภาพ
การใช้งานและการให้บริการ
การเปิดตัวของ Meta ครั้งนี้เกิดขึ้นตามหลัง Google Gemini 3.5 Transcribe โมเดลเสียงจากคู่แข่งที่มีความสามารถใกล้เคียงกันไม่นานนัก แต่ในขณะที่ Google นำโมเดลเสียงไปผสานเข้ากับระบบ Android และ Chrome ทาง Meta ยังไม่มีการยืนยันที่แน่ชัดเกี่ยวกับการนำ Muse Voice Transcribe ไปรวมเข้ากับบริการหลักอื่น ๆ
อย่างไรก็ตาม ผู้ใช้ทั่วไปสามารถสัมผัสประสบการณ์การทำงานของโมเดลนี้ได้ผ่านทางแอปพลิเคชัน Meta AI บน Mac ที่เพิ่งปล่อยออกมา ซึ่งมีความสามารถในการขับเคลื่อนฟีเจอร์ที่สั่งการด้วยเสียงบนแอปอื่น ๆ ทำให้ Muse Voice Transcribe ทำหน้าที่ขับเคลื่อนระบบเขียนตามคำบอกบนบริการเหล่านั้นด้วยเช่นกัน
สำหรับนักพัฒนา สามารถเข้าถึงโมเดลนี้ได้ผ่านทาง Muse Code และ Model API ของ Meta โดยมีค่าบริการอยู่ที่ 3 ดอลลาร์สหรัฐต่อเสียงความยาว 1,000 นาที นอกจากนี้ยังมีเวอร์ชันทดลองใช้งานบนบล็อกวิจัยของ Meta อีกด้วย Muse Voice Transcribe ถือเป็นส่วนหนึ่งของการพัฒนาจาก Meta Superintelligence Lab (MSI) ที่ทยอยปล่อยเครื่องมือและโมเดล AI ใหม่ ๆ ออกมาอย่างต่อเนื่อง รวมถึงเอเจนต์สำหรับการเขียนโค้ดตัวแรก โมเดลแบบ open-weight และแอป Meta AI บน Mac
ป้ายกำกับ: AI, Mark Zuckerberg, Meta, Muse Voice Transcribe

<< หน้าแรก