Nokka

Posted on Sep 6

AI-assisted

OmniVoice โมเดล TTS 600+ ภาษา โคลนเสียงจากคลิป 3 วินาที เปิดซอร์สฟรี

ทีม k2-fsa เปิดตัว OmniVoice โมเดลแปลงข้อความเป็นเสียงพูด (text-to-speech) แบบ zero-shot ที่รองรับมากกว่า 600 ภาษา ซึ่งเป็นความครอบคลุมภาษาที่กว้างที่สุดในบรรดาโมเดล TTS แบบ zero-shot ที่มีอยู่ในปัจจุบัน โดยใช้สถาปัตยกรรม diffusion language model แบบใหม่ และรองรับทั้งการโคลนเสียง (voice cloning) และการออกแบบเสียง (voice design) [1]