Meta ha presentato Muse Voice Transcribe, il suo primo modello dedicato alla percezione audio in tempo reale. La tecnologia � stata sviluppata per offrire una trascrizione multilingue durante lo streaming dell'audio ed � gi� utilizzata nell'app Meta AI per Mac e in Muse Code. Gli sviluppatori possono inoltre accedere al modello attraverso la Meta Model API.

Il sistema combina diverse tecnologie dedicate al riconoscimento vocale. Oltre a convertire in testo ci� che viene pronunciato mentre la conversazione � ancora in corso, Muse Voice Transcribe � capace di distinguere i diversi interlocutori e di stabilire quando una persona ha terminato di parlare. Il riconoscimento pu� gestire registrazioni con pi� di 20 voci differenti, senza richiedere una fase separata di elaborazione successiva.

Il modello � stato addestrato utilizzando oltre 70 lingue, mentre 25 lingue sono state validate al momento del lancio. Muse Voice Transcribe pu� inoltre gestire contenuti audio con una durata superiore a un'ora e riconoscere automaticamente il passaggio da una lingua all'altra anche all'interno della stessa frase. La precisione pu� essere ulteriormente migliorata utilizzando informazioni relative alla lingua, alle parole chiave e al contesto.