Microsoft AI ha lanciato MAI-Transcribe-2, il nuovo modello di riconoscimento vocale che l'azienda di Redmond definisce il pi� veloce, accurato ed economico sul mercato. Il debutto arriva con un prezzo di lancio di appena 0,10 dollari per ora di audio, valido fino alla fine del 2026.
Il confronto diretto � con i concorrenti pi� ingombranti del settore: Gemini 3.5 Transcribe di Google e GPT-Transcribe di OpenAI. Secondo i dati diffusi da Microsoft, elaborati insieme al benchmark indipendente Artificial Analysis, MAI-Transcribe-2 processa l'audio fino a 10 volte pi� velocemente di GPT-Transcribe, 7 volte pi� velocemente di Scribe v2 di ElevenLabs e 5 volte pi� velocemente di Gemini 3.5 Transcribe.
Sul fronte dell'accuratezza il modello si posiziona al primo posto nel benchmark FLEURS, il riferimento per la trascrizione multilingue, coprendo 60 lingue con un tasso di errore medio del 5,2%. Nella classifica generale di Artificial Analysis, invece, MAI-Transcribe-2 si ferma al secondo posto per accuratezza pura, pur definendo quella che Microsoft chiama la Pareto Frontier tra precisione e latenza.
Oltre alla velocit�, MAI-Transcribe-2 introduce funzioni pensate per un uso professionale: la diarizzazione dei parlanti, che attribuisce ogni segmento audio a una voce distinta restituendo un dialogo strutturato invece di un blocco di testo indifferenziato, e i timestamp a livello di parola. A completare il pacchetto ci sono il keyword biasing per la terminologia di settore, le modalit� di trascrizione configurabili tra verbatim e pulita, e la gestione del code-switching tra lingue diverse nella stessa conversazione, un dettaglio che torna utile con hindi-inglese o spagnolo-inglese.










