Microsoft ha lanciato MAI-Transcribe-2-Streaming, il suo primo modello di trascrizione in streaming, e ha subito preso il primo posto assoluto su Artificial Analysis per accuratezza — non solo sulle trascrizioni finali, ma anche sui partials, quelli che arrivano mentre state ancora parlando.
Insieme al modello di trascrizione arrivano due varianti voice: MAI-Voice-2.1 e MAI-Voice-2.1-Flash. L’idea è darvi tutti i componenti per costruire agenti vocali conversazionali senza dover scegliere tra velocità e qualità.
MAI-Transcribe-2-Streaming: trascrizioni in tempo reale
Il modello supporta 60 lingue con rilevamento automatico e continuo della lingua parlata. Produce i primi partials in poco più di 100 millisecondi dall’arrivo dell’audio, poi li rivede man mano che arriva più contesto e fissa la trascrizione finale subito dopo.
Questo significa che un agente vocale può iniziare a ragionare o chiamare strumenti a metà frase, prima ancora che finiate di parlare. Per dettatura in tempo reale o sottotitoli live, le valutazioni interne di Microsoft mostrano che le parole compaiono nella trascrizione due volte più velocemente rispetto al competitor più vicino.
Il prezzo introduttivo è 0,54 dollari per ora di audio fino a fine anno.
MAI-Voice-2.1: multilingua senza cambiare voce
MAI-Voice-2.1 supporta 23 lingue e 26 varianti locali. Una singola voce può parlare tutte le lingue con accento nativo: chiedetegli di passare dall’inglese al mandarino al tedesco e il parlante resta inequivocabilmente lo stesso, con la cadenza locale corretta. Niente accento inglese trascinato in tutte le lingue, che è esattamente quello che succede con molti altri sistemi.
Significa che un’app per tutoraggio può cambiare lingua a metà lezione senza cambiare insegnante, o che un assistente multilingua può rispondervi nella lingua in cui gli parlate mantenendo sempre la stessa identità vocale. Il prezzo è 22 dollari per 1 milione di caratteri.
MAI-Voice-2.1-Flash: velocità pura
Flash supporta le stesse lingue di Voice-2.1, ma è ottimizzato per carichi di lavoro ad alto volume e bassa latenza. Genera 45 secondi di audio con una latenza end-to-end di 150 millisecondi, è il 55% più veloce della versione standard nell’inferenza e costa circa il 60% in meno rispetto a modelli comparabili: 15 dollari per 1 milione di caratteri.
Accoppiato a MAI-Transcribe-2-Streaming, Flash vi restituisce tempo su entrambi i fronti del loop — trascrizione e sintesi — lasciando all’agente più spazio per ragionare, usare strumenti e verificare la risposta, il tutto dentro la finestra temporale in cui un umano percepisce ancora l’interazione come una conversazione.
Voice cloning con guardrail integrati
Entrambi i modelli supportano la clonazione vocale in tutte le lingue supportate usando solo pochi secondi di audio di riferimento. Hanno guardrail di consenso integrati per prevenire abusi — non un dettaglio secondario, considerando quanto sia facile fare danni con questa tecnologia.
Casi d’uso concreti
Microsoft elenca alcune applicazioni già costruibili oggi:
- Agenti di customer service che trascrivono le richieste mentre vengono pronunciate, iniziano ad agire prima che il chiamante finisca di parlare e rispondono con voce naturale
- Assistenti multilingua che rilevano automaticamente la lingua parlata e rispondono in una delle 23 lingue supportate con la stessa voce e accento nativo
- Apprendimento interattivo e media con speaker distinti per tutoraggio, giochi di ruolo, simulazioni e contenuti conversazionali in tutte le lingue supportate
Disponibilità
Microsoft ha costruito Chatter, una demo nel MAI Playground, per mostrare i modelli all’opera in un agente live. MAI-Voice-2.1 e MAI-Voice-2.1-Flash sono già disponibili su OpenRouter; tutti e tre i modelli sono accessibili su Microsoft Foundry, MAI Playground, Vercel, LiveKit (in arrivo) e Azure Voice Live.
I numeri sono buoni, i prezzi competitivi, la tecnologia è già disponibile. Ora tocca vedere quanti sviluppatori riusciranno a costruire esperienze vocali che non facciano rimpiangere una telefonata con un umano.
