Microsoft sfonda con MAI-Transcribe-2-Streaming: primo posto su Artificial Analysis

Microsoft ha lanciato MAI-Transcribe-2-Streaming, il suo primo modello di trascrizione in streaming, e ha subito preso il primo posto assoluto su Artificial Analysis per accuratezza — non solo sulle trascrizioni finali, ma anche sui partials, quelli che arrivano mentre state ancora parlando.

Insieme al modello di trascrizione arrivano due varianti voice: MAI-Voice-2.1 e MAI-Voice-2.1-Flash. L’idea è darvi tutti i componenti per costruire agenti vocali conversazionali senza dover scegliere tra velocità e qualità.

MAI-Transcribe-2-Streaming: trascrizioni in tempo reale

Il modello supporta 60 lingue con rilevamento automatico e continuo della lingua parlata. Produce i primi partials in poco più di 100 millisecondi dall’arrivo dell’audio, poi li rivede man mano che arriva più contesto e fissa la trascrizione finale subito dopo.

Questo significa che un agente vocale può iniziare a ragionare o chiamare strumenti a metà frase, prima ancora che finiate di parlare. Per dettatura in tempo reale o sottotitoli live, le valutazioni interne di Microsoft mostrano che le parole compaiono nella trascrizione due volte più velocemente rispetto al competitor più vicino.

Il prezzo introduttivo è 0,54 dollari per ora di audio fino a fine anno.

MAI-Voice-2.1: multilingua senza cambiare voce

MAI-Voice-2.1 supporta 23 lingue e 26 varianti locali. Una singola voce può parlare tutte le lingue con accento nativo: chiedetegli di passare dall’inglese al mandarino al tedesco e il parlante resta inequivocabilmente lo stesso, con la cadenza locale corretta. Niente accento inglese trascinato in tutte le lingue, che è esattamente quello che succede con molti altri sistemi.

Significa che un’app per tutoraggio può cambiare lingua a metà lezione senza cambiare insegnante, o che un assistente multilingua può rispondervi nella lingua in cui gli parlate mantenendo sempre la stessa identità vocale. Il prezzo è 22 dollari per 1 milione di caratteri.

MAI-Voice-2.1-Flash: velocità pura

Flash supporta le stesse lingue di Voice-2.1, ma è ottimizzato per carichi di lavoro ad alto volume e bassa latenza. Genera 45 secondi di audio con una latenza end-to-end di 150 millisecondi, è il 55% più veloce della versione standard nell’inferenza e costa circa il 60% in meno rispetto a modelli comparabili: 15 dollari per 1 milione di caratteri.

Accoppiato a MAI-Transcribe-2-Streaming, Flash vi restituisce tempo su entrambi i fronti del loop — trascrizione e sintesi — lasciando all’agente più spazio per ragionare, usare strumenti e verificare la risposta, il tutto dentro la finestra temporale in cui un umano percepisce ancora l’interazione come una conversazione.

Voice cloning con guardrail integrati

Entrambi i modelli supportano la clonazione vocale in tutte le lingue supportate usando solo pochi secondi di audio di riferimento. Hanno guardrail di consenso integrati per prevenire abusi — non un dettaglio secondario, considerando quanto sia facile fare danni con questa tecnologia.

Casi d’uso concreti

Microsoft elenca alcune applicazioni già costruibili oggi:

  • Agenti di customer service che trascrivono le richieste mentre vengono pronunciate, iniziano ad agire prima che il chiamante finisca di parlare e rispondono con voce naturale
  • Assistenti multilingua che rilevano automaticamente la lingua parlata e rispondono in una delle 23 lingue supportate con la stessa voce e accento nativo
  • Apprendimento interattivo e media con speaker distinti per tutoraggio, giochi di ruolo, simulazioni e contenuti conversazionali in tutte le lingue supportate

Disponibilità

Microsoft ha costruito Chatter, una demo nel MAI Playground, per mostrare i modelli all’opera in un agente live. MAI-Voice-2.1 e MAI-Voice-2.1-Flash sono già disponibili su OpenRouter; tutti e tre i modelli sono accessibili su Microsoft Foundry, MAI Playground, Vercel, LiveKit (in arrivo) e Azure Voice Live.

I numeri sono buoni, i prezzi competitivi, la tecnologia è già disponibile. Ora tocca vedere quanti sviluppatori riusciranno a costruire esperienze vocali che non facciano rimpiangere una telefonata con un umano.

AI LABELS_3x2_3_black