SpaceXAI ha appena rilasciato Grok Voice Transcribe 2.0, il loro nuovo modello di speech-to-text. Prima che pensiate ‘ecco l’ennesimo aggiornamento incrementale’: il doppio della precisione rispetto alla versione 1.0. Stesso prezzo.
Grok Voice gestisce già decine di migliaia di chiamate di assistenza clienti al giorno, trascrive milioni di ore di video e alimenta assistenti vocali in prodotti fisici — compreso quello nelle Tesla. Non è un esperimento di laboratorio. È roba che lavora sul campo.
Quando l’audio è un casino (cioè sempre)
La maggior parte dei modelli se la cava bene con audio pulito, singolo speaker, ambiente silenzioso. Il problema è che l’audio del mondo reale fa schifo: linee telefoniche traballanti, voci sovrapposte, accenti marcati, numeri sillaabati a velocità variabile. Grok Voice Transcribe 2.0 è stato costruito per questo — per l’audio difficile, sporco, caotico.
Sulla leaderboard pubblica di Artificial Analysis, tra 32 modelli streaming, Grok Voice Transcribe 2.0 si piazza primo per accuratezza.
I test interni raccontano di più
Oltre ai benchmark pubblici, SpaceXAI ha misurato il word error rate su quattro set estratti dal traffico di produzione reale:
- Audio telefonico da chiamate di supporto clienti
- Conversazioni con Grok
- Credenziali parlate — codici account, email, indirizzi
- Comandi vocali brevi e multilingua
Grok Voice Transcribe 2.0 batte la versione 1.0 su tutti e quattro. Sulla telefonia fa meglio di qualsiasi altro modello testato. Se gestite un call center, questo è il modello che volete.
Multilingua senza fare domande
Decine di lingue supportate, rilevamento automatico, e segue i cambi di lingua a metà registrazione in un singolo passaggio. Nessun bisogno di specificare la lingua in anticipo o riavviare il processo.
Il miglioramento più grande rispetto alla versione 1.0 è proprio qui. Su frasi brevi come comandi vocali in auto — dove il modello ha pochissimo contesto per identificare la lingua — il word error rate è sceso dal 20,6% al 6,8%: da uno su cinque a uno su quindici errori, più o meno.
Le feature che contano
Grok Voice Transcribe 2.0 non è solo più preciso. Se state integrando un sistema di trascrizione serio, queste funzionalità vi serviranno:
Batch e streaming. Trascrivete file registrati, URL o stream audio in tempo reale.
Timestamp word-level. Ogni parola ha start/end time precisi e punteggi di confidenza. Utile per sincronizzare sottotitoli o analizzare pause nel discorso.
Speaker diarization. Il modello etichetta automaticamente ogni speaker. Nessun costo aggiuntivo, il che è raro.
Trascrizione multicanale. Fino a 8 canali indipendenti. Perfetto per call center con registrazioni stereo cliente/operatore.
Key term biasing. Fino a 100 termini specifici per richiesta — nomi di prodotti, vocabolario medico, quello che vi serve. Il modello li prioritizza nel riconoscimento.
Formattazione del testo. Numeri, date, valute, telefoni ed email restituiti in forma scritta. Non ‘tre tre nove otto’, ma ‘3398’.
Rimozione filler word. Volete eliminare tutti gli ‘ehm’ e gli ‘uh’? C’è un flag per quello.
Smart turn detection. Per voice agent: rileva quando uno speaker ha finito il suo turno, così evitate interruzioni imbarazzanti.
Atlassian Loom ci costruisce sopra workflow AI
Atlassian Loom — piattaforma per registrare e condividere video dello schermo — ha trovato Grok Voice Transcribe 2.0 più accurato della loro soluzione esistente. Con trascrizioni precise si aprono flussi di lavoro nuovi: registri un action plan in Loom, mandi la trascrizione a Cursor, e Cursor aggiorna direttamente il codice.
Come dice Sanchan Saxena, SVP di Teamwork Collection in Atlassian: ‘Abbiamo sempre creduto che il modo migliore per far avanzare il lavoro sia catturare il contesto una volta e lasciarlo fluire ovunque. Con Grok che alimenta lo speech-to-text di Loom e Cursor che lo trasforma in codice, stiamo chiudendo il cerchio dal contesto al codice: registri quello che intendi, e il lavoro viene fatto.’
Registri, trascrivi, generi codice. Ed è già operativo oggi.
Il prezzo (spoiler: uguale)
Grok Voice Transcribe 2.0 costa esattamente quanto la versione 1.0: batch a 0,10$ l’ora di audio, streaming a 0,20$ l’ora. Diarization, timestamp e key terms inclusi. Nessuna sorpresa nascosta.
Doppia precisione allo stesso prezzo non è una mossa comune. Di solito i miglioramenti significativi si pagano. Qui no.
Transizione in arrivo
Grok Voice Transcribe 2.0 diventerà presto il default nell’API Speech-to-Text. La versione 1.0 verrà deprecata nelle prossime settimane. Se volete restare sulla 1.0 durante la transizione, dovete pinnarla esplicitamente specificando grok-voice-transcribe-1.0 nelle chiamate API.
Le integrazioni esistenti ricevono automaticamente il miglioramento di accuratezza senza modifiche al codice. Basta fare l’upgrade dell’endpoint.
Se state costruendo qualcosa che coinvolge trascrizione audio — customer support, video platform, assistenti vocali, analisi di chiamate — i numeri ci sono, i casi d’uso anche, e il prezzo non è cambiato.
