L’interpretariato simultaneo non è solo questione di velocità. Deve sentire bene, tradurre accuratamente e capire chi sta parlando. Qwen3.8-LiveTranslate ricostruisce la traduzione in tempo reale con un’architettura Interleave che migliora fedeltà, fluidità e concisione, mentre il ritardo medio (LAAL) scende da 2,8 a 2,3 secondi. Mezzo secondo in meno che fa tutta la differenza quando stai cercando di seguire una conversazione vera.
Il modello supporta 60 lingue e aggiunge tre capacità che lo portano oltre il solito ‘parla-e-traduci’: separazione real-time dei parlanti (ogni frase ha la sua attribuzione chiara e clonazione vocale più stabile), output sincronizzato sorgente-traduzione su un unico schermo bilingue, e disambiguazione a lungo contesto — legge il presente alla luce di quello che è stato detto prima, rendendo nomi e terminologia più precisi.
Architettura Interleave: audio e testo intrecciati, latenza più bassa
Questa generazione ripensa l’interpretariato simultaneo come un unico flusso intrecciato audio-testo. Sia l’audio già ascoltato che la traduzione già prodotta vengono messi in cache e riutilizzati. La qualità di traduzione migliora nettamente rispetto alla generazione precedente, mentre il ritardo medio cala da 2,8 a 2,3 secondi. Non male per un sistema che deve capire, tradurre e parlare quasi in contemporanea.
Separazione real-time dei parlanti: chi dice cosa
Quando più persone parlano a turno, il modello distingue chi è chi e cosa dice ciascuno. Aiuta anche il discorso tradotto a preservare il timbro vocale di ogni parlante in modo più accurato e stabile. Ogni parlante mantiene la propria identità sonora, niente voci generiche che appiattiscono tutto.
Output sincronizzato sorgente e traduzione
L’allineamento bilingue durante l’interpretazione supporta sia la comprensione istantanea che il controllo della fonte, e getta le basi per funzionalità successive: sottotitoli, organizzazione dei contenuti, recupero. In pratica, vedi scorrere fianco a fianco quello che viene detto e la traduzione. Utile quando devi verificare che non si stia perdendo qualcosa per strada.
Disambiguazione a lungo contesto: memoria che conta
Attingendo al testo precedente e al contesto storico, il modello riduce l’ambiguità di nomi propri e riferimenti in scenari complessi, mantenendo l’espressione coerente. Se qualcuno ha detto ‘Marco Rossi, il CEO di Acme Corp’ dieci minuti fa, quando più tardi salta fuori ‘Rossi ha detto che’, il sistema ricorda chi è Rossi e mantiene la traduzione consistente. Non è magia, è memoria contestuale.
Architettura: Thinker-Talker con Hybrid-MoE
Qwen3.8-LiveTranslate adotta un design a due moduli basato su Hybrid-MoE: il Thinker e il Talker. Il Thinker organizza video, audio, testo sorgente e traduzione in un’unica sequenza causale, intrecciata in ordine temporale e prodotta end-to-end, così comprensione e traduzione avvengono dentro una sola sequenza. Il Talker combina la traduzione e l’audio sorgente per sintetizzare il parlato tradotto preservando il timbro del parlante originale.
Il Thinker pensa, il Talker parla. E lo fanno insieme, non in serie. Questo è ciò che tiene bassa la latenza.
Performance: batte i sistemi mainstream su 70 direzioni linguistiche
Su Omnilingua-MSpeaker, un set di valutazione audio lungo multi-parlante che copre 14 direzioni linguistiche, Qwen3.8-LiveTranslate supera i sistemi di interpretazione real-time mainstream su quattro dimensioni: fedeltà della traduzione, fluidità, concisione e Diarization Error Rate (DER), che misura quanto bene il sistema identifica chi sta parlando.
Sul dataset pubblico FLEURS, valutato su 70 direzioni linguistiche, il modello guida sia la generazione precedente che i sistemi attuali su qualità di traduzione, ritardo medio, accuratezza del riconoscimento vocale e qualità della sintesi vocale. Traduce meglio, più velocemente, con meno errori.
60 lingue in input, 29 in output audio
Input audio e output testo: 60 lingue. Cinese, inglese, tedesco, italiano, portoghese, spagnolo, giapponese, coreano, francese, russo, thai, indonesiano, arabo, vietnamita, turco, finlandese, polacco, hindi, olandese, ceco, urdu, filippino, svedese, danese, ebraico, islandese, malese, norvegese, persiano, afrikaans, asturiano, azero, bielorusso, bengalese, bosniaco, bulgaro, cantonese, catalano, cebuano, croato, estone, galiziano, gujarati, greco, ungherese, giavanese, kannada, kazako, kirghiso, lettone, macedone, malayalam, marathi, punjabi, rumeno, slovacco, sloveno, swahili, tagico, ucraino.
Output audio: 29 lingue. Le principali ci sono tutte: cinese, inglese, tedesco, italiano, portoghese, spagnolo, giapponese, coreano, francese, russo, thai, indonesiano, arabo, vietnamita, turco, finlandese, polacco, hindi, olandese, ceco, urdu, filippino, svedese, danese, ebraico, islandese, malese, norvegese, persiano.
API DashScope: un esempio completo
Il team Qwen ha rilasciato un client Python completo per l’interpretazione real-time: cattura l’audio del microfono, lo invia al server in streaming, riceve e riproduce la traduzione. La separazione dei parlanti e l’output sincronizzato sorgente-traduzione si abilitano tramite configurazione di sessione. Il server restituisce l’identificatore del parlante e il testo in lingua sorgente insieme alla traduzione, senza bisogno di chiamare un’interfaccia ASR separata.
Il codice gestisce WebSocket, PyAudio, code asincrone per la riproduzione, configurazione delle modalità di output (voce + testo o solo testo), selezione della lingua target e hotword corpus per migliorare l’accuratezza su nomi propri e termini di dominio. Serve solo impostare le variabili d’ambiente DASHSCOPE_API_KEY e DASHSCOPE_WORKSPACE_ID.
Direzioni future: verso il limite della latenza
Il team guarda a tre direzioni, sintetizzate in: ascoltarlo più pienamente, trasmetterlo più fedelmente, usarlo più ampiamente.
Avvicinarsi al limite di latenza: continuare a comprimere la latenza end-to-end, spingendo il divario tra sentire e tradurre verso il suo limite fisico.
Memoria a lungo termine tra sessioni: portare la memoria attraverso le sessioni per lo stesso progetto e lo stesso gruppo di persone. Se lavori con lo stesso team per settimane, il sistema ricorda terminologia, nomi e contesto, e traduce in modo sempre più preciso.
Copertura linguistica: estendere il supporto a più lingue long-tail e dialetti regionali, così l’interpretazione real-time può servire anche le lingue che di solito restano fuori dai radar.
