Qwen3.8-Omni-Flash: il modello che non si limita a capire video e audio, ma ci lavora davvero

Oggi Qwen lancia Qwen3.8-Omni-Flash. Non è il solito modello multimodale che “capisce” immagini e suoni: pianifica, chiama strumenti, e consegna lavoro finito. Video editing, creazione di videoclip musicali, doppiaggio automatico di serie TV, montaggio di commenti cinematografici — roba che fino a ieri richiedeva ore di lavoro manuale e una dozzina di software diversi.

Il salto: da “guarda questo video e dimmi cosa vedi” a “prendi questo film di tre ore, scrivici un commento, montalo, aggiungi voce fuori campo e musica, e fammi vedere il risultato”.

I numeri

Qwen3.8-Omni-Flash gestisce finestre di contesto da 1 milione di token mantenendo prestazioni testuali comparabili a un modello text-only della stessa dimensione. Su 29 benchmark il punteggio medio cresce di oltre il 25% rispetto a Qwen3.5-Omni-Plus. Il prezzo API per ora di input audio scende del 98%. Per audio-video del 93%.

Su WildClawBench-MM guadagna 36,5 punti, su AgenticVBench altri 22,3. Su UniClawBench segna 69,6. Su LongAudioSpan migliora di 8,3 punti, su OmniVideoBench di 9,6. Il DER (Diarization Error Rate) per riconoscimento multi-speaker in riunioni passa da 88,11 a 3,35. Non è un refuso.

Audio e video come strumenti di lavoro

Il problema vero dei modelli multimodali non è mai stato solo “capire” un video. È gestirlo in modo efficiente: storage, trasmissione, elaborazione multi-turno. Audio e video lunghi costano, e i framework per agenti esistenti non li supportano nativamente. Qwen ha affrontato il problema sistemicamente: modello, harness, runtime, tutto insieme.

Con Qwen3.8-Omni-Flash arrivano due nuovi strumenti open source. Qwen-MM-Plugins gestisce percezione on-demand, uso di tool e workflow su audio-video lunghi. Qwen-Live Harness è un runtime nativo per interazione omnimodale continua e in tempo reale. Il modello non si limita a processare contenuti completi: partecipa attivamente mentre l’interazione avviene.

Descrizioni video controllabili

Non esiste una risposta univoca a “come va descritto questo video”. Se stai cercando footage specifico, vuoi timestamp precisi. Se gestisci asset, ti serve struttura. Se crei contenuti, ti interessa la narrativa. Qwen3.8-Omni-Flash capovolge l’approccio: da “cosa ha visto il modello” a “cosa vuole sapere l’utente”.

Puoi specificare soggetto, intervallo temporale, livello di dettaglio, formato di output. Lo stesso video può restituire una panoramica generale, l’identificazione di segmenti chiave, o un’analisi di azioni dei personaggi, inquadrature, illuminazione, suono. Tu decidi cosa guardare, quanto da vicino, e come presentarlo.

Comprensione agentica di video lunghi

Per video di diverse ore, l’approccio convenzionale obbliga il modello a processare tutto dall’inizio alla fine, anche quando la risposta sta in pochi minuti di footage. L’agente nativo di Qwen3.8-Omni-Flash parte dalla domanda, decide autonomamente cosa guardare e ascoltare, e localizza le informazioni chiave attraverso più round di ricerca progressiva, dal generale allo specifico.

Su OmniVideoBench la modalità Agentic migliora l’accuratezza da 63,4 a 67,8 riducendo il consumo di token da 145.736 a 79.117, circa il 45,7% in meno. Meno compute, più precisione.

Dalle riunioni alle azioni concrete

Le riunioni multi-partecipante sono tra gli scenari più complessi: parlanti che si alternano e si sovrappongono, identità che cambiano, riferimenti ambigui. Qwen3.8-Omni-Flash riconosce i parlanti usando audio e video insieme, supporta fino a un’ora di input audio-visivo nativo, e gestisce segmentazione speaker, trascrizione e allineamento identità end-to-end.

Dagli un video di riunione completo e una richiesta: mappa le relazioni tra partecipanti, genera verbali, identifica azioni da intraprendere, analizza rischi di progetto. Usa le informazioni visive per risolvere ambiguità nell’audio. Combinato con agenti e tool, può anche inviare email, organizzare task, o iniziare a programmare in risposta ai requisiti emersi.

Ricerca approfondita basata su video

Quando guardi un video con una domanda specifica, la risposta spesso va oltre il video stesso. Qwen3.8-Omni-Flash combina le tue necessità con il contenuto video per identificare domande che meritano approfondimento, organizza il materiale chiave, e cerca fonti multimodali sul web: immagini, video, documenti. Poi produce un report di ricerca video-centrico, illustrato.

Esempio pratico: incontri color fringing attorno al ritaglio capelli in Photoshop. Il modello scompone i passaggi del tutorial, studia i principi dietro le modalità di fusione Multiply e Screen, confronta tecniche alternative di riparazione bordi, e spiega quale approccio si adatta meglio alla tua situazione.

Produzione e editing audio-visivo

Con Qwen3.8-Omni-Flash il modello non si limita a capire suoni e immagini: pianifica autonomamente, chiama strumenti e consegna video finiti. Workflow professionali completi.

Music2MV: da canzone a videoclip

Il modello analizza struttura, ritmo, mood, voci e cambiamenti strumentali di una canzone. Informa il design di personaggi, scene e inquadrature. Produce testi sincronizzati riga per riga con timestamp per allineare canto, sottotitoli e visual. Combinato con Qwen-MM-Plugins, copre il workflow completo: da comprensione musicale e pianificazione creativa a revisione qualità finale.

Traduzione di serie brevi

La traduzione video tradizionale richiede switch continui tra piattaforme di trascrizione, traduzione, doppiaggio, editing, con coordinamento complesso tra voci dei personaggi, durata dialoghi e ritmo visivo.

Con un agente basato su Qwen3.8-Omni-Flash descrivi le tue necessità in una frase: riconoscimento dialoghi speaker-aware, traduzione conversazionale, clonazione voci personaggi e doppiaggio, remix audio, revisione qualità. I passaggi di localizzazione frammentati diventano un workflow unico. Consegna automatica di serie brevi per audience internazionali.

Commenti a film lunghi

Produrre video di commento per film di due-tre ore richiede visioni ripetute, ricostruzione trama, selezione inquadrature, scrittura script, voiceover, musica, editing.

Con Qwen3.8-Omni-Flash descrivi i requisiti creativi in una frase: comprensione video lungo, estrazione plot chiave, pianificazione commento, produzione voiceover e musica, editing, rendering, revisione qualità. L’agente intreccia dialoghi originali e commento, regola velocità parlato e volume perché narrazione, audio originale, musica di sottofondo e visual fluiscano insieme.

Dall’uso dei modelli all’ottimizzazione dei modelli

Le applicazioni multimodali reali sono spesso complesse e cost-sensitive. Richiedono bilanciamento tra qualità, latenza, compute e costi deployment. Personalizzare modelli più piccoli per scenari specifici è un percorso importante per il deploy su scala. I workflow tradizionali, costruzione dati, diagnosi problemi, round multipli di training e valutazione, richiedono tempo e dipendono pesantemente da expertise umana.

Qwen ha esteso Qwen3.8-Omni-Flash allo sviluppo di modelli stesso: il large model guida la R&D, il modello più piccolo serve il business.

Task assegnato: migliora il riconoscimento vocale del dialetto Sichuan di Qwen2.5-Omni-3B entro 12 ore e consegna un modello utilizzabile. Il modello ha selezionato autonomamente l’evaluation set WenetSpeech-Chuan, fissato i criteri di valutazione, stabilito la baseline. Poi ha ascoltato direttamente sample audio, diagnosticato problemi usando i risultati del riconoscimento, costruito training data mirato. In quattro round consecutivi ha creato 3.413 esempi di training, regolato l’approccio basandosi sul feedback di valutazione, mantenuto i miglioramenti efficaci, eseguito rollback dei tentativi non riusciti.

Il character error rate di Qwen2.5-Omni-3B sullo stesso evaluation set è sceso da 25,79% a 15,30%, una riduzione relativa del 40,7%.

Compressione informazione audio-visiva

Audio e video portano informazione ricca, ma la forma lineare e non strutturata rende retrieval e riuso difficili. Qwen3.8-Omni-Flash analizza contenuto attraverso suono, visual e timeline, usa workflow agentico per estrarre informazioni, riorganizzarne la struttura, verificare i risultati. Trasforma conoscenza ed esperienza pratica in video lunghi in asset informativi più densi e facili da riusare.

Video2Note: da video a documentazione strutturata

Open-sourced in Qwen-MM-Plugins. Sfrutta la comprensione congiunta di speech, visual e procedure per organizzare automaticamente la conoscenza, scomporre i passaggi chiave, selezionare frame rappresentativi, generare note PDF con testo e immagini. Review automatizzata e correzione iterativa condensano ore di video in documenti chiari e facili da rivisitare.

Omni Skill Creator: da dimostrazione a skill riusabile

I video registrano non solo come fare qualcosa, ma anche l’expertise pratica accumulata da specialisti. Omni Skill Creator, nuova capability open-source in Qwen-MM-Plugins, estrae procedure operative standard (SOP) da dimostrazioni per eseguire lavoro automatizzato riusabile, o apprende uso strumenti, criteri di decisione e insight chiave da istruzioni di esperti. Una singola dimostrazione diventa una agent skill verificata, valutata, riusabile e condivisibile.

Interazione audio-visiva real-time

Qwen3.8-Omni-Flash è progettato per comprensione e creazione con contenuto audio-visivo completo. Per interazione continua a bassa latenza arriva Qwen3.8-Omni-Flash-Realtime. Percepisce e risponde mentre riceve stream audio-visivi live, usa il contesto real-time per chiamare tool ed eseguire task.

Pratica linguistica real-time

Il parlato non ha input standard. Accenti, sostituzioni vocaliche e consonantiche, deviazioni tonali possono far divergere la trascrizione parola-per-parola dal significato inteso. Qwen3.8-Omni-Flash-Realtime modella congiuntamente pronuncia e semantica, capisce espressioni non standard influenzate da accenti, le allinea con le parole corrette, genera dimostrazioni a pronuncia standard in tempo reale. Attraverso turni multipli di pratica, il modello aggiorna il giudizio con nuovo audio, correggendo errori che influenzano la comprensione preservando ritmo naturale, tono, emozione.

Percezione audio spaziale omnimodale

Negli spazi reali, il suono fornisce un ulteriore asse di orientamento oltre alla visione. Qwen3.8-Omni-Flash-Realtime combina suono spaziale e informazione visiva per determinare continuamente direzione e distanza delle sorgenti sonore, percependo ostacoli, aree navigabili e cambiamenti di scena. È il primo modello omnimodale capace di localizzare target tramite suono.

Per istruzioni come “vieni qui” o “vai a vedere cosa produce quel suono”, il modello isola voci e suoni target dal rumore ambientale, ne ancora il significato nello spazio circostante, chiama tool per localizzazione, ricerca, pianificazione percorso e navigazione.

Conoscenza esterna per interazione audio-visiva

L’interazione real-time richiede non solo bassa latenza, ma la capacità di caricare conoscenza e comportamento dinamicamente per ogni applicazione. Qwen3.8-Omni-Flash-Realtime supporta l’iniezione di impostazioni identità, stili di espressione, conoscenza business e regole di interazione attraverso Skills, mentre il tool use estende le capacità in esecuzione task.

In scenari come il customer service, il modello carica linguaggio brand e procedure in tempo reale, capisce speech, visual e contesto dell’utente, genera risposte che seguono i requisiti business ed esegue azioni. Lo stesso modello real-time può assumere conoscenza, ruoli e modi di agire diversi.

I numeri dei benchmark

Su WildClawBench-MM (multimodal tool use): 71,0 contro 34,5 di Qwen3.5-Omni-Plus e 58,9 di Gemini 3.8 Flash. Su UniClawBench: 69,6. Su AgenticVBench: 36,8 (Gemini 3.8 Flash fa 45,0, ma partiamo da una base molto più bassa nei modelli precedenti).

Audio-visual understanding su DailyOmni: 85,1. WorldSense: 68,5. AVUT: 86,6. OmniVideoBench: 63,4 statico, 67,8 in modalità agente con Qwen Code. Video-MME-v2: 65,0 statico, 71,3 agente.

Multi-speaker ASR su AliMeeting Test, DER e cpWER: 3,4 | 17,2. Qwen3.5-Omni-Plus faceva 88,1 | 89,6. Gemini 3.8 Flash: 72,6 | 53,1. Non sono miglioramenti incrementali.

ASR multilingue FLEURS copre 60 lingue con WER medio 9,3. Speech-to-text translation (S2TT) BLEU score: 31,8. Su LongAudioSpan: Accuracy 82,7, Rubric 71,8, Chain 48,2.

Throughput e latenza API real-time

Per input audio 6s: 84,87 token/s output, time to first token 591ms, time to first audio packet 978ms, audio generation RTF 0,1538. Per audio-visual 20s: 83,0 token/s, TTFT 981ms, TTFAP 1350ms, RTF 0,1528. RTF sotto 0,16 significa che il modello genera un secondo di audio in circa 150-160 millisecondi.

Lingue e dialetti supportati

Speech recognition: 74 lingue, da Afrikaans a Vietnamese, passando per Cebuano, Interlingua, Lingala, Maori. Speech generation: 29 lingue. Dialetti cinesi supportati: 39, tra cui Northeastern Mandarin, Sichuanese, Cantonese (Guangdong e Hong Kong), Shanghainese, Southern Min, Hakka, e dialetti regionali da Henan a Yunnan.

Non è un modello che “parla cinese e inglese”. Copre varietà linguistiche reali, quelle che le persone usano davvero quando parlano, non quelle standardizzate dei dataset.

Come iniziare

Qwen3.8-Omni-Flash supporta il parametro reasoning_effort per regolare profondità del ragionamento e controllare i costi. Tre livelli: xhigh (default, per task complessi che richiedono analisi approfondita), medium (bilancia accuratezza e velocità), low (ottimizzato per velocità e costo). Preserve_thinking è abilitato di default in tutti gli scenari.

Disponibile su Qianwen AI Platform con input testo, immagine, audio e video, finestra contesto 1M token, API standard e API real-time.

Qwen-MM-Plugins e Qwen-Live Harness sono open source: potete studiarli, modificarli, integrarli. Non sono demo. Sono infrastruttura.

AI LABELS_3x2_3_black