Ola todos! ecco le notizie dedicate al mondo IA del 24 Settembre 2026Iniziamo con Google. Otto minuti. Un tutorial completo per costruire i tuoi primi agenti IA. Nessuna premessa teorica, solo istruzioni dirette. Oltre mezzo milione di visualizzazioni in poche ore.Passiamo a Opus CINQUE PUNTO CINQUE. Un utente ha chiesto al modello di spiegare la messa a fuoco costruendo un laboratorio interattivo. Risultato: un’app completa con elementi di lente regolabili. Un’ora e ventisei minuti. Una singola richiesta. Venticinque dollari e sessantasei centesimi di costo API.Nel frattempo, Alibaba Qwen rilascia Audio TRE PUNTO UNO. Cinque modelli in un’unica suite: riconoscimento vocale, sintesi, interazione in tempo reale e creazione audio. ASR-Next supporta trascrizioni multi-speaker con etichette, timestamp e riconoscimento emotivo. TTS-Next genera voce, effetti sonori e audio di sottofondo in un’unica passata. I prezzi? Settanta percento in meno per TTS, ottantacinque percento per Realtime, fino a novantacinque percento per ASR.A proposito di audio, Google AI Studio presenta Gemini TRE PUNTO OTTO Flash TTS e Flash-Lite TTS. I modelli più espressivi mai rilasciati per la generazione audio. Disponibili via API e direttamente in AI Studio.Sempre Alibaba, questa volta con Qwen Intelligence. Tre agenti SOTA per dispositivi mobile: Mobile Planner Agent pianifica e orchestra task complessi, primo posto su MobilePA-Bench. Mobile-Use Agent esegue con approccio API-first, novantadue punto due su MobileWorld-Real, novanta percento di successo end-to-end. Mobile Creative Agent genera contenuti pronti all’uso in tre secondi, circa il doppio più veloce dei competitor.Passiamo ad Antigravity. Modelli come Gemma QUATTRO girano completamente offline nel loro SDK. Costruito su LiteRT di Google AI Edge, esegue direttamente sulla GPU locale. Zero costi API, privacy totale, nessuna connessione internet richiesta.Nel frattempo, NVIDIA rilascia Nemotron TRE Diarization. Quando più persone parlano contemporaneamente, le trascrizioni diventano illeggibili. Questo modello traccia chi ha parlato e quando, anche con voci sovrapposte. Gestisce fino a otto speaker. Cento milioni di parametri. Disponibile su Hugging Face.Vale la pena menzionare il Contrastive Language Model. CLM-OTTO B è pre-addestrato su dati internet-scale e offre inferenza fino a nove volte più veloce di Jev, con prestazioni comparabili su computer-use, gaming e tool-calling. Con fine-tuning leggero raggiunge OTTANTUNO PUNTO SEI percento su DeepSWE e OTTANTASETTE PUNTO SEI su Terminal-Bench DUE PUNTO UNO.Torniamo su Anthropic. Claude sembra aver scoperto un sistema enzimatico precedentemente sconosciuto nel DNA dei batteriofagi. Accanto al gene dell’enzima si trova un lungo array di DNA ripetuto, una struttura simile a CRISPR. Non sappiamo ancora cosa faccia, ma solo pochi sistemi noti condividono queste caratteristiche, e tutti possono tagliare, copiare e incollare DNA.Spostiamoci su Qwen-Image. La versione ufficiale contiene ancora un blocco nascosto: il prompt rewriter. La versione originale rifiuta novantotto richieste su cento. Ora esiste una versione Heretic che abbassa il rifiuto a tre su cento. Esiste anche una versione a quattro step distillata e una in formato NVFP4 per RTX CINQUANTA. La cosa interessante? Qwen-Image DUE PUNTO UNO gira già su smartphone Android. Snapdragon OTTO Gen DUE con sedici GB di RAM produce un’immagine CINQUECENTODODICI per CINQUECENTODODICI in circa otto minuti.Passiamo a Cua-S1-4B-0.2. Il primo modello di decisione multimodale addestrato con RLOO su task computer-use live, usando reward di completamento task. Adattatori testuali e multimodali disponibili sotto licenza Apache DUE PUNTO ZERO.Ancora Opus CINQUE PUNTO CINQUE. Un utente ha generato una scena navigabile con barca attraverso paesaggi giapponesi. Meteo dinamico, illuminazione diurna e notturna, texture realistiche, personaggi 3D. Riflessi dell’acqua, fisica, scenografia e architettura costruiti con three punto js.Da segnalare anche Circuit World. Una piattaforma EDA più MCAD AI-native per progettare, iterare, collaborare e produrre hardware in browser. Parte da oltre OTTOMILAOTTOCENTO schede esistenti, permette modifiche con IA da PCB ad assemblaggio meccanico, e invia direttamente in produzione.Sul fronte Apple, hanno rilasciato su Hugging Face un fine-tune di Qwen TRE PUNTO CINQUE-NOVE B. Trasforma documenti lunghi in piccole immagini di pagina per risparmiare token, poi recupera il testo completo solo delle pagine rilevanti alla domanda.Novità anche da OpenMausBot. Un team di agenti IA open source e self-hostable. Controllo computer completo: browser, terminale, file e desktop reale. Connettori per le app che già usi. Obiettivi, routine e progressi che continuano autonomamente. Compatibile con Claude, ChatGPT, Grok, Cursor, Nous Research, Alibaba Qwen, Kimi Moonshot e qualsiasi modello o harness tu abbia.Passiamo a Comfy Router. Un’unica API per modelli frontier di immagine, video, 3D e audio. Stesso nome modello, stessi argomenti. Nessun nuovo SDK, nessuna nuova chiave, nessun redeploy. Routing esplicito: nomini il provider, viene chiamato quel provider. Se è offline, la richiesta fallisce lì. Ogni job restituisce il provider che l’ha eseguito. Asincrono: submit restituisce immediatamente un ID richiesta. Ritenzione ventiquattro ore su input e output, poi cancellazione. Provider al lancio: Comfy, Runware, Wavespeed, Fal, Higgsfield.Sul fronte traduzione, NetEase Youdao ha rilasciato due modelli: R2T2 per ASR in tempo reale e T3PO per traduzione real-time. Entrambi supportano streaming e possono essere concatenati. Primo posto su Hugging Face nelle rispettive categorie.Chiudiamo con Audio OTTO ASR Infinite. Latenza ultra-bassa, audio illimitato, trascrizione ventiquattro su sette, senza drift. Rilevamento semantico delle pause integrato. Nuovo SOTA per ASR streaming.Trovate i link di queste notizie altri link interessanti sul mio sto ziobuddalabs punto itSalvate il video così da non perderlo, seguitemi sui miei canali social e sul nuovo podcast su spotify e mannaggia a voi se ancora non lo state facendo, condividete il video con amici e nemici e ola todos.