Ola todos! ecco le notizie dedicate al mondo IA del 01 Ottobre 2026Iniziamo con Google. Gemini 4 Argon. Il nuovo modello frontier costruito per ragionamento profondo su workflow complessi. Sul benchmark Artificial Analysis Intelligence Index arriva a CINQUANTATRE. Pari a GPT-6 Astra. Un punto sopra GPT-6.1 Sol. Costa SESSANTA PERCENTO in meno per task rispetto ad Astra. Due dollari in ingresso, dieci in uscita. Il limite di output? UN MILIONE di token. Dalla sua uscita, Google torna tra i primi tre laboratori al mondo per intelligenza raggiunta.Nel frattempo, RunInfra ha riscritto i kernel dietro GLM 5.3 Flash. Risultato? SEICENTOSETTANTA token al secondo su Vercel AI Gateway. Undici centesimi per milione di token in input, quarantacinque in output. Cache hit rate? NOVANTANOVE PUNTO SETTE percento nelle ultime ventiquattro ore. Ora gira anche su AMD. Stesso modello, stessa API, più capacità dietro.Passiamo a SGLang. Hanno trasformato Qwen3.8-27B in un modello multimodale di decisione. Ha battuto l’élite dei quattro e il campione di Pokémon FireRed con decisioni sotto i CENTO millisecondi dallo stato di gioco live. Con l’endpoint nativo /v1/decisions ora puoi trasformare LLM e VLM in modelli di classificazione e scoring.Arriva anche DeepSeek Harness per desktop. Disponibile su macOS e Windows. Sembra essere l’evoluzione dell’interfaccia desktop per i modelli DeepSeek.Sempre attivo, Anthropic. Hanno rilasciato uno skill per ottimizzazione dei costi API. Si chiama cost-optimize. Profila dove vanno i tuoi token, classifica le leve per risparmio, e applica prima le vittorie gratuite come caching e batch. Un diff per leva, misurato contro la tua eval.Occhio a ComfyUI. Hanno lanciato Comfy API. Punti l’API a un file JSON del workflow e gestisce tutto: risolve custom node, modelli, LoRA e dipendenze Python. Blocca tutto in una Build versionata. Crea un rilascio immutabile. Deploy come endpoint autoscaling su RTX PRO 6000, H100, H200 o B200.Sul fronte multimodale, MiniMax H3 introduce RefMod. Una tecnica che fissa la faccia di un personaggio senza LoRA training. Crei un file da circa UN megabyte in pochi minuti. La faccia rimane coerente nei video generati.Da segnalare anche Spark-X2.5-4B. Numero uno su Hugging Face. QUATTRO miliardi di parametri. Finestra di contesto nativa da UN MILIONE di token. Gira completamente offline su un laptop da sedici giga. Supporta Ollama, LM Studio e llama.cpp.Altra novità: OpenAI ha integrato MCP Events in ChatGPT. I server MCP ora possono inviare aggiornamenti real-time a ChatGPT, attivando automazioni per gli utenti. Messaggi, commenti, cambi di stato, qualsiasi evento.Segnaliamo anche Open Dots. Un’alternativa open source a OpenAI Dot. Ogni dot ha il proprio browser che resta loggato in modo sicuro. Può usare e configurare trigger su Gmail, Calendar e millecinquecento altre app. Puoi chiamarlo e dargli task mentre parli. I dot possono coordinarsi e programmare promemoria. Gira su Mac. Costa UN DECIMO rispetto alla soluzione di OpenAI.Chiudiamo con Echo di Fulcrum. Un modello di scrittura specializzato nell’imitazione di stile. Batte i modelli frontier su task di scrittura che vanno dalla fiction alle spiegazioni tecniche. Costo di training? Meno di CINQUEMILA dollari.Trovate i link di queste notizie altri link interessanti sul mio sto ziobuddalabs punto itSalvate il video così da non perderlo, seguitemi sui miei canali social e sul nuovo podcast su spotify e mannaggia a voi se ancora non lo state facendo, condividete il video con amici e nemici e ola todos.