Ola todos! ecco le notizie dedicate al mondo IA del 04 Giugno 2026Anthropic ha rilasciato un workshop gratuito di ventisette minuti su come scrivere prompt per Claude. Un corso completo, sottotitolato in spagnolo, che spiega come far lavorare agenti tra loro, distribuendo compiti ed eseguendo processi autonomamente.Microsoft ha annunciato MAI-Thinking-1, il suo primo modello di reasoning sviluppato internamente. Trentacinque miliardi di parametri attivi, novantasette percento su AIME 2025, cinquantadue punto otto su SWE Bench Pro. Competitivo con Opus quattro punto sei.Passiamo a Reve due punto zero. Il nuovo modello per immagini in quattro K introduce un sistema di layout precisi per generare e modificare qualsiasi immagine. Per la prima volta, è possibile creare immagini che si possono toccare.Google ha lanciato Gemma quattro dodici B, un modello unificato che porta ragionamento avanzato, visione e audio direttamente sul laptop. Dodici miliardi di parametri, performance vicina al modello ventisei B, tutto in sedici GB di VRAM. Architettura unificata, niente encoder separati.Cloudflare ha stretto una partnership con xAI per portare Grok su AI Gateway. Modelli LLM, audio, immagine e video ora disponibili attraverso Gateway, fatturati direttamente via Cloudflare. Niente autenticazione aggiuntiva, niente chiavi API extra.Nel frattempo, Hermes Desktop è entrato in pubblico preview. Un agente AI nativo per Mac, Windows e Linux che connette ChatGPT, GPT-cinque punto cinque, Codex e Claude Code Skills in un’unica interfaccia. MIT, gratuito, completamente open source. Jensen Huang lo ha mostrato in demo al GTC.Sempre da Google, il team di ricerca ha pubblicato SAM tre D Body. Recupera un mesh tridimensionale completo del corpo umano da una singola immagine RGB. Candidate paper per CVPR 2026. Può funzionare automaticamente o guidato con maschere e keypoint bidimensionali.Anthropic ha esaminato ottocentotrentadue account malevoli e mappato la loro attività su un database di tattiche e tecniche usate da threat actor. Obiettivo: capire quanto bene reggono le tecniche della security community contro attacchi abilitati da IA.OpenAI ha rilasciato Codex Sites. Ora chiunque può dare un’idea, un piano, una dashboard o un documento di lancio e trasformarlo in un’app interattiva con URL. Cinque esempi concreti mostrano l’intero processo dall’input al deploy.ByteDance ha pubblicato un paper su CUDA Agent. Un sistema di apprendimento agentico per rinforzo che scrive kernel CUDA meglio degli esperti umani. Fino a tre punto due volte più veloce dell’esecuzione nativa di PyTorch. Batte Claude Opus quattro punto cinque e Gemini tre Pro del quaranta percento sui modelli più complessi.Arriva anche plateau-creative-mcp, un server MCP che permette agli agenti AI di usare dati urbani tridimensionali reali del Giappone per creare scene modificabili. Open source, pubblico su GitHub.Claude Code introduce Dynamic Workflows. L’agente costruisce un harness personalizzato per ogni task al volo, decidendo come scomporre il lavoro, quali sub-agent avviare, come verificare l’output. Ogni sotto-task ottiene un contesto fresco. Solo il risultato condensato passa indietro.Google AI Edge ha rilasciato nuove app per Mac: AI Edge Gallery per generare codice e AI Edge Eloquent per dettare e modificare testo. Tutto gira localmente con Gemma quattro dodici B tramite LiteRT-LM CLI.Ideogram ha rilasciato Ideogram quattro, il suo ultimo modello per immagini open source. Nove punto tre miliardi di parametri, due versioni: FP otto e NF quattro. Trentaquattro layer DiT con text encoder Qwen tre VL otto B. Addestrato esclusivamente su caption JSON strutturate con styling per elemento, bounding box opzionali e palette di colori.Torniamo su Gemma quattro con test pratici. Atomic Chat ha confrontato Gemma quattro ventisei B-A quattro B e Gemma quattro dodici B su una RTX quattro zero nove zero. Stessa task: animazione HTML cinque canvas con fisica reale. Il ventisei B-A quattro B ha vinto su ogni scena, girato uno punto sette volte più veloce, su solo quattro B parametri attivi. Il dodici B è rimasto vicino, su metà VRAM.Da segnalare anche Amara di zero uno C. Non è uno strumento per costruire scene, è qualcosa di diverso. Trasforma un’idea semplice in un mondo vivente completo. Descrivi una città, un palazzo, una foresta: costruisce tutto attorno. Terreno, edifici, strade, interni, tutto piazzato in modo sensato. Genera asset al volo o usa i tuoi. Tutto resta modificabile.OfficeCLI è un tool che permette di creare, leggere e modificare file Word, Excel e PowerPoint direttamente da terminale, senza installare Office. Claude Code e Cursor possono controllare i file Office tramite script. Open source, leggero, ideale per automazione.Voicebox è uno studio vocale locale open source con ventinove punto due mila stelle su GitHub. Clone vocale da dieci secondi, ventitré lingue, sette motori TTS intercambiabili, editor multi-traccia per podcast e dialoghi. Totalmente locale, nessun abbonamento.Microsoft ha annunciato l’app ufficiale di OpenClaw. Permette all’agente di controllare Windows con permessi integrati, controllo totale dalla system tray, esecuzione sicura in container. Open source.Occhio a Shotcut, editor video open source con quattordici mila stelle. Timeline multi-traccia, keyframe, transizioni, export quattro K, accelerazione hardware, correzione colore. Tutto gratis. Nessuna registrazione, nessun upload, dati offline. Cross-platform.Sul fronte TTS, Miso One di Teodora. Otto miliardi di parametri, generazione vocale altamente espressiva. Emoziona come un umano, risponde più veloce: solo centodieci millisecondi di latenza. Pesi open source, API in arrivo.Rodin Gen-due punto cinque è il primo generatore AI tre D a raggiungere dieci milioni di poligoni, arrivando fino alle microstrutture della pelle. Per oggetti quotidiani: modelli da un milione di poligoni in quattro secondi.Butterbase ha aperto tutto il codice: backend open source con IA nativa integrata. Postgres con RLS, autenticazione, OAuth, storage, functions, AI Gateway, server MCP. Il backend si trasforma in tool reali per Claude, Cursor e qualsiasi agente. Self-host gratis o managed.NVIDIA ha rilasciato LongLive due punto zero. Text-to-video in tempo reale con controllo multi-shot completo. Costruisci la storia inquadratura per inquadratura, scena per scena. Disponibile su Reactor.Grok Imagine uno punto cinque Preview è arrivato. Disponibile oggi via API.Unsloth ha reso Gemma quattro dodici B eseguibile localmente con soli otto GB di RAM tramite Dynamic GGUF. Il modello supporta immagini, audio e duecentocinquantasei K di contesto. Disponibile anche su Unsloth Studio per training.Firecrawl ha introdotto Workflows, skill installabili per task web ripetibili. Oltre dieci workflow già live: ricerca approfondita, audit SEO, cloning di design di siti web. Tutto via CLI.NVIDIA ha rilasciato nuove skill per agenti AI in robotica. Isaac Mobility e altre specializzazioni automatizzano i passi di sviluppo più comuni, dalla preparazione della scena alla simulazione e apprendimento, usando librerie Omniverse, framework Isaac e dataset aperti di IA fisica.Chiudiamo con LocateAnything tre B di NVIDIA. Modello di localizzazione visiva con decodifica parallela di bounding box. Predice coordinate complete in un passo, veloce e stabile. Trova oggetti in video, riconosce interfacce UI, OCR su testo. Tre miliardi di parametri, circa sette punto otto GB, gira su GPU consumer locali.Trovate i link di queste notizie altri link interessanti sul mio sto ziobuddalabs punto itSalvate il video così da non perderlo, seguitemi sui miei canali social e sul nuovo podcast su spotify e mannaggia a voi se ancora non lo state facendo, condividete il video con amici e nemici e ola todos.