Ola todos! ecco le notizie dedicate al mondo IA del 02 Agosto 2026Iniziamo con OpenAI: il modello Astra potrebbe uscire nelle prossime settimane. Progettato per flussi multi-agente a lungo termine. Già dimostrato ai politici di Washington. Ha generato dieci scoperte in matematica e informatica. Potrebbe chiamarsi GPT-6, GPT-5.7 o semplicemente Astra.Nel frattempo, Microsoft ha rilasciato Skill Recorder: registri lo schermo mentre fai un task, il sistema converte tutto in documentazione e automazione. Non ripete coordinate del mouse. Trasforma azioni in API e comandi stabili. Compatibile con Microsoft Scout e Microsoft 365 Copilot Cowork.Passiamo a una tecnica che permette di eseguire modelli enormi su GPU ridotte: solo una layer alla volta in memoria. Kimi K3 da due virgola otto trilioni di parametri gira sotto quattro GB di VRAM. DeepSeek-V3 su dodici. Llama 3.1 405B su otto. Open source.Da segnalare anche Comp AI: hanno rilasciato il loro CRM interno come open source. Agenti di ricerca duraturi integrati. Licenza MIT. Costruito su Next, Eve e Context.InVideo lancia Playbooks su Agent Two: definisci regole che l’agente deve seguire. Tre livelli di intelligenza: Ultra, Pro e Lite. Velocità quadruplicata, costo dimezzato.Occhio a un test comparativo tra DeepSeek V4 Flash, Kimi K3 e GLM 5.2: stesso prompt, risultati diversi. Kimi K3 primo con nove punto cinque su dieci, costo sette centesimi. DeepSeek V4 Flash ultimo ma centocinquanta volte più economico.NVIDIA ospita oltre cento modelli frontier gratuitamente: chiave API perpetua senza costi. GLM 5.2, Kimi K2.7, DeepSeek V4 Pro disponibili. Limite: quaranta richieste al minuto.Sempre attivo, qualcuno ha trasformato l’interfaccia web gratuita di Gemini in un’API compatibile OpenAI: gira in locale, nessun costo, accesso a Gemini 3.6 Flash. Un file Python, nessuna chiave richiesta.Arriva anche UniFace: libreria Python che unifica rilevamento volti, riconoscimento, tracking, landmark, stima dello sguardo e anti-spoofing. Accelerazione hardware integrata.Sul fronte agent engineering, IBM ha pubblicato un workshop di quaranta minuti: ottanta percento della costruzione di un agente non riguarda il modello. Framework, tool, skill e controlli di rischio sono centrali.Troviamo su GitHub uno strumento che indicizza l’intera codebase una volta sola: caricamento del contesto da sessantaquattromila token a duemilaquattrocento. Riduzione del novantasei percento. Grafo delle dipendenze su sedici linguaggi. Quattromila stelle.Segnaliamo anche due SDK open source per riconoscimento facciale: detection, landmark, embedding e confronto di similarità. Tutto on-premise.Passiamo a AirLLM: carica una sola layer alla volta in GPU. Kimi K3 gira sotto quattro GB senza quantizzazione. Ventiquattromila stelle.Un utente ha eseguito DeepSeek V4 Flash 0731 su M5 Max con Metal: generazione tra trentacinque e trentanove token al secondo. Versione quantizzata da novantuno GB.Colpo a sorpresa da Andrej Karpathy: ha rilasciato autoresearch. Ottimizza qualsiasi processo misurabile. L’agente modifica il codice, esegue, mantiene i miglioramenti, ripristina i fallimenti. Tobi Lütke lo ha usato su Liquid, motore di templating di Shopify: novantatré commit, tempo ridotto del cinquantatré percento.Troviamo su GitHub jcode: harness per coding agent che avvia duecentoquarantacinque volte più veloce di Claude Code. Primo frame in quattordici millisecondi. Grafo di memoria semantico. Oltre trenta provider. Modalità swarm e self-dev. Scritto in Rust.Sempre nel mondo AI, Semantica è un’alternativa open source al layer di intelligence aziendale di Palantir: grafi di contesto, ragionamento spiegabile, audit trail permanente.Merita attenzione un endpoint pubblico gratuito per DeepSeek V4 Flash 0731: nessun account, nessuna carta. Compatibile OpenAI. Ottantadue punto sette su terminal-bench. Cinquantaquattro punto quattro su SWE-bench. Limite: dodici richieste al minuto per IP.Google ha pubblicato un paper su Memory Caching: RNN con capacità di memoria dinamica. Complessità lineare, prestazioni da Transformer. Chiude il gap storico delle reti ricorrenti.Un ingegnere di Anthropic ha pubblicato un workshop di oltre due ore su Graph Engineering: RAG e grafi, nodi ed edge, indexing, self-verifying adaptive RAG.Proseguiamo con Audio8 TTS Preview zero punto sei B: modello compatto per sintesi vocale. Gira su CPU con ONNX Runtime. Un GB di memoria. Undici lingue. Zero-shot voice cloning.Un repository molto seguito raccoglie ogni API LLM gratuita su internet: Google AI Studio, Groq, Cerebras, Cloudflare, Cohere, Mistral. Ventottomila stelle. Limiti aggiornati costantemente.MoneyPrinterTurbo è un progetto con oltre centomila stelle: genera video brevi automaticamente da un tema. AI scrive la sceneggiatura, cerca materiali, aggiunge voce, sottotitoli e musica. Supporta YouTube Shorts, TikTok, Reels. Open source, licenza MIT.Seedance 2.5 clona voce e immagine da una foto e un clip audio: genera walkthrough video da un prompt unico.Il team openPangu ha rilasciato openPangu-2.0-Pro: modello MoE da cinquecentocinque miliardi di capacità, diciotto miliardi attivi per token. Contesto di cinquecentododici K. Novantacinque punto quattro su AIME 2026. Open source.Andrew Ng ha pubblicato un corso di un’ora su Graph Engineering: costruzione di grafi, architettura multi-agente, automazione completa.Chiudiamo con sol-advisor per Codex: plugin che orchestra GPT-5.6 Sol High, GPT-5.6 Luna Max e GPT-5.6 Terra Max. Distribuzione del carico tra modelli. Open source, gratuito.Trovate i link di queste notizie altri link interessanti sul mio sto ziobuddalabs punto itSalvate il video così da non perderlo, seguitemi sui miei canali social e sul nuovo podcast su spotify e mannaggia a voi se ancora non lo state facendo, condividete il video con amici e nemici e ola todos.