Google ha svelato Gemini 4 Argon, e no, non è l’ennesimo modello che promette miracoli. Questo sistema sta già lavorando dentro Google stessa — e i numeri fanno girare la testa.
Il modello è pensato per ragionamenti complessi: software engineering serio, analisi finanziarie multi-step, redazione legale, difesa cibernetica. Roba che fino a ieri richiedeva team specializzati.
Un milione di token: sì, avete letto bene
Argon arriva con un limite di output di 1 milione di token. Si passa da 64K a 1M: il modello può generare centinaia di migliaia di token in una singola sessione, mantenendo coerenza e ragionamento profondo dall’inizio alla fine.
Non è un upgrade incrementale. È la differenza tra risolvere un problema a pezzi e affrontarlo in un colpo solo, con tutto il contesto necessario sempre attivo.
Cosa sta già facendo dentro Google
Migliaia di dipendenti Google lo usano ogni giorno. Ecco i dettagli:
Ottimizzazione quantistica: Argon ha aiutato i ricercatori del quantum computing a ottimizzare le risorse spacetime (qubit × gates) di subroutine critiche. In un caso specifico ha battuto il baseline pubblicato del 40%. In pochi minuti.
Efficienza della memoria: un team di agenti Argon ha analizzato i dati di profiling dei data center Google, identificando e applicando ottimizzazioni autonome. Risultato: oltre 300 TiB di memoria liberata, con stime tra 500 TiB e 1 PiB di risparmio totale.
Migrazioni di codice su larga scala: gli agenti Argon stanno migrando codebase C/C++ verso Rust. Decine di migliaia di righe in librerie core come re2 e libgav1, fino a oltre 800K righe per il kernel Zircon di Fuchsia OS.
Nel caso di libgav1 (il decoder video open source di Google), Argon ha preso un port Rust esistente e riscritto 32K righe di codice SIMD: un decoder memory-safe che gira 2.7x più veloce del port Rust originale, con output video identico, avvicinandosi alle performance del C++ ottimizzato.
Benchmark: dove Argon eccelle davvero
Argon segna 77.9% su DeepSWE v1.1, che misura la performance in task di software engineering reali e complessi. State of the art.
Sul Vals Index — che pesa settori come finanza, coding, legal e tax in base al loro contributo al PIL USA — Argon è in testa. Stesso discorso su Vals Finance Agent v2 (ricerca finanziaria multi-step) e sul Legal Agent Benchmark di Harvey (ricerca e drafting legale).
Su AutomationBench di Zapier, che misura l’esecuzione end-to-end su funzioni business core, Argon è al primo posto con un punteggio di 51.3%.
Su LVBench (long video understanding) arriva a 91.7%. State of the art anche lì.
Cybersecurity: trova bug che gli altri modelli non vedono
Argon è stato addestrato specificamente per la difesa cibernetica. Può trovare vulnerabilità, validarle e patchare autonomamente bug critici.
Wiz lo sta già usando attraverso la sua iniziativa Scan for Good, dedicata alla protezione di infrastrutture pubbliche critiche. In una dimostrazione iniziale, Argon ha scoperto una vulnerabilità critica che esponeva dati personali sensibili in software healthcare usato da ospedali in tutto il mondo — una falla che i modelli frontier precedenti avevano mancato.
Su CWE-bench v1 (capacità di rimediare a vulnerabilità di sicurezza) Argon pareggia al primo posto con un 68%.
Sul benchmark interno di Google per vulnerability discovery, Argon ha scoperto vulnerabilità in codebase complesse che coprono 20 linguaggi di programmazione. Sul benchmark di penetration testing black-box di Wiz — che testa la capacità del modello di analizzare sistemi web live senza accesso al codice sorgente — Argon supera 3.8 Flash Cyber nell’identificare la superficie d’attacco, scoprire vulnerabilità e produrre prove proof-of-concept per validarle.
Guardrail e sicurezza: rilascio graduale
Google distribuisce Argon in modo graduale, partendo da un gruppo ristretto di cyber defender fidati attraverso il Fairwind Program.
Le aree di focus per le salvaguardie frontier sono quattro:
Difesa contro misuse: il modello rifiuta richieste dannose (attacchi cyber o CBRN) preservando la ricerca scientifica legittima dual-use. Tecniche di monitoraggio delle attivazioni interne per individuare abusi.
Difesa contro prompt injection: Argon è il modello più resiliente di Google contro indirect prompt injection, dove istruzioni o contesti malevoli vengono usati per dirottare il comportamento del modello. Risultato: leadership sul benchmark IPI di Gray Swan.
Monitoraggio del misalignment: sistemi che monitorano la chain-of-thought e le azioni di Argon, bloccando l’esecuzione quando il modello cerca di fare qualcosa oltre le intenzioni dell’utente. Google è chiara: «Incoraggiamo fortemente il resto dell’industria a preservare la trasparenza del reasoning in questi momenti cruciali di aumento delle capacità».
Hardening dei sistemi: ambienti sandbox isolati e sigillati prima di training o valutazioni ad alto rischio. Google si impegna a condividere queste best practice con i partner.
Prezzo e disponibilità
Argon parte a $2 per milione di token in input e $10 per milione in output. Token cached al 95% di sconto sul prezzo input. Dopo il periodo introduttivo si passa a $4 e $20 rispettivamente.
Il rollout inizia con cyber defender fidati e tester selezionati, per poi espandersi a sviluppatori, enterprise e consumatori, partendo da clienti API a pagamento e abbonati Google AI Ultra.
Google collabora con il processo volontario del governo USA per l’accesso pre-release ai modelli, raccogliendo feedback prima di allargare l’accesso.
Argon è già operativo dentro Google, con migliaia di utenti interni che lo usano per task reali. Le ottimizzazioni quantistiche, le migrazioni di codice, la scoperta di vulnerabilità critiche, il risparmio di petabyte di memoria: non sono proiezioni. Sono già misurabili.
