Holo4 non è l’ennesimo modello specializzato. Clicca sullo schermo, scrive codice, chiama API, naviga il web, controlla desktop e Android. Tutto con lo stesso modello. Non serve più scegliere la versione giusta a seconda della piattaforma.
Arriva in due versioni: 27B denso e 35B-A3B Mixture of Experts. Entrambi disponibili via API, pesi open source su Hugging Face. Licenza Apache 2.0: prendilo e facci quello che vuoi, anche commercialmente.
Un agente per tutte le interfacce
La maggior parte dei modelli agentici ha un problema di miopia: quelli addestrati per le GUI sono ciechi senza uno schermo, quelli che preferiscono le API si bloccano davanti a un’applicazione che non ne ha. Holo4 no. Usa GUI, codice, MCP, API — quello che serve per portare a casa il lavoro.
Su OSWorld raggiunge l’85,2% con il modello da 27B, a 0,08 dollari per task. Otto centesimi. Opus 5.5 arriva all’81,8% ma costa 8,48 dollari per task. Due ordini di grandezza di differenza.
I benchmark
OSWorld 2.0 è il test tosto: workflow lunghi, multi-step, roba che spezza anche i modelli migliori. Holo4 27B fa 61,7% con un success rate del 41,5%, spendendo 1,22 dollari per task. Opus 5.5 vince con l’81,8%, ma costa 8,48 dollari. GPT-6 Astra? 73,5% a 9,07 dollari.
Su AutomationBench — automazione business vera, non esercizi accademici — Holo4 27B segna 45,4% a 0,05 dollari. Opus 5 fa meglio (50,3%) ma costa 3,05 dollari.
AndroidWorld: 85,1%. ALE-CLI (workflow da esperti su Linux): 44,1% con un 19,4% di success rate. Non sono numeri da primo della classe su tutto, ma sono competitivi dove conta, a una frazione del costo.
Come l’hanno costruito
Dietro Holo4 c’è quello che chiamano Agentic Task Factory: pipeline automatiche che partono dalla documentazione — screenshot di siti reali, manuali, software open source — e costruiscono ambienti interattivi e task verificabili. Circa 10.000 task finora: 40% web app, 30% server MCP, 30% desktop e OS.
Ogni task passa una serie di gate brutali. Il verificatore deve fallire sullo stato iniziale, passare su quello finale, rifiutare ogni variante quasi-giusta. Un agente deve averlo risolto usando l’interfaccia reale. Se qualcosa non torna, loop di audit e correzione. Solo i task che superano tutto entrano nel training set.
Training in tre fasi
Prima fase: supervised fine-tuning su 127 miliardi di token. Tre quarti sono traiettorie agentiche riuscite dalla Task Factory: desktop (45%), web (14%), MCP e API (12%), mobile (3%). Il resto è reasoning multimodale, grounding GUI, tool use e coding.
Seconda fase: reinforcement learning online asincrono su task a lungo orizzonte. Addestrano due LoRA expert specializzati — uno per desktop e web, uno per terminale, MCP e API — sul modello già fine-tuned.
Terza fase: merge. I due expert si fondono nel modello base con peso uguale, senza ulteriore training. Il risultato combina le skill generali del supervised learning con quelle specializzate di ciascun expert.
L’harness che fa la differenza
Parallelamente al training hanno ricostruito l’harness — il loop che esegue le azioni del modello e gestisce il contesto per centinaia di step. Lo hanno fatto usando feedback dalle performance su OSWorld 2.0: gli agenti taggavano perché ogni task falliva, gli ingegneri revisionavano le fix.
I cambiamenti principali: una memoria affidabile che traccia centinaia di step e una shell sulla macchina desktop stessa. Tra agosto e settembre sono passati da punteggi sotto il 50% al 61,7% finale. Opus 5.5 resta davanti all’81,8%, ma il rapporto prezzo-prestazioni non è paragonabile.
Holotron4 Nano: lo stesso stack, modello più piccolo
Come membro della NVIDIA Nemotron Coalition, hanno applicato la stessa ricetta post-training al modello Nemotron 3 Nano Omni. Il risultato è Holotron4 Nano: stesso approccio generalista, dimensioni ridotte.
I guadagni sono netti. Su OSWorld passa dal 21,0% al 76,3% (+55,3 punti). Su OSWorld 2.0 dallo 0,2% al 7,9%. Su AutomationBench dal 19,4% al 35,6%. Che la ricetta funzioni così bene su un modello diverso indica che il metodo scala indipendentemente dalla taglia.
Come usarlo
Entrambe le versioni sono disponibili via H Models API. I pesi sono su Hugging Face in BF16, FP8, NVFP4 e 4-bit GGUF, insieme a Holotron4 Nano. Licenza Apache 2.0 per il modello MoE da 35B-A3B.
Holo4 27B costa 0,40 dollari per milione di token in input (0,04 cached) e 3,00 in output. Il 35B-A3B è più economico: 0,30 in input (0,03 cached) e 2,00 in output. Contesto: 256K.
Nei prossimi giorni rilasceranno anche checkpoint DSpark drafter ottimizzati per accelerare l’inferenza. Nel frattempo hanno open-sourced ogni singolo step dietro i loro score sui benchmark pubblici: replay completo su trajectories.hcompany.ai o download da Hugging Face.
Holo4 non batte i giganti closed su tutto. Ma a questo rapporto prezzo-prestazioni, ignorarlo è una scelta che va giustificata.
