Aikido ha appena rilasciato Altar, e no, non è l’ennesimo modello AI di sicurezza che gira su cloud altrui. È un open-weight model pensato per girare completamente dentro la tua infrastruttura. Anche se quella infrastruttura è completamente air-gapped, senza un filo di connessione verso l’esterno.
Il problema che Altar risolve è semplice da capire ma difficile da sistemare: i modelli frontier più capaci girano sui server di qualcun altro. Il che significa che il tuo codice sorgente, la documentazione dell’architettura interna, le vulnerabilità ancora non rimediate — tutto esce dalla tua rete. Per una banca con mandati di residenza dati, un gruppo ospedaliero con regole rigidissime sul trattamento dati, o un operatore industriale il cui ambiente OT non ha rotte verso internet, non è un compromesso che puoi permetterti.
Il gap di deployment che nessuno vuole ammettere
Gli open-weight model più capaci sono enormi. GLM-5.3, uno dei modelli con le migliori performance nei benchmark di sicurezza di Aikido, pesa 1,51 TB a piena precisione. La quantizzazione lo riduce a 488 GB. Ancora troppo per deployment di produzione scalabili, con agenti che consumano contesto in parallelo e si contendono la memoria GPU.
Il motivo è architetturale. Molti di questi modelli usano mixture-of-experts: una moltitudine di piccole reti neurali specializzate, ciascuna chiamata ‘esperto’. Solo una manciata di esperti si attiva per ogni token, ma l’intero pool deve comunque essere caricato in memoria. Paghi un costo enorme di infrastruttura per capacità che contribuisce poco o nulla al workload che stai effettivamente eseguendo.
Il lavoro di security — review del codice per vulnerabilità, proposte di patch, penetration test — usa solo una piccola fetta di quel pool di esperti. Ma il costo in memoria non si riduce di conseguenza: ogni richiesta carica il modello completo, che sia rilevante o no per il task.
Da 1,51 TB a 328 GB: pruning degli esperti
Aikido è partita da GLM-5.3 e ha applicato quantizzazione e pruning. Il pruning degli esperti rimuove alcuni esperti dal modello, cancellando interi blocchi di pesi e aggiustando il routing così che ogni token scelga solo tra quelli rimasti. La rimozione in sé è meccanica. Decidere quali esperti rimuovere è la parte difficile.
Per capire cosa tenere, hanno usato trace dal loro harness di pentesting interno che girava benchmark: codice, tool call e risposte che gli agenti attraversano durante un pentest completo. Dati rappresentativi per guidare la selezione degli esperti, senza toccare dati dei clienti.
La tecnica scelta è Cerebras REAP (Router-weighted Expert Activation Pruning). REAP stima il contributo di ogni esperto usando sia il peso del router sia la magnitudine del suo output. Non basta contare quante volte viene selezionato: bisogna guardare quanto conta davvero quando viene scelto.
Hanno anche aggiunto testo multilingue per preservare le capacità linguistiche. Investigare un’applicazione significa capirne feature, regole di business e workflow, anche quando documentazione o interfaccia sono in francese, olandese o altre lingue.
I numeri finali
Altar trattiene 168 dei 256 esperti originali in ogni layer backbone, rimuovendone 88, il 34,4%. Il router seleziona ancora otto esperti per token, ma da un banco più piccolo. La quantizzazione AWQ INT4 aveva già portato il modello da 1.506,7 GB (BF16) a 488,2 GB. Il pruning rimuove altri 160 GB, una riduzione del 32,8% rispetto al modello già quantizzato.
Risultato: 328 GB totali. Il 78,2% in meno rispetto al modello originale a piena precisione.
E le capacità di identificazione vulnerabilità?
Aikido ha un benchmark CVE interno: 32 vulnerabilità note su 30 repository, tre run per caso. Altar ha ottenuto in media il 60,4% di recall per run e ha riscoperto 23 delle 32 vulnerabilità almeno una volta nelle tre run.
Per confronto: GLM-5.3 quantizzato AWQ ha fatto 61,5% di recall medio con le stesse 23 vulnerabilità coperte. Il GLM-5.3 originale a piena precisione: 65,6% di recall medio, 25 vulnerabilità su 32 coperte.
Ridurre il checkpoint già quantizzato da 488 GB a 328 GB ha portato a circa un punto percentuale in meno di recall medio rispetto al baseline AWQ, mantenendo la stessa copertura di vulnerabilità. Rispetto al parent originale, Altar ha tenuto 23 delle 25 vulnerabilità coperte (il 92%), con un calo di 5,2 punti percentuali nel recall medio.
Il 92% della copertura di vulnerabilità del parent, con il 33% in meno di storage. Esattamente il tradeoff che cercavano.
Altar è stato deployato sulla flotta Aikido Machine subito dopo questi test. Poco dopo ha identificato una vulnerabilità critica durante un pentest di produzione per un cliente.
Cosa viene dopo
Sul fronte compressione, stanno esplorando formati a bit più bassi come EXL3, che potrebbe permettere di trattenere più esperti, insieme a ottimizzazioni di serving su H200. Il passo successivo è il fine-tuning per workflow di sicurezza specifici: migliorare l’uso di tool e il ragionamento a lungo orizzonte, e costruire una pipeline self-learning guidata dai benchmark interni per plasmare i modelli futuri.
Quel lavoro coprirà vulnerability research, code analysis, remediation e altri workflow di sicurezza difensiva.
Altar si deploya su un nodo 4-H200 con l’ultima versione di vLLM. I pesi sono disponibili sotto l’organizzazione Aikido. Licenza, flag di serving e istruzioni di deployment nel model card.
L’approccio si estende su tutta la linea prodotti Aikido: Attack (AI pentesting), Code Security Audit, Deep PR Review. Modelli che migliorano nel tempo senza perdere il vincolo che conta: i difensori devono poterli far girare interamente dentro gli environment che proteggono.
