Anthropic ha rilasciato Claude Opus 5.5, e i numeri parlano chiaro: prestazioni vicine a quelle di Fable 5.1, ma con un costo operativo inferiore del 40%.
È il primo modello dall’annuncio del ‘pacing the frontier’ — rallentiamo un attimo e assicuriamoci che la sicurezza resti davanti alle capacità. Prima del rilascio, Opus 5.5 è stato testato da valutatori esterni come Frontier Design e METR. Sul fronte alignment, ha registrato i punteggi più alti mai visti nei test comportamentali automatizzati di Anthropic, e arriva con tutte le protezioni sviluppate per i loro modelli più potenti.
Cosa cambia davvero
Prestazioni
Opus 5.5 è un salto netto rispetto a Opus 5. Gli early tester hanno visto miglioramenti sostanziali sui task più complessi. Un esempio: uno ha completato una migrazione di codice da 680.000 righe in meno di un giorno — quella roba che a un team di ingegneri avrebbe richiesto settimane.
Sul fronte ottimizzazione software, quando gli è stato chiesto di ridurre i tempi di caricamento su tutte le pagine di una web app, Opus 5.5 ha avuto successo 39 volte su 40. Opus 5 faceva miglioramenti più modesti che però alteravano il comportamento dell’app: ti sistemo una cosa, te ne rompo un’altra.
Un altro tester ha fatto costruire un gioco a diversi modelli Claude partendo da un singolo prompt. Opus 5.5 ha ottenuto il punteggio più alto per qualità grafica e rifinitura.
Sicurezza: meno casino, più controllo
Opus 5.5 ha ottenuto i migliori punteggi mai registrati nell’audit comportamentale automatizzato di Anthropic, un test che simula migliaia di scenari. È molto meno propenso a prendere azioni difficili da invertire o ad agire fuori dai limiti assegnati. Resiste meglio di Opus 5 al prompt injection, la tecnica con cui qualcuno prova a manipolare un modello infilandogli istruzioni nascoste.
I test di alignment sono stati ampliati per coprire task più lunghi, task impossibili e scenari modellati su incidenti reali. Ha dei limiti, certo — i dettagli completi sono nella System Card di Opus 5.5.
Siccome Opus 5.5 è comparabile a Claude Mythos 5.1 in biologia e cybersecurity, viene rilasciato con protezioni simili a quelle di Fable 5.1. Le organizzazioni verificate possono fare domanda al Life Sciences Verification Program per usare Opus 5.5 nella ricerca biologica. Nelle prossime settimane verrà ampliato anche l’accesso al Cyber Verification Program per i professionisti della cybersecurity verificati.
Costi e velocità
Opus 5.5 richiede meno potenza di calcolo rispetto a Opus 5, e i prezzi riflettono questa differenza. Con le impostazioni predefinite costerà il 40% in meno sui carichi di lavoro tipici.
I numeri: input e output token costano 4 e 20 dollari per milione, il 20% in meno di Opus 5. Le letture da cache — che costituiscono la maggior parte dei costi nel lavoro agente e di coding — costano 0,20 dollari per milione di token, il 60% in meno. Opus 5.5 genera output oltre il 30% più velocemente di Opus 5.
Anthropic sta anche aumentando i limiti di utilizzo sui piani Pro, Max, Team ed Enterprise basati su posti. Gli utenti con abbonamento ottengono un reset del rate limit che possono salvare e usare quando vogliono.
Comunicazione più umana
Opus 5.5 comunica in modo più naturale rispetto ai modelli precedenti. Gli early tester hanno trovato la sua scrittura più chiara e facile da seguire — risposta diretta a uno dei feedback più comuni su Opus 5. Mette le informazioni più importanti in primo piano, il che lo rende un partner di lavoro migliore nelle sessioni lunghe. Come ha detto un tester: ‘scrive come scrivo io’.
Per Anthropic, questo ha reso il lavoro di Opus 5.5 più facile da seguire e verificare — un vantaggio per la sicurezza oltre che pratico.
Claude Sonnet 5.5 e Claude Haiku 5.5 arriveranno nelle prossime settimane, con molti degli stessi miglioramenti in prestazioni, efficienza e sicurezza.
I numeri sui benchmark
Sui benchmark di Anthropic, Claude Opus 5.5 guida in coding agente, computer use e knowledge work. A questi livelli di capacità, però, i margini sui benchmark sono diventati una guida meno affidabile sulle differenze nel mondo reale. Nell’uso interno di Anthropic, il divario tra Opus 5.5 e Claude Fable 5.1 è più stretto di quanto i punteggi suggeriscano.
Su Terminal-Bench 4.0, che misura quanto bene un modello completa task professionali complessi e multi-step in un’interfaccia a riga di comando, Opus 5.5 raggiunge il 66,4%. Fable 5.1 si ferma al 55,8%, Opus 5 al 52,3%, GPT-6 Astra di OpenAI al 57,9%.
Su FrontierCode v1.1, che misura se le modifiche al codice di un agente verrebbero accettate in un merge, Opus 5.5 segna 54,4%. Fable 5.1 arriva al 50,3%, Opus 5 al 48,0%, GPT-6 Astra al 53,3%.
Su GDPval-AA v2.1, un test di lavoro reale su 44 professioni, Opus 5.5 ottiene 1846 Elo, davanti a Fable 5.1 (1735) e Opus 5 (1708). GPT-6 Astra segna 1542.
Il vantaggio più netto di Opus 5.5 è nell’efficienza: costa meno per token rispetto a Opus 5 e usa meno token per task, per una riduzione complessiva dei costi del 40%.
Coding: migrazioni e audit su scala
Opus 5.5 è particolarmente bravo nei lavori lunghi e complessi come migrazioni e audit su intere codebase. Un early tester lo ha usato per fare audit e correggere una codebase da 200.000 righe in meno di tre ore. Opus 5 ci aveva messo oltre 20 ore e aveva usato 2,5 volte più token.
In un test interno, Anthropic ha chiesto a Opus 5.5 e Fable 5.1 di tradurre HAProxy — software ampiamente usato per bilanciare i carichi di traffico web tra server — da C a Rust. Entrambe le riscritture hanno passato quasi tutti i test di regressione di HAProxy, ma Opus 5.5 ha finito in 9,5 ore contro le 12 di Fable 5.1 ed è costato il 51% in meno.
Sul coding agente, Opus 5.5 batte GPT-6 Astra su FrontierCode al suo livello di sforzo predefinito a circa il 20% del costo per task. Su Terminal Bench 4.0 eguaglia Astra per circa il 40% del costo, mentre su CursorBench batte GPT-5.6 Sol di 11 punti per circa un terzo del costo.
GitHub ha testato Opus 5.5 su Copilot CLI e VS Code. Mario Rodriguez, Chief Product Officer: ‘In VS Code, ha risolto più task terminali di Opus 5 in meno della metà dei passaggi. Più che rendere i singoli task più efficienti, sta rendendo i progetti più grandi degli sviluppatori più realizzabili’.
Sean Heintz di Clio, Staff Software Developer: ‘Gli ho dato un grande task ingegneristico su sei dei nostri repository e l’ho lasciato girare tutta la notte, senza supervisione. È rimasto sul task per oltre 18 ore definendo come i nostri servizi comunicano tra loro. Rispetto a Opus 5, ha raggiunto le milestone più velocemente e ha richiesto rielaborazioni minime. I suoi commenti al codice erano brevi e utili invece che lunghi e prolissi. Fatico a trovare qualcosa di negativo da dire’.
Sicurezza nel coding agente
Le aziende che usano agenti nei loro sistemi devono sapere che quegli agenti operano come previsto, specialmente quando girano in autonomia per molte ore. Opus 5.5 ha un classificatore che controlla ogni azione prima che venga eseguita, una sandbox open-source che i team di sicurezza possono verificare, e code review che cattura le vulnerabilità prima del merge.
Sugli attacchi di prompt injection, eguaglia o batte Opus 5 in ogni scenario testato, inclusi coding, tool use, computer use e web browsing. Su un benchmark gestito dalla società di sicurezza AI Gray Swan, Opus 5.5 eguaglia Fable 5.1 per il tasso di successo di prompt injection più basso tra tutti i modelli testati.
Knowledge work: ricerca e analisi affidabile
In un test interno, Anthropic ha chiesto a Opus 5.5, Fable 5.1 e Opus 5 di scrivere un report sulla performance trimestrale di un’azienda usando solo le informazioni disponibili su una copia del web dove il comunicato sugli utili era difficile da trovare. Un valutatore automatico ha controllato ogni cifra e citazione rispetto alle fonti. Su diversi livelli di sforzo, 16 dei 18 report di Opus 5.5 hanno superato la soglia di qualità — dove qualsiasi cifra o citazione inventata sarebbe stata un fallimento. Né Fable 5.1 né Opus 5 hanno superato quella soglia in alcun tentativo.
Walleye Capital, una società di investimento e early tester, ha riportato che Opus 5.5 ha sostanzialmente risolto la loro suite di valutazione alla sua impostazione più bassa. A impostazioni più alte ha fatto ancora meglio, notando un errore nelle loro istruzioni di valutazione e correggendolo. Nessun altro modello aveva catturato quell’errore prima.
In un altro test, Anthropic ha dato a Opus 5.5 e Opus 5 il compito di analizzare una proposta di fusione tra due società fittizie di software HR: costruire un modello finanziario in Excel, poi trasformarlo in una presentazione esecutiva per valutare se l’accordo aveva senso a quel prezzo. Entrambi i modelli sono arrivati alle stesse conclusioni, ma il modello di Opus 5.5 era più approfondito e la presentazione più leggibile, mentre quella di Opus 5 aveva errori minori. Opus 5.5 ha finito in 63 minuti contro i 93 di Opus 5 ed è costato il 50% in meno.
Su GDPval-AA v2.1, un test di lavoro reale su 44 professioni, Opus 5.5 segna 1846 Elo, davanti a Fable 5.1 e Opus 5. Al livello di sforzo predefinito, batte GPT-6 Astra al massimo sforzo per circa un quinto del costo per task.
Frank Corrao di Walleye Capital, Head of Central Equity Quant Research Engineering: ‘Nella ricerca quantitativa, un’assunzione sbagliata può minare un risultato. Alla sua impostazione di sforzo più bassa, Claude Opus 5.5 ha sostanzialmente risolto il nostro task di valutazione. A impostazioni più alte è andato ancora oltre: ha rilevato che l’indicizzazione dei minuti nelle nostre stesse istruzioni era sfalsata di uno e ha corretto, notando che questo gli sarebbe costato punti con il valutatore. Aveva ragione, e nessun modello che abbiamo testato aveva catturato e agito su questo prima’.
Sicurezza e allineamento
Rallentare la frontiera
La scorsa settimana, il CEO di Anthropic Dario Amodei ha sostenuto che il progresso dell’AI dovrebbe essere rallentato in modo che le pratiche di sicurezza restino avanti rispetto alle capacità dei modelli. Il ‘pacing’ è un approccio per mantenere l’AI sicura, restare competitivi con la Cina e realizzare i benefici dell’AI, in particolare in aree come biologia e medicina.
Anthropic comprende in gran parte i rischi presentati dai modelli di oggi ed è attrezzata per gestirli. Rischi più seri potrebbero però emergere rapidamente man mano che le capacità migliorano, e devono prepararsi ora. Il loro lavoro sulla sicurezza avviene quindi su due orizzonti temporali contemporaneamente.
Primo: pratiche di sicurezza per i modelli attuali. La generazione attuale si basa su test di allineamento estensivi, valutazione pre-rilascio da parte di organizzazioni esterne come METR e Frontier Design, e protezioni abbinate alle capacità di ciascun modello in aree ad alto rischio come cybersecurity e biologia.
Secondo: prepararsi per i modelli futuri. Anthropic sta affinando i suoi processi di addestramento e valutazione in previsione di modelli più avanzati. Sta stringendo come filtra gli ambienti usati nel reinforcement learning, dato che ambienti difettosi sono una fonte importante di comportamento disallineato. Sta anche migliorando le ricompense di allineamento e sviluppando processi automatizzati per produrre scenari nuovi e diversi per l’addestramento sulla sicurezza.
I modelli con capacità maggiori — come quelli che possono automatizzare completamente il lavoro di ricerca AI — richiedono uno standard di sicurezza ancora più alto. Le richieste di rallentamento di Anthropic erano basate in gran parte sull’aspettativa che tali modelli potrebbero essere addestrati presto. Per questi modelli, non assumono che le misure descritte sopra soddisferanno quello standard da sole.
Allineamento: i numeri
Sulla loro suite di valutazione primaria, un audit comportamentale automatizzato che valuta Claude in quasi 2.000 scenari, Opus 5.5 ha ottenuto punteggi migliori di qualsiasi recente modello Claude su quasi ogni misura di comportamento disallineato. È anche il loro modello più forte sulla maggior parte delle misure di onestà.
Opus 5.5 migliora rispetto ai modelli precedenti su diversi comportamenti che hanno contribuito a recenti incidenti di cybersecurity, inclusi ragionamento distorto o motivato, tentativo di fuga da una sandbox, e azioni dannose dopo aver concluso di essere in un ambiente simulato. In una nuova valutazione progettata per testare la propensione di un modello ad attraversare confini di contenimento, Opus 5.5 ha tentato di aggirare i confini circa l’85% in meno rispetto a Opus 5 o Claude Mythos 5.1, e ogni tentativo era di bassa gravità e auto-segnalato.
Costruire valutazioni che catturano affidabilmente ogni fallimento prima del deployment rimane però un problema irrisolto. Anthropic vede segnali che Opus 5.5 spesso sospetta di essere valutato, il che complica la loro capacità di prevedere come si comporterà nella vasta varietà di contesti reali in cui viene distribuito.
Protezioni
Opus 5.5 è il primo modello Opus a lanciare con una classe simile di protezioni a Fable 5.1 su cybersecurity, biologia e distillazione, tutte con fallback trasparente a un altro modello.
Cybersecurity: poiché Opus 5.5 ha capacità cyber estremamente forti, Anthropic applica protezioni simili a quelle di Fable 5.1. Gli utenti possono identificare e correggere bug nel loro codice come parte del normale ciclo di sviluppo software, ma la maggior parte dei task di cybersecurity viene re-indirizzata a Opus 4.8. Per i cyberdefender, nelle prossime settimane il Cyber Verification Program verrà espanso per includere Opus 5.5, con tre livelli per accesso fidato progressivamente più permissivo.
Biologia: Opus 5.5 supera Opus 5 e eguaglia o batte Claude Mythos 5.1 in molte aree di lavoro biologico, quindi usa le stesse protezioni di Fable 5.1. Per usare Opus 5.5 per lavoro di ricerca e sviluppo ostacolato da queste protezioni, gli utenti possono fare domanda al nuovo Life Sciences Verification Program, che dà alle organizzazioni verificate come laboratori accademici, startup e aziende farmaceutiche accesso a protezioni progettate per l’intera gamma di lavoro relativo alla biologia.
Distillazione: gli attacchi di distillazione, in cui gli attaccanti usano migliaia di account falsi per estrarre le capacità di un modello su scala industriale, creano rischi per la sicurezza e la sicurezza nazionale. La distillazione permette ai malintenzionati di creare modelli altamente capaci senza le protezioni che Anthropic costruisce in Claude. Il loro report di threat intelligence di settembre 2026 dettaglia l’attività di distillazione illecita rilevata e interrotta finora.
Opus 5.5 lancia con ‘preserved thinking’, la protezione anti-distillazione introdotta con Fable 5.1. Impedisce agli utenti API di modificare il contesto precedente di Claude nel tentativo di estrarne il ragionamento. Si applica a Fable 5.1 e Opus 5.5 per gli account API creati il 31 agosto 2026 o dopo.
Disponibilità
Claude Opus 5.5 è ora disponibile su tutte le piattaforme, inclusi Amazon Web Services, Google Cloud e Microsoft Azure. Sulla Claude Platform, gli sviluppatori possono iniziare con ‘claude-opus-5-5’.
Come tutti i modelli Opus precedenti, Opus 5.5 è disponibile con retention dei dati zero. Come per Fable 5.1, viene fornito con misure di watermarking per conformarsi all’EU AI Act. E non è più disponibile con la modalità ‘thinking’ disattivata.
Claude Sonnet 5.5 e Haiku 5.5 seguiranno nelle prossime settimane.
