Claude Haiku 5.5: il modello piccolo che costa il 75% in meno e va più veloce di tutti

Anthropic ha rilasciato Claude Haiku 5.5: costa il 75% in meno della versione precedente, è il modello più veloce che abbiano mai fatto, e spacca su tutti i benchmark che contano. Non male per un modello pensato per fare il lavoro sporco.

Haiku 5.5 è costruito per i compiti ad alto volume dove ogni centesimo conta. Riassunti, compattazione dati, query al database, classificazione — tutto quel lavoro ripetitivo che non ti fa dormire la notte quando guardi la bolletta API. Funziona bene come subagente per Opus 5.5 e Sonnet 5.5 sui task di coding. E siccome è velocissimo, diventa la scelta ovvia per supporto clienti live e uso del browser.

I numeri che contano

Su GDPval-AA v2.1 — quello che misura il lavoro professionale vero attraverso 44 occupazioni diverse — fa 1620 punti. Haiku 4.5 si fermava a 735. GPT-6 Luna a 1437. Sonnet 5.5 domina a 1840, ma non è questo il punto: Haiku 5.5 non vuole essere il più intelligente della classe.

Su AA-Briefcase v1.1 raggiunge 1578 contro i 614 della versione precedente. Un salto che fa girare la testa. E poi c’è OSWorld 2.1, il benchmark che testa quanto bene un agente sa usare un computer vero per completare task lunghi e articolati: 72,4% nel subset offline. Haiku 4.5 faceva 15,7%.

Sul fronte del coding agente, Terminal-Bench 4.0 segna 39,2%. Non è il 70,6% di Sonnet 5.5, chiaro. Ma per task più ristretti, quelli che prima erano troppo costosi da far girare, cambia tutto. FrontierCode 1.1 (Main) lo porta a 46,4%, praticamente alla pari con GPT-6 Luna al 42,4%.

L’effort setting: decidi tu quanto farlo pensare

Haiku 5.5 è il primo modello Haiku con un’impostazione di effort regolabile. Puoi scegliere se ottimizzare per il costo o per l’intelligenza, su cinque livelli: Low, Medium, High, Xhigh, Max.

Prendete OSWorld. A effort Low costa pochi centesimi per tentativo ma ti dà prestazioni base. A Max ti avvicini alle performance di Sonnet 5.5, pagando di più. Per un riassunto veloce vai Low. Per qualcosa di più critico spingi su High o Xhigh.

Cosa dicono quelli che l’hanno provato davvero

Asana lo ha testato su AI Teammates, il loro prodotto agente: oltre il 30% di riduzione nella latency per completare i task, fino a 2,5 volte più veloce per singolo turno. «È un’esperienza notevolmente più scattante», dice Aaron Vinh, Staff Software Engineer.

HubSpot l’ha messo alla prova su task CRM usando portali simulati. Haiku 5.5 ha ottenuto 92,8% di media su tre run — il punteggio migliore che abbiano mai visto. Su un task particolarmente ambiguo (identificare record obsoleti ma poco chiari) è stato il più veloce a completarlo, con il miglior hit rate e il minor tasso di falsi positivi.

AlphaSense lo usa per Ask in Document, che fa circa 8 milioni di chiamate a settimana in produzione: domande molto specifiche su uno o pochi documenti. Su 400 query di test, Haiku 5.5 ha segnato 0,84 contro lo 0,76 di Haiku 4.5. Differenza statisticamente significativa, dicono. Quando fai 8 milioni di chiamate, ogni decimale conta.

Box AI lo vede bene su lavoro analitico su larga scala: report sui costi, riassunti finanziari, review ricorrenti settimanali. Nei loro test ha segnato 11 punti in più di Haiku 4.5 con circa metà della latenza.

Quanto costa, davvero

Il pricing scala in base alla lunghezza del prompt. Per richieste fino a 100k token (circa il 90% delle richieste al vecchio Haiku): cache reads a $0,01 per milione di token, input a $0,10, output a $0,50. Oltre i 100k token: $0,05 per cache reads, $0,50 per input, $2,50 per output.

Rispetto a Haiku 4.5, per richieste sotto i 100k costa il 90% in meno. Il 90%. Oltre i 100k la riduzione è del 50% — anche tenendo conto che il tokenizer aggiornato (simile a quello di Sonnet 5.5 e Opus 5.5) consuma leggermente più token per task.

In più, Anthropic ha dimezzato il prezzo delle cache reads su Sonnet 5.5: da $0,20 a $0,10 per milione di token. Siccome le cache reads costituiscono una grossa fetta del consumo, questo riduce il costo di Sonnet 5.5 su task agenti di circa il 20%.

Sicurezza e allineamento

Haiku 5.5 migliora su quasi tutte le valutazioni di allineamento rispetto a Haiku 4.5: meno comportamenti disallineati, minor disponibilità a collaborare con usi impropri. I dettagli sono nella system card del modello.

Le protezioni per cybersecurity sono più restrittive di Haiku 4.5, ma un po’ meno di quelle applicate agli altri modelli recenti. Permettono un range più ampio di task difensivi rispetto a Sonnet 5.5, ma bloccano penetration testing e altre tecniche più probabilmente usate da attaccanti.

Per la biologia, stesse protezioni di Sonnet 5, 5.5 e Opus 5: domande di ricerca ok, richieste che potrebbero causare danni bloccate. Chi lavora su attività più estese può fare domanda ai programmi di verifica Life Sciences e Cyber.

Disponibilità e aggiornamenti

Haiku 5.5 è disponibile ora su AWS, Google Cloud e Azure. Sulla Claude Platform si accede con claude-haiku-5-5. C’è una guida alla migrazione per chi viene dalle versioni precedenti.

Novità per gli abbonati Max e Team: crediti API mensili per sperimentare con tool, app e agenti. Max 5x riceve $100 al mese, Max 20x riceve $200, Team fino a $500 condivisi tra gli utenti. Utilizzabili su qualsiasi modello.

Gli SDK Python e TypeScript sono stati aggiornati per supportare computer use e browser use in beta. Haiku 5.5, veloce e economico, è particolarmente adatto a questi task.

Cognition lo ha già integrato in Devin Fusion come sidekick. Con Haiku 5.5 in quel ruolo, Fusion tiene un punteggio FrontierCode di 66,2 tagliando costi e latenza. «Puoi provarlo oggi nella Devin CLI con Opus 5.5 come lead», dice Walden Yan, co-founder e CPO.

Se avete workload ad alto volume dove velocità e costo fanno la differenza, Haiku 5.5 merita un test. I numeri ci sono, le testimonianze pure.

AI LABELS_3x2_3_black