Cerebras ha appena alzato l’asticella. E non di poco.
Il nuovo CS-4 è un rack-scale system che promette fino a 30 volte la velocità delle soluzioni GPU nella generazione di token. Trenta. Non tre, trenta. Parliamo di oltre 4.400 token al secondo per utente su GPT-OSS-120B — il tipo di numero che fa girare la testa e che cambia completamente le carte in tavola per chi deve gestire inference in produzione.
Tre wafer, un’architettura completamente nuova
Il CS-4 è costruito attorno a tre Wafer Scale Engine 3 Turbo (WSE-3T). Ogni wafer contiene quattro trilioni di transistor e 900.000 core ottimizzati per AI sparsi su 46.225 millimetri quadrati di silicio. Sì, avete letto bene: millimetri quadrati, non chip separati. Un singolo wafer, enorme.
Il risultato? 750 PFLOPS di potenza di calcolo AI, 7.2 terabit al secondo di I/O, e — qui viene il bello — 129.6 petabyte al secondo di bandwidth di memoria. Perché alla fine è la memoria il collo di bottiglia, non il compute puro. E Cerebras lo sa benissimo.
Il doppio della velocità del CS-3
Rispetto al predecessore CS-3, siamo al doppio della velocità. Ma non è solo questione di numeri grezzi: l’efficienza energetica fa un salto fino a 10x in più di throughput per watt. Il che, tradotto in termini di data center, significa costi operativi molto più sostenibili e margini migliori per chi vende servizi AI.
Come dice Andrew Feldman, CEO di Cerebras: ‘In AI, speed is productivity’. E aggiunge che storicamente inference veloce significava usare modelli più piccoli e meno capaci. Con il CS-4, quella equazione cambia: velocità estrema su modelli frontier, i più grandi e complessi.
Lo zaino magico: Wafer-Scale Backpack
Una delle innovazioni più curiose è il design a ‘backpack’ — zaino, letteralmente. Cerebras ha ripensato il sottosistema di compute come un modulo posteriore che si attacca verticalmente all’array di alimentazione. Ogni Wafer-Scale Backpack è un’unità autosufficiente che integra conversione di potenza, raffreddamento a liquido diretto, I/O ad alta velocità e elettronica di controllo in un package tridimensionale compatto costruito direttamente attorno al wafer.
Risultato pratico? Il deployment passa da giorni a ore. Il 50% di componenti in meno rispetto alla generazione precedente, e il 60% in più di automazione nella produzione. Meno cose che possono rompersi, meno tempo per mettere tutto in produzione.
Power delivery estremo
Cerebras ha spostato la conversione di potenza 100 volte più vicino ai processori: da circa 50 millimetri di distanza (tipico delle schede GPU) a circa 0.5 millimetri. Questo quasi elimina le perdite di potenza a livello di board e permette di fornire il doppio della potenza al WSE-3T, traducendosi in frequenze operative più alte e generazione di token più veloce.
È il tipo di dettaglio ingegneristico che non fa titoli ma che cambia tutto nella pratica.
I/O programmabile e latenza ridicola
Il nuovo sottosistema I/O è completamente programmabile e supporta due modalità di connettività, raddoppiando la bandwidth e riducendo la latenza. Il Wafer I/O Module supporta RoCE v2 RDMA over Ethernet — quindi si integra senza problemi nell’infrastruttura esistente — e raggiunge 2.4 terabit al secondo per wafer, 7.2 terabit per rack CS-4 completo.
Ma c’è di più: una nuova modalità chiamata Direct Wafer Links permette di collegare i wafer dentro e tra rack senza bisogno di switch. Latenza wafer-to-wafer? Due microsecondi. Due. Questo apre la porta a cluster CS-4 massicci e al supporto di modelli con oltre 50 trilioni di parametri.
Come nota Sean Lie, CTO di Cerebras: ‘Essere 30 volte più veloci non significa solo che una risposta sembra veloce. Dà a un sistema agente spazio per più di un ordine di grandezza di ragionamento, verifica o uso di strumenti nello stesso tempo reale’. Ecco, questo.
Numeri a confronto: CS-3 vs CS-4
Mettiamo le cose in prospettiva. Un singolo wafer CS-3 erogava 125 PFLOPS; il CS-4 con tre wafer arriva a 750 PFLOPS. Bandwidth di memoria? Da 21.6 a 129.6 petabyte al secondo. Bandwidth del fabric on-chip? Da 26.7 a 160.5 petabyte al secondo. I/O di sistema? Da 1.2 a 7.2 terabit al secondo. E la latenza I/O scende da 5 a 2 microsecondi.
Ogni metrica è un salto generazionale, non un miglioramento incrementale.
Quando arriva?
Le prime spedizioni del CS-4 partono in questo trimestre. Il datasheet completo è già disponibile sul sito di Cerebras per chi vuole entrare nei dettagli tecnici.
Cerebras ha sempre puntato su un’architettura radicalmente diversa rispetto al mondo GPU. Con il CS-4 e la nuova piattaforma Nexus, stanno raddoppiando su quella scommessa. Se i numeri reggono in produzione — e c’è da aspettarsi che reggano, considerando il track record — il panorama dell’inference AI potrebbe cambiare parecchio nei prossimi mesi.
