SpaceXAI ha appena rilasciato Grok 4.7, e i numeri fanno girare la testa. Non perché siano astronomici — anzi, è il contrario. Costa la metà dei competitor di pari livello e va il doppio più veloce. Tradotto dal marketing-speak: finalmente qualcosa che puoi usare davvero senza svenarti.
Grok 4.7 è pensato per il coding e il knowledge work — quel termine vago che copre tutto, dagli avvocati agli analisti finanziari. La vera novità è come lavora: passa più tempo sui task difficili, verifica il proprio output con più attenzione, e ha un sistema di safeguard completamente nuovo. Rispetto a Grok 4.6, è un salto netto.
I benchmark: dove Grok 4.7 spacca (e dove no)
Su CursorBench 4.0 — che testa task di coding che durano ore, non minuti — Grok 4.7 segna il 46,3%. Non è il primo della classe (Fable 5.1 arriva al 51,8%), ma costa un quinto. Due dollari per milione di token in input, sei in output. Fable? Dieci e cinquanta. Fate voi.
Su DeepSWE v1.1 raggiunge il 71% con high effort, battendo GPT-5.6 Sol (72,7%) per un pelo ma costando un terzo. In ambito ingegneristico — EEBench — domina con il 64%, staccando tutti. Nei task di ufficio multi-ora (AA Briefcase) fa 1.657 punti, secondo solo a Fable che ne fa 1.678. Ma di nuovo: guardate il prezzo.
Dove fa meno bene? Legal work. Sul Harvey Legal Agent Benchmark segna il 19,6%. Non male, ma lontano dai livelli top. In ambito clinico (HealthBench Professional) arriva al 56,7%, dietro a GPT-5.6 Sol (60,5%) e Fable (62,1%). Non è perfetto ovunque. Ma dove serve — coding, ingegneria elettrica, terminal work — è competitivo o meglio della concorrenza, a metà prezzo.
Come ci sono arrivati
Grok 4.7 parte da un base model più grande di quello di Grok 4.6, addestrato con un ciclo di reinforcement learning più lungo su task più difficili — pesati verso problemi che richiedono ore per essere completati. Il modello gestisce meglio i contesti lunghi, verifica il proprio lavoro con più attenzione, e capisce nativamente l’harness Grok Bot, il che lo rende più naturale nelle conversazioni e nel lavoro generalista.
Non è solo più grosso. È stato allenato diversamente, con più pazienza e su roba più tosta.
Sicurezza e cybersecurity: il nuovo stack di safeguard
Grok 4.7 ha uno stack di safeguard completamente nuovo ed è il modello più resistente ai jailbreak che SpaceXAI abbia mai rilasciato. In domini dual-use — cybersecurity e biologia — bilancia utilità per task legittimi e rifiuto su quelli pericolosi.
Sul biosafety benchmark di LatchBio raggiunge il 62,4%, il punteggio più alto. Su HackerBench v0.3 lascia passare solo il 3,3% dei prompt dual-use rischiosi, bloccando raramente il lavoro di sicurezza legittimo. SpaceXAI ha anche aperto l’accesso invite-only alle capacità di red-team a partner selezionati nel settore cybersecurity.
È difficile da fregare, ma non rompe le scatole se stai facendo ricerca di difesa seria.
Prezzi e disponibilità
Grok 4.7 è disponibile da oggi su Cursor, Grok Build, e tramite API. Lo trovi anche su harness di coding di terze parti, router di modelli e piattaforme cloud. Il prezzo parte da 2 dollari per milione di token in input, 6 in output. C’è anche una variante veloce: il doppio della velocità di output al doppio del prezzo.
Puoi provarlo gratis su Grok Build. Installazione via curl. Niente fronzoli.
Grok 4.7 non è il modello più potente del mondo. È quello che ti fa fare più cose con meno soldi. In un mercato dove i costi di inferenza sono ancora un collo di bottiglia, non è una feature secondaria.
