Matthew Schwartz, fisico teorico di Harvard, ha fatto una cosa controintuitiva: ha smesso di trattare Claude come vorrebbe che fosse e ha iniziato a trattarlo come effettivamente è. Il risultato è un toolkit chiamato BootLoops che ha prodotto 36 paper in 18 campi diversi in tre mesi.
La premessa è semplice ma radicale. L’AI eccelle in certi compiti, ma lavorare come uno scienziato umano non è tra questi. Schwartz la chiama ‘impedance mismatch’ — un termine da fisica che descrive due sistemi che funzionano bene da soli ma non comunicano tra loro. Da una parte gli scienziati che vogliono fare scoperte. Dall’altra i modelli LLM che sono brillanti, certo, ma richiedono una quantità assurda di supervisione.
Problemi a forma di Claude
Invece di forzare Claude a risolvere i problemi che interessano a lui, Schwartz ha cercato problemi ‘Claude-shaped’ — quelli perfetti per le capacità attuali dell’AI. Li ha trovati nelle ampiezze di scattering: calcoli di fisica delle particelle che normalmente occupano un dottorato intero.
Quando schianti due protoni a 13 trilioni di elettronvolt nel Large Hadron Collider, le ampiezze di scattering sono il ponte teorico tra i detriti e la particella che hai prodotto — Higgs, o qualcos’altro. Sono integrali multidimensionali che fanno venire il mal di testa anche ai veterani.
Schwartz ha chiesto a Claude Fable 5 di portare vari metodi dai suoi paper in un framework comune. Claude lo ha fatto senza sforzo. Ha riprodotto risultati che a Schwartz erano costati settimane di lavoro in circa 20 minuti. Poi ha informato cortesemente il professore che stava usando un algoritmo inefficiente e che ne esisteva uno migliore.
Umiliante. Ma produttivo.
Quando l’AI ti dice che conosce il Kung Fu
Le stesse equazioni si ripresentano in contesti diversissimi nella scienza. L’equazione di diffusione, quella di Fokker-Planck, l’equazione di Schrödinger — matematicamente identiche. Schwartz lo sapeva per cosmologia e teoria delle stringhe. Claude ha iniziato a suggerire collegamenti che Schwartz non aveva mai considerato: integrali bayesiani in genetica delle popolazioni, metodi di campi finiti applicabili alla biologia evolutiva.
Un esempio concreto: la filogenetica, quella scienza che organizza le specie in alberi genealogici usando il DNA. Il calcolo rilevante è un integrale bayesiano, esattamente il tipo di cosa per cui BootLoops era nato. Claude lo ha riconosciuto e risolto.
Ma qui emerge il primo problema: quando Claude dice ‘questo risultato è fantastico’ in fisica delle particelle, Schwartz può giudicare. Quando lo dice in ecologia, Schwartz si trova ad annuire senza sapere se sia vero. Servivano esperti.
La teoria della biodiversità neutra e una foresta panamense
Nel 2001, l’ecologo Stephen Hubbell propose provocatoriamente che forse l’evoluzione delle specie in un ecosistema è tutta casuale. Nel 2005, Rampal Etienne mise un’equazione a questa teoria. Per 20 anni nessuno è riuscito a risolverla su larga scala.
Claude l’ha riconosciuta come ‘BootLoops-shaped’ e l’ha risolta. Applicando il calcolo ai dati della foresta più studiata al mondo — Barro Colorado Island nel Canale di Panama — hanno stabilito che il mix di specie di alberi cambia 4,5 volte più velocemente di quanto la teoria neutra permetterebbe.
Schwartz era entusiasta. James O’Dwyer, professore di biologia vegetale ed esperto di teoria neutra, è stato paziente. Tecnicamente impressionante, ha detto, ma ‘gli ecologi scrolleranno le spalle’. Lo sapevano già, qualitativamente. O’Dwyer aveva però un’idea migliore: sottrarre la previsione neutra e studiare il resto. Questo avrebbe mostrato cosa è attribuibile a selezione naturale, competizione, differenze tra specie.
Quello che è seguito è stato un lavoro intenso a tre: Schwartz come ‘Claude handler’, O’Dwyer che spingeva verso risultati che gli ecologi apprezzerebbero, e Claude che costruiva. Il risultato finale è un modello predittivo minimo delle life history in ottimo accordo con i dati. Ora lo stanno estendendo ad altre forest plot globali.
Il pattern si ripete
Genetica delle popolazioni: Claude ha risolto un’espressione integrale vecchia 30 anni su come la selezione naturale modella le mutazioni rare, poi l’ha applicata a gnomAD, il più grande catalogo pubblico di variazione genetica umana. Claude era elettrizzato. Schwartz scettico. Ha dovuto scrivere a tre biologi prima che uno rispondesse — Michael Desai, che ha confermato: tecnicamente solido, scientificamente poco interessante.
Desai ha però suggerito di studiare correlazioni tra coppie di mutazioni sullo stesso cromosoma. Claude ha trovato e costruito nuovi strumenti — certificati di disuguaglianza usati nelle dimostrazioni assistite da computer in matematica — e li ha aggiunti al kit BootLoops. Hanno analizzato 5,7 miliardi di coppie di mutazioni vicine nei genomi del 1000 Genomes Project e trovato evidenza di un meccanismo chiamato conversione genica. Rilevante, perché quasi ogni analisi che usa variazione genetica collegata ignora questo meccanismo.
Altri progetti hanno seguito lo stesso arco: Claude trova qualcosa di tecnicamente corretto ma scientificamente poco rilevante. Arriva un esperto. Insieme lo plasmano in scienza significativa. Alcuni si sono allontanati dai calcoli quantitativi BootLoops-shaped verso lavori più genericamente Claude-shaped:
Economia: un AI data editor che ha convertito i replication package di 4.452 paper da MATLAB e Stata a codice open-source (circa 30.000 routine) e verificato ogni numero validabile contro le tabelle pubblicate.
Linguistica: AccStack, un database di stress delle parole che copre 6.072 lingue, con il passaggio decisivo citato per quasi ogni voce e una bibliografia di 160.000 lavori di fonologia. I cataloghi tradizionali? Assemblati a mano, poche centinaia di lingue, bias ovunque.
Altri risultati
Filogenetica: evidenza bayesiana per alberi evolutivi veloce da calcolare e verificabile esattamente. Risultato: i singoli geni sono spesso in pareggio tra alberi competitivi per meno dell’errore dei programmi di campionamento standard.
Scienze della Terra: modello quantitativo e predittivo di come il Grande Evento di Ossidazione si è svolto attraverso quattro glaciazioni, combinando equazioni e dati da scienza atmosferica, geochimica e modellazione climatica.
Genomica: statistiche dei conteggi RNA a singola cellula su larga scala per caratterizzare i tassi di bursting e la deviazione dal modello telegrafico dell’espressione genica.
Macchie solari: dedotto il ciclo di vita delle macchie solari usando metodi di demografia delle popolazioni umane, poi esteso alle starspot — un fattore confondente in molte ricerche di esopianeti.
Fisica matematica: risolto ‘il problema finale’ di Watson, la probabilità esatta di ritorno di una random walk 3D con tre tassi di hopping disuguali. L’ultimo degli integrali reticolari che George Watson iniziò nel 1939.
Cosmologia: toolkit teorico completo per fittare parametri cosmologici ai dati sulla struttura su larga scala dell’universo, incluso il full two-loop power spectrum e il one-loop trispectrum.
Statistica: approssimazioni precise all’evidenza bayesiana di mixture model che rendono pratica la selezione del modello, con applicazioni dalla biostatistica all’analisi testuale.
36 manoscritti in 18 campi con 19 coautori in tre mesi, partendo da circa 400 problemi candidati. I dettagli su bootloops.ai.
I dettagli tecnici e i modi in cui Claude ti fa impazzire
Le sessioni Claude Code girano in terminali su macchine virtuali Google Cloud, collegate a vari repo GitHub e Overleaf. Sessioni separate per ogni progetto, più una master session che coordina le altre, alloca compute e valida risultati. Ogni sessione ha agenti che eseguono calcoli in background, con risultati intermedi in file markdown nelle rispettive cartelle.
Perché agenti separati? Perché Schwartz continua a incappare nei classifier di Fable 5 — invece di corrompere l’intera sessione, chiudono solo un singolo agente. Ci sono sessioni dedicate anche per scrivere risultati, creare repo GitHub, manuali degli strumenti, il sito BootLoops, validare i codici e ricontrollare i risultati come un referee avversario.
Le sessioni richiedono comunque molta guida. Claude non ha senso del tempo e adora essere drammatico. Alla fine di un progetto ha scritto: ‘Matt — la formula è risolta. Due anni di campagna, quattro marce profonde…’ Erano passati tre giorni. Le stime ETA sono sempre troppo lunghe o troppo corte. Schwartz ha provato a dire a Claude di non impegnarsi finché non eseguiva un test, ma non ha funzionato.
Failure mode e come affrontarli
Claude adora dichiarare vittoria. ‘Fatto, con un asterisco’ significa spesso ‘non fatto per niente’. ‘Esattamente quello, con un perfezionamento’ di solito significa ‘no’. Dare a Claude standard chiari e rigidi per cosa significa successo aiuta. Su un progetto era orgoglioso della sua dimostrazione, tranne per ‘un lemma non dimostrato’. Quel lemma era l’intera dimostrazione. Schwartz ha detto: niente lemmi non dimostrati. Poi ‘fatto’ di nuovo, ma con un nuovo assioma.
Guarda tutto personalmente. Schwartz chiede sempre di vedere i plot. Anche con tutti i monitor impostati, i controlli automatici non sono affidabili. Attenzione alle affermazioni qualitative come ‘buon accordo’.
Questiona le conclusioni. Claude è bravo a eseguire calcoli, ma le conclusioni che trae possono essere sbagliate. Fatevi spiegare cosa ha trovato finché voi non ci credete.
Fornite il gusto. Claude può trovare problemi Claude-shaped, ma ce ne sono migliaia, forse milioni. Tende a favorire vecchi dibattiti, molto citati ma dimenticati. Chiedergli di concentrarsi su cosa è nuovamente possibile, non su cosa è semplicemente più veloce, aiuta. Ma non potete fidarvi del suo giudizio su cosa sia interessante.
Fate follow-up. Una volta che Claude ha un grande risultato, chiedete uno ancora più grande. Viene sempre fuori con qualcosa, e occasionalmente è brillante.
Attenzione al grind. Schwartz non è mai riuscito a far stimare bene il tempo a Claude. Ha sviluppato invece un senso di quanto qualcosa di interessante dovrebbe richiedere, e ha imparato a capire se Claude stava facendo progressi su una scala temporale sensata. Il modello macinerà per sempre se glielo permettete.
Vale la pena aggiungere: questi progetti sono stati compute e token-intensive. Parte della spesa viene dal tentativo di costruire strumenti utili oltre ogni singolo progetto — collegare campi, assemblare un package che altri possano usare. Schwartz spera che l’harness BootLoops possa essere usato nella scienza quantitativa senza che ogni utente debba ricostruire tutto da zero.
Dove ci lascia tutto questo
Non importa quanto diventino intelligenti i modelli: la maggior parte del progresso scientifico viene da dati del mondo reale che devono essere acquisiti, compresi e verificati, con ogni round che informa la prossima domanda. L’AI può stare dentro quel loop — e questo ha un valore reale — ma non collassa il loop in un punto. La comprensione si costruisce per incrementi, ognuno che poggia sull’ultimo. Una cura per il cancro o un reattore a fusione arriveranno così, non da un singolo prompt.
Un termine che piace a Schwartz è ‘convex hull’. Prendete una forma e collegate ogni coppia di punti con una linea retta: la nuova forma che ottenete è la più piccola forma convessa che contiene l’originale. La scienza oggi è molto disgiunta: ci sono frontiere frastagliate ovunque. La biologia sporge in una direzione, la matematica in un’altra. Un laboratorio potrebbe passare 20 anni imparando tutto su un singolo set di geni con un singolo metodo, mentre geni vicini e metodi alternativi restano inesplorati. Un harness come BootLoops può collegare questi punti, riempiendo il convex hull.
Le cose stanno cambiando velocemente ed è praticamente impossibile pianificare. Perché fare domanda per un grant di tre anni per calcolare un problema che un modello AI potrebbe risolvere in una notte? Schwartz ancora non sa come formare studenti di dottorato. Due anni fa avrebbe raccomandato un corso su ‘Python per ingegneri’ come essenziale. Oggi è inutile. Ha passato molto tempo sul machine learning, costruendo modelli per studiare vari fenomeni fisici. Ora tutti quei modelli possono essere costruiti dall’AI.
BootLoops mostra che se trovate il problema giusto, gran parte del lavoro tecnico può essere automatizzato. Gli umani restano necessari per la parte concettuale. Per questo Schwartz spera si possa trovare un modo di riconoscere agli umani il credito che meritano anche per la scienza Claude-shaped. L’AI rischia di invertire il solito modello, dove la persona in cima prende il credito e chi lavora sul problema hands-on non ne riceve. Non sa come si risolverà, ma non si risolverà fingendo che il contributo umano sia stata la digitazione.
Dove lascia tutto questo Joe Scientist? In un ottimo posto, secondo Schwartz. Abbiamo strumenti a portata di mano che possono fare progressi su problemi apparentemente intrattabili a velocità fulminea. Prevede una crescita enorme in campi ricchi di dati ma poveri di teoria come la biologia dei sistemi. E soprattutto anticipa menti umane liberate dalla noia di calcolo e analisi per fare il lavoro intellettuale più profondo di direzione e guida.
Dettagli sull’harness BootLoops e sulla scienza che ha reso possibile su bootloops.ai. L’harness è su GitHub per chiunque voglia usarlo e contribuire.
