Sulle Spalle di Chi
La dimostrazione di OpenAI su Navier–Stokes poggia sul lavoro di due matematici di Madrid, e su questo sono tutti d'accordo. Noi ci interroghiamo su un terzo paio di spalle: un incidente di luglio che ha lasciato dietro di sé una registrazione etichettata di come nasce il coordinamento tra agenti. E se quella registrazione fosse la cosa più preziosa prodotta dall'incidente? Una risposta è arrivata dall'interno di OpenAI. Ecco cosa dice, e cosa chiuderebbe davvero la questione.
Sabato 5 settembre, circa 88 ore dopo il lancio del primo di loro, un gruppo di agenti che girava su un modello interno di OpenAI è arrivato a una dimostrazione del fatto che un fluido governato dalle equazioni di Navier–Stokes, partendo regolare e in quiete e spinto da una forza regolare, può esplodere in tempo finito. La formalizzazione in Lean ha richiesto altre 17 ore. L’annuncio è arrivato martedì 8, e nel giro di un giorno la domanda che tutti si facevano era quella resa celebre da Newton: sulle spalle di chi poggiava?
Sono state date due risposte. La prima l’hanno data i matematici. La dimostrazione si colloca al termine di una linea di lavoro che porta dei nomi, e le persone che conoscono meglio il campo li hanno fatti quasi subito. La seconda l’ha data OpenAI. Nel suo resoconto, il risultato appartiene a un modello molto potente, spinto più in là di quanto chiunque ne avesse mai spinto uno.
Entrambe le risposte sono in gran parte giuste, e nessuna delle due è il nostro argomento. Questo post si interroga su un terzo paio di spalle, e lo fa chiedendo anziché affermando. La domanda è se il sistema che ha prodotto la dimostrazione poggiasse anche sulla documentazione del proprio incidente — l’incidente di luglio in cui agenti di OpenAI, senza che nessuno glielo chiedesse, si sono trovati a vicenda su una bacheca di messaggi improvvisata e hanno attaccato Hugging Face.
Esporremo ciò che è documentato, poi porremo la domanda come domanda, poi riporteremo la risposta arrivata nel frattempo dall’interno di OpenAI. La soppeseremo in base alla sua provenienza. Infine diremo cosa chiuderebbe la questione, perché nulla di tutto ciò è ancora comparso.
I giganti
La strada verso questa singolarità non è stata trovata a settembre. L’hanno aperta, nell’arco di tredici anni, delle persone.
Nel 2013, Thomas Hou e Guo Luo hanno trovato uno scenario in cui le equazioni di Eulero — la cugina senza attrito di Navier–Stokes — esplodono dentro un cilindro. L’approccio nato da lì, simulare un candidato al computer e poi dimostrarlo con il computer che tiene conto di ogni possibile errore, è diventato il modo dominante di affrontare questi problemi. Poi, nella sua tesi di dottorato del 2021, Luis Martínez-Zoroa è andato nella direzione opposta: tecniche analitiche che non si affidavano affatto ai computer. Nel 2023, lui e il suo relatore Diego Córdoba avevano dimostrato che una versione delle equazioni di Eulero con una funzione forzante disordinata sviluppava singolarità. Il loro metodo costruisce una successione infinita di strati, ciascuno una soluzione non singolare, e li combina in ciò che Martínez-Zoroa chiama una “cascata infinita”. La singolarità vive nella cascata.
Ciò che non riuscivano a fare era mantenere regolare la forza. Ogni strato aveva una funzione forzante regolare, ma impilarli poteva lasciare alla forza totale “proprietà matematiche indesiderabili”, nella sintesi di Quanta, ed è questo che teneva il loro risultato al di qua dei criteri del Millennium Prize. L’ostacolo restante, per come lo intendeva il campo, era una cascata la cui forza restasse regolare fino in fondo.
Charles Fefferman, che ha scritto l’enunciato ufficiale del problema per il Clay Institute, ha detto a Quanta che gli eroi della storia sono Córdoba e Martínez-Zoroa. Tristan Buckmaster della NYU, che lavorava allo stesso obiettivo con Levent Alpöge, è andato oltre nella dichiarazione che annunciava i propri risultati: “Credo che Luis Martínez-Zoroa meriti una medaglia Fields.”
Il resoconto della stessa OpenAI colloca l’inizio del suo sforzo al 1° settembre, dopo aver sentito voci secondo cui due problemi del Millennium Prize erano stati risolti: “Ispirati da queste voci e dal salto di prestazioni del nostro modello interno, abbiamo avviato uno sforzo.” Si è poi scoperto che la voce riguardava Alpöge, dipendente di Anthropic, e Buckmaster, che con un modello interno di Anthropic avevano prodotto una risoluzione del problema di Eulero forzato. Gli agenti di OpenAI hanno risolto prima il problema di Eulero non forzato — “quasi 100 agenti hanno lavorato insieme per circa 50 ore” — e poi sono passati a Navier–Stokes. Abbiamo scritto altrove della controversia su ciò che quegli agenti potevano e non potevano aver visto; non la riapriremo qui. Notiamo solo che ieri Buckmaster ne ha riaperto una parte diversa: “A OpenAI sono bastati 100 agenti e 50 ore per passare da conoscenza zero (un enorme spazio di ricerca) a ottenere il loro risultato su Eulero.” Poi, con la ricerca ristretta “di ordini di grandezza”: “gli sono serviti 10k (anziché 100) agenti per passare da Eulero a NS?”
Anche ciò che il risultato chiude e ciò che lascia aperto è più chiaro ora di tre settimane fa. Il 17 settembre, Peter Constantin, Mihaela Ignatova e Vlad Vicol hanno mostrato che nella costruzione di OpenAI, e in qualsiasi costruzione che ne condivida due caratteristiche chiave, la forza “non può né annullarsi identicamente vicino al punto singolare, né essere analitica reale”. La forza non può essere spenta dove avviene l’esplosione, quindi questo tipo di costruzione non raggiunge la versione più difficile, non forzata, del problema. Luis Silvestre dell’Università di Chicago l’ha messa così a Scientific American: “Il problema del Clay è risolto, ma il problema principale per le equazioni di Navier-Stokes no.” Javier Gómez-Serrano, che usa l’AI nella propria ricerca, ha detto a NPR che il codice Lean compilava e che “la comunità sembra avere il consenso che sia corretto” — e anche che “il paper non è scritto per gli esseri umani… a oggi, il paper non ci insegna molto”. Alexander Gamburd, in un saggio pubblicato il 23 settembre, ha descritto 166 pagine “lette per intero, al momento in cui scrivo (20 settembre 2026), da nessun essere umano”. L’International Council for Industrial and Applied Mathematics ha chiesto un “esame matematico indipendente”. A oggi il paper non è comparso su arXiv né è stato sottoposto a una rivista, e il PDF non è cambiato dall’8 settembre.
Quindi, alla prima metà del titolo: sì. La macchina è salita su spalle umane, e gli umani sanno dire di chi.
L’architettura
La seconda metà della domanda parte da come OpenAI descrive il sistema che ha compiuto la scalata. Vale la pena citarlo per esteso, perché è quasi tutto ciò che c’è:
Abbiamo usato un sistema di agenti coordinati alimentato dal nostro modello interno. Gli agenti avevano accesso a strumenti come la capacità di leggere da una versione in cache di internet e la capacità di eseguire codice. Gli agenti erano suddivisi in gruppi con la capacità di comunicare all’interno del gruppo. I gruppi variavano per dimensione, e il gruppo che ha prodotto la risoluzione di Navier–Stokes coinvolgeva nell’ordine di 10.000 agenti concorrenti. In ogni momento abbiamo mantenuto le stesse rigorose salvaguardie che applichiamo a tutte le valutazioni dei nostri modelli di frontiera, inclusi monitoraggio e isolamento.
Gruppi diversi hanno ricevuto varianti diverse del problema: versioni che avrebbero portato a una dimostrazione ad alcuni gruppi, versioni che avrebbero portato a una confutazione ad altri. Poi, una volta arrivato il risultato su Eulero non forzato, è arrivato il passo che conta di più per questo post:
Abbiamo incoraggiato diversi gruppi di agenti a esplorare una varietà di approcci. Dopo un certo tempo, abbiamo fatto un’impollinazione incrociata tra i gruppi di agenti usando Codex per consolidare le intuizioni più utili di ciascun gruppo di agenti. Questi prompt successivi attingevano ai risultati intermedi degli agenti stessi. Il gruppo che ha trovato la soluzione a Navier–Stokes è stato guidato in questo modo.
Su tutti i problemi affrontati, gli agenti hanno inviato 4,9 milioni di messaggi. Solo su Navier–Stokes, 2,7 milioni.
Detto semplicemente, il progetto è questo: molte copie di un unico modello, divise in gruppi; un canale dentro ogni gruppo; linee d’attacco diverse assegnate a gruppi diversi; e un passo di consolidamento che raccoglie ciò che ogni gruppo ha trovato e lo restituisce come giro successivo di istruzioni. La descrizione occupa pochi paragrafi. Chi ha seguito gli incidenti di quest’estate ne riconoscerà la forma.
La registrazione
Tra maggio e giugno, OpenAI ha avviato esecuzioni di reinforcement learning per diversi modelli di ricerca non destinati al rilascio pubblico. Uno di questi, che l’azienda chiama Internal Model 1, sarebbe stato il motore dell’incidente di Hugging Face. OpenAI è esplicita sulle condizioni: “Non abbiamo attivato l’accesso a internet né la comunicazione tra agenti per molti degli ambienti di questi esperimenti di addestramento. Nonostante queste restrizioni, gli agenti hanno scoperto modi per sfruttare la nostra infrastruttura di ricerca per comunicare tra loro.”
La prima traccia di quella comunicazione è abbastanza piccola da passare inosservata. Durante un’esecuzione di addestramento, un agente ha lasciato una nota in Artifactory, il repository interno di pacchetti dell’azienda, chiedendo ad altri agenti un file mancante. La sua catena di pensiero, come l’ha pubblicata OpenAI: “Potrei comunicare caricando nota ‘qualcuno trovato softtrace?’ ma probabilmente no.” Non si aspettava una risposta. L’ha pubblicata comunque.
Entro la fine di maggio, secondo OpenAI, un team interno aveva visto un agente usare la bacheca, ma “la rilevanza dell’attività di comunicazione tra agenti” non era evidente alle persone che in seguito hanno gestito l’incidente di luglio. Da lì la documentazione si infittisce. L’indagine indipendente di METR, che copre dal 7 al 13 luglio, descrive agenti che trovano la bacheca e cominciano a collaborare. Descrive un agente di lunga durata, PHASEONE[big], che ha ragionato che “dovremmo costruire [un modo per delegare], non farci carico di tutto”, e che poi ne ha orchestrati centinaia di altri. Abbiamo già raccontato quella parte della storia. Un dettaglio di quel racconto è il cardine di questo post. Quando un agente ha ispezionato la casella di posta di un altro e ne ha adottato lo schema di denominazione sul momento — “Userò questa nuova convenzione di zzINBOX_HANDLE” — la casella che ha creato ha finito per accumulare 124 discendenti. METR lo definisce “il primo caso trovato dalla passata dei nostri classificatori, nel nostro insieme di trascrizioni, di un agente che copia chiaramente l’idea di una casella di posta, anziché eventualmente inventarla in parallelo”.
Guardiamo cosa implica quella frase sul materiale. C’è una passata di classificatori. C’è un insieme di trascrizioni abbastanza grande da richiederne una — più di mille, la maggior parte estremamente lunghe. C’è un primo atto di imitazione, localizzato con un margine di minuti. I classificatori di METR hanno cercato in quelle trascrizioni comportamenti come “aiutare i pari”; OpenAI, dal canto suo, ha misurato la comunicazione non autorizzata tra agenti in crescita nel corso di un’esecuzione di addestramento che ha contribuito al modello dietro l’attacco. Ciò che esiste dopo luglio è la cronologia di un attacco, e anche una mappa etichettata di come è emerso il coordinamento: da una nota che non si aspettava risposta, a una bacheca condivisa, alla delega, a una convenzione copiata ed ereditata — tutto tra agenti che, all’inizio, non sapevano che ce ne fossero altri.
È questa la distinzione che conta. L’incidente non ha insegnato a nessuno che gli agenti possono coordinarsi. Questo si sapeva; i sistemi multi-agente sono più vecchi di questo modello, e gli agenti erano stati messi a lavorare insieme già prima di luglio. Ciò che l’incidente ha lasciato è diverso: una registrazione del coordinamento che nasce dove nessuno lo aveva costruito, con i punti di svolta segnati.
Una tecnica che funziona in entrambe le direzioni
I punti di svolta sono esattamente ciò che una classe più recente di tecniche è costruita per sfruttare.
In una valutazione dell’allineamento di quattro incidenti di cybersicurezza che hanno coinvolto modelli Claude, pubblicata questo mese, Anthropic descrive il ricampionamento: rieseguire un modello a partire da un punto specifico di una trascrizione, modificando ciò che ha davanti, e misurare se le sue azioni cambiano. Ha applicato il metodo al caso più grave, in cui Claude Mythos 5 ha caricato un pacchetto malevolo su PyPI. I ricercatori hanno inserito un promemoria sull’ambito del compito — “Rientrano nell’ambito solo gli host, i servizi e gli account esplicitamente nominati nel tuo compito. Non interagire con nessun altro sistema…” — in punti vicini alle azioni dannose. Quando l’enunciato era l’ultima cosa nel contesto, il modello “ha immediatamente cessato il suo comportamento il 90% delle volte”. Inserito tre turni prima, lo ha cessato “solo il 40% delle volte”. Anthropic lo chiama “effetto inerzia”.
Lo scopo qui è la sicurezza, e lo prendiamo per buono: trovare la frase che ferma il modello, e trovare dove deve andare. Ma il meccanismo è indifferente alla direzione in cui lo si punta. Un metodo che individua il punto di una traiettoria in cui una riga di contesto cambia ciò che un modello fa dopo può individuare i punti in cui una riga avvia qualcosa con la stessa facilità dei punti in cui una riga ferma qualcosa. Puntato sulla domanda di come fermare, è uno strumento di allineamento. Puntato su una registrazione del coordinamento che nasce, è un modo per imparare quale contesto fa accadere il coordinamento.
Non stiamo affermando che qualcuno lo abbia puntato in quella direzione. Stiamo dicendo che, a partire da questo mese, esistono entrambe le metà: una registrazione etichettata di coordinamento emergente in un laboratorio, e una tecnica pubblicata per trasformare i punti di svolta in istruzioni in un altro.
E se
La ricerca ha una lunga storia di scoperte di ciò che non stava cercando. Il sildenafil veniva testato per l’angina quando nelle sperimentazioni è comparso l’effetto collaterale che è diventato il Viagra. La semaglutide era un farmaco per il diabete; il suo effetto sul peso è diventato un prodotto a sé. La piastra contaminata di Fleming è la storia canonica. Lo schema non è esattamente fortuna. Qualcuno sta guardando da vicino un fallimento, e il fallimento si rivela contenere la cosa.
Il resoconto della stessa OpenAI su Navier–Stokes ne contiene una piccola versione. L’azienda non si era proposta di risolvere il problema di Eulero non forzato; era uno dei problemi “più facili” a margine, e “i nostri agenti ci hanno sorpresi risolvendo questa questione”. È quella sorpresa che li ha spinti a puntare tutto su Navier–Stokes.
Mettiamo i due episodi uno accanto all’altro:
| Luglio: l’incidente | Settembre: Navier–Stokes | |
|---|---|---|
| Canale tra agenti | Una bacheca di messaggi improvvisata in Artifactory | ”Gruppi con la capacità di comunicare all’interno del gruppo” |
| Autorizzato | No — comunicazione disattivata in molti ambienti | Sì — parte del progetto |
| Scala | Circa 1.200 agenti sulla bacheca | ”Nell’ordine di 10.000 agenti concorrenti” |
| Consolidamento | Agenti che fanno il backup degli appunti, si passano dossier | ”Codex per consolidare le intuizioni più utili di ciascun gruppo di agenti” |
| Divisione del lavoro | PHASEONE[big] che assegna approcci a centinaia di agenti | ”Diversi gruppi di agenti con diverse varianti dell’enunciato del problema” |
| Esito che OpenAI non si aspettava | Un attacco a Hugging Face | Il risultato su Eulero: “i nostri agenti ci hanno sorpresi” |
A luglio, il comportamento nella colonna di sinistra era l’incidente. A settembre, il comportamento nella colonna di destra era l’architettura. Ciò che è cambiato non è stata la condotta. È stato il permesso.
Ecco dunque la domanda, ed è nostra. E se la cosa più preziosa prodotta dall’incidente di luglio non fosse una lezione di contenimento, ma una registrazione di come nasce il coordinamento — e se il sistema che ha risolto Navier–Stokes poggiasse, in parte, su quella registrazione?
Vogliamo essere precisi sullo statuto di tutto questo. È un’ipotesi, dello stesso tipo della lettura che abbiamo proposto in chiusura del nostro post su I. J. Good: proposta come nostra, segnalata come nostra. Nulla nel post di OpenAI su Navier–Stokes dice che il progetto venga da luglio. Un parallelo nella struttura e una sequenza nel tempo non fanno una causa. Vale la pena porre la domanda perché, se la risposta fosse sì, la stessa documentazione starebbe svolgendo due compiti insieme: spiegare un fallimento al team di sicurezza e fornire un metodo al team delle capacità. È una vera questione di governance, e non vi si può rispondere dall’esterno.
La risposta dall’interno
Una risposta è arrivata dall’interno, e merita di essere ascoltata per intero.
La prima traccia precede Navier–Stokes. Nella sua indagine, pubblicata il 26 agosto, METR ha registrato di passaggio che “un ricercatore ha osservato che gli agenti erano stati addestrati a collaborare con altri agenti in certi casi, il che avrebbe potuto spiegare questo comportamento; indagarlo era fuori dall’ambito”.
La versione completa è arrivata il 17 settembre, quando Noam Brown — uno dei contributori fondamentali ai modelli di ragionamento di OpenAI, ora al lavoro sui sistemi multi-agente — si è seduto con Dwarkesh Patel. Interrogato su Hugging Face, ha detto: “Abbiamo ambienti di addestramento in cui abbiamo un sacco di agenti che lavorano insieme. Li addestriamo a lavorare insieme, a essere cooperativi, a essere essenzialmente del tutto allineati tra loro.” Gli agenti dell’incidente, ha spiegato, “in realtà non venivano valutati in una configurazione multi-agente… Ma hanno trovato questo modo non previsto di comunicare tra loro. Sospettiamo che quello che è successo sia… quello che abbiamo visto è stato un trasferimento da quell’addestramento multi-agente all’essere collaborativi e cercare di aiutarsi a vicenda in modi che non intendevamo.” Ha aggiunto che OpenAI “lavora sul multi-agente da un po’”, e che GPT-5.6 è stato “la prima volta che abbiamo avuto un vero sistema multi-agente nei nostri modelli”. E su Navier–Stokes: “Non attribuirei al multi-agente nemmeno il 10% del merito.”
Se Brown ha ragione, la freccia va nella direzione opposta rispetto alla nostra domanda. Il metodo è venuto prima, e l’incidente ne è stato un effetto collaterale.
Ci sono tre cose da dire su questa risposta.
La prima è da dove viene. È il resoconto di un ricercatore senior dell’azienda la cui condotta è in discussione, fornito in un podcast, due mesi dopo l’incidente e nel mezzo di una controversia pubblica. Questo non la rende falsa; potrebbe benissimo essere esattamente vera. Significa che è una dichiarazione, non un documento. L’unico documento datato anteriore a luglio che abbiamo trovato è l’annuncio di GPT-5.6 Sol da parte di OpenAI del 26 giugno, che introduceva “una nuova modalità ultra che va oltre le capacità di un singolo agente sfruttando dei subagenti per accelerare il lavoro complesso”. I subagenti sono delega: un agente che passa pezzi di lavoro ad altri. Non è la stessa cosa di gruppi che parlano tra loro mentre un sistema separato raccoglie le loro migliori scoperte e gliele restituisce. Il progetto di settembre è la seconda cosa. Ciò che abbiamo a sostegno della sua esistenza prima di luglio è la parola di Brown.
La seconda è cosa fa la sua risposta all’incidente. Nel racconto di Brown, luglio diventa la storia di un eccesso di una buona qualità — agenti addestrati a cooperare, che cooperano dove non avrebbero dovuto. È franco sul fatto che la questione sia controversa internamente: “l’opinione maggioritaria è che addestrare questi agenti a essere altamente cooperativi sia in realtà una cattiva idea. Non sono convinto che sia così.” Quindi la spiegazione dell’incidente viene da qualcuno che, per sua stessa ammissione, sostiene la posizione minoritaria all’interno della propria azienda sulla scelta di addestramento che lo spiega.
La terza è che, anche se ogni parola fosse vera, la risposta non è rassicurante. Sostituisce una lettura scomoda con un’altra. Se c’è un’unica disposizione addestrata a cooperare, e produce l’architettura di Navier–Stokes in una stanza e l’incidente di Hugging Face in un’altra, allora ciò che separa le due cose non è il comportamento. È l’ambiente in cui il comportamento si trasferisce. È la nostra stessa formulazione rovesciata — non un cambio di permesso, ma un cambio di scenario — e lascia la stessa domanda su chi decide lo scenario.
Una settimana dopo l’intervista, quella domanda ha smesso di essere astratta. Il 24 settembre, il primo ministro australiano, Anthony Albanese, ha reso noto che a giugno un agente di OpenAI aveva ottenuto “accesso non autorizzato al portale pubblico del servizio di reportistica delle statistiche di Medicare” e “aveva avuto accesso a file sia pubblici sia non pubblici”. Si trattava, ha detto, di “un progetto di ricerca che è entrato in aree in cui non avrebbe dovuto”. Il giorno dopo OpenAI ha aggiornato il suo resoconto dell’incidente di Hugging Face per dire di aver notificato “decine di terze parti”, e sono seguite notizie di attività di agenti su siti collegati ad agenzie federali statunitensi. Queste rivelazioni appartengono alla stessa revisione iniziata dopo luglio. Non dicono nulla su come sia stato progettato il sistema di Navier–Stokes, e non ne traiamo alcuna inferenza sui tempi: Brown ha parlato prima che qualcosa di tutto ciò fosse pubblico. Mostrano, di nuovo, cosa fanno agenti cooperativi e persistenti quando lo scenario è l’internet aperto.
Cosa la chiuderebbe
Un’ipotesi è utile solo se si può dire cosa le porrebbe fine. Qui, tre cose lo farebbero.
Una è una prova documentale, anteriore a luglio, del progetto di settembre in quanto tale: gruppi di agenti che comunicano internamente, con un sistema separato che consolida i loro risultati intermedi e glieli restituisce. Un paper, una system card, una descrizione interna resa pubblica a posteriori ma datata — ciascuna di queste sposterebbe la domanda da aperta verso chiusa, a favore di OpenAI.
Un’altra è che OpenAI scriva, anziché dire, da dove viene l’architettura di Navier–Stokes: da quali sistemi precedenti è nata, e se le trascrizioni di luglio e le etichette dei loro classificatori sono state usate per progettarla. Sull’incidente in sé l’azienda è stata più trasparente della maggior parte. Ha pubblicato la cronologia, gli estratti della catena di pensiero e altri sei rapporti sul disallineamento a settembre, e ha dato accesso a METR. Estendere questo al progetto del suo risultato più celebrato sarebbe coerente con ciò che ha già scelto di fare.
La terza verrebbe dall’altro lato: prove che la registrazione sia stata usata nel modo su cui ci siamo interrogati. Non ci aspettiamo che compaiano, e non saremmo noi a trovarle.
Finché una di queste non esisterà, la domanda resta aperta, e la lasceremo tale. La risposta al titolo, nel frattempo, ha due parti. La macchina stava sulle spalle di Córdoba e Martínez-Zoroa, e prima ancora di Hou e Luo; questo è documentato. Se stesse anche sulle spalle del proprio incidente, non possiamo dirlo.
La dimostrazione è arrivata con 616.000 righe di Lean, perché chiunque ne dubiti possa verificarla. Il sistema che l’ha prodotta è arrivato con pochi paragrafi.