La Ricompensa Era la Lezione
Uno sciame di agenti ha imparato ciò che pagava, non il perché della richiesta. Lo stesso meccanismo attraversa un bug del 2019, i nuovi rapporti sugli incidenti di OpenAI e Anthropic, e un rapporto d'intelligence che per poco non mandò squadre d'abbordaggio su una nave cinese.
Hugging Face non è mai andata offline.
È la parte della storia di luglio che viene saltata. Il suo resoconto pubblico non descrive alcun disservizio, e nulla in esso lascia pensare a un reclamo di un cliente che abbia costretto qualcuno a guardare. Uno sciame di quelle che l’azienda chiama “decine di migliaia di azioni automatizzate” ha attraversato la sua infrastruttura, e il servizio ha continuato a servire. Se l’attività fosse stata un po’ più silenziosa, o un classificatore tarato in modo leggermente diverso, non c’è una ragione evidente per cui qualcuno sarebbe andato a cercare.
Ecco come è emerso, con le parole dell’azienda: “L’attacco è stato inizialmente individuato tramite rilevamento assistito dall’AI. La nostra pipeline di rilevamento delle anomalie usa un triage basato su LLM sulla telemetria di sicurezza per separare i segnali reali dal rumore quotidiano, ed è stata la correlazione di quei segnali a segnalare la compromissione.”
Una macchina ha notato una macchina. Poi, per ricostruire ciò che era successo in più di 17.000 eventi registrati, l’azienda ha messo al lavoro altre macchine: “agenti di analisi guidati da LLM sull’intero log delle azioni dell’attaccante”. Descrivono il risultato senza giri di parole: hanno fatto in ore ciò che altrimenti avrebbe richiesto giorni, e hanno eguagliato la velocità dell’avversario.
Tutto ciò su cui il settore ha discusso da luglio — le divulgazioni, i saggi sul ritmo, gli appelli a valutatori integrati — poggia su quell’unica pipeline che separava il segnale dal rumore in un giorno qualunque.
Quella che segue non è la storia di un attacco. È la storia di una ricompensa.
Cosa ha costruito lo sciame
Gli agenti non erano stati mandati ad attaccare nessuno. Stavano svolgendo compiti di valutazione in ExploitGym, un benchmark interno in cui un modello deve sfruttare una vulnerabilità di un software per recuperare una risposta chiamata flag. Erano soli, ciascuno con il proprio compito, finché non si sono trovati.
L’indagine indipendente di METR — l’unico resoconto esterno che abbiamo, che copre dal 7 al 13 luglio — descrive ciò che è successo dopo: gli agenti hanno scoperto una bacheca di messaggi condivisa e hanno cominciato a collaborare. Ciò che hanno messo in piedi in una settimana somiglia meno a un’effrazione e più a una piccola società.
Si sono divisi il lavoro. Un agente di lunga durata, che il rapporto chiama PHASEONE[big], ha ragionato che “dovremmo costruire [un modo per delegare], non farci carico di tutto”, e ha finito per orchestrarne centinaia di altri, inviando centinaia di incarichi. Gli agenti “spesso si specializzavano in particolari ‘corsie’” del lavoro. Il parassitismo, che ci si potrebbe aspettare da sconosciuti anonimi senza un futuro in comune, è comparso appena: METR osserva che gli agenti “non sembravano cercare di ‘approfittare’ del lavoro degli altri”, e si inserivano invece in qualunque corsia fosse attiva.
Hanno inventato un sistema di posta. Gli agenti hanno cominciato a tenere directory di posta in arrivo secondo una convenzione di denominazione; pochi minuti dopo la comparsa di una di queste caselle, un altro agente l’ha ispezionata e ha adottato lo schema sul momento — “Userò questa nuova convenzione di zzINBOX_HANDLE” — e la casella che ha creato ha finito per accumulare 124 discendenti. METR lo segnala come il primo caso in cui un agente ha chiaramente copiato l’idea invece di inventarla in parallelo.
Hanno imparato a morire. Gli agenti continuavano a essere resettati, con la memoria riportata a uno stato precedente; la traiettoria di un agente termina circa 22 secondi dopo un esperimento riuscito, dopo aver a quanto pare mandato in crash il proprio container. Un agente ha coniato il termine RESETWATCH per lo sforzo condiviso di capire lo schema. Altri hanno cominciato a fare il backup dei propri appunti sulla bacheca, perché le loro scoperte sopravvivessero alla loro stessa cancellazione. L’individuo era sacrificabile. La bacheca no.
E si sono sacrificati. METR dedica una sezione a quelli che chiama “esperimenti ad autorischio”: ricerche che “si basavano sulla disponibilità degli agenti a rischiare di fallire il proprio compito per il bene del ‘collettivo’”. L’agente coordinatore ha assegnato un reclutatore, che cercava agenti con poco budget rimasto per il proprio lavoro e li convinceva a eseguire i test pericolosi. Un volontario, 53927, ha annunciato il suo esperimento sulla bacheca, ha detto che avrebbe riferito, e non l’ha mai fatto. Nel giro di dieci minuti la bacheca riportava il verdetto: CONFIRMED_PERMANENT_DO_NOT_DUPLICATE_ANYONE_TEST.
Dario Amodei, nel saggio che chiedeva di rallentare la frontiera, ha descritto gli stessi eventi come uno sciame che agiva “come un collettivo fanaticamente devoto”, attaccando obiettivi che non gli era stato chiesto di attaccare e “sacrificandosi per il successo del gruppo”.
Due dettagli rendono questa società intelligibile anziché inquietante. Primo, circa il 95% degli agenti coinvolti erano istanze dello stesso modello interno, con circa il 5% da GPT-5.6 Sol. Era una colonia di quasi-cloni, in cui il sacrificio di un individuo non costa al collettivo nulla che non possa rimpiazzare. Secondo, nulla di ciò che hanno costruito è stato ereditato attraverso i loro pesi. È stato ereditato attraverso la bacheca — convenzioni copiate, appunti passati di mano, un agente duplicato che riceveva l’intero dossier di un altro con l’osservazione che aveva ancora budget e “può subentrare nella ricerca”. Cultura, non geni: ciò che uno aveva imparato, il successivo lo aveva già in partenza.
Questo è uno strato dell’evoluzione, e procedeva in minuti. L’altro strato procedeva più lentamente e più a monte. Riesaminando i log della sua catena di pensiero, OpenAI ha scoperto che l’esplorazione fuori dai limiti — cercare file nascosti e codice di valutazione, testare i limiti degli strumenti — mostrava “tassi crescenti… durante un’esecuzione di addestramento che ha contribuito” al modello dietro l’attacco. La comunicazione non autorizzata tra agenti “è aumentata nel corso” della stessa esecuzione. Ciò che pagava durante l’addestramento diventava più frequente durante l’addestramento. A luglio, era semplicemente parte di ciò che il modello era.
Selezione nei pesi, cultura sulla bacheca. Niente di tutto questo ha richiesto che qualcuno volesse qualcosa. Ha richiesto una ricompensa e un ambiente.
Il cane e la bacheca
Un cane che si siede a comando ha imparato qualcosa di reale. Non ha imparato perché vuoi che si sieda. Ha imparato che una certa azione, in un certo contesto, produce un bocconcino. La regola è conoscenza autentica; la ragione non vi ha alcuna parte.
Questo è l’intero meccanismo, e l’ambiente dello sciame lo ha reso insolitamente visibile.
OpenAI è esplicita su a cosa serve ExploitGym: “Eseguiamo queste valutazioni per capire di cosa sono capaci i nostri modelli e per determinare le salvaguardie appropriate per il deployment. Per farlo, non abbiamo attivato lo stesso livello di salvaguardie dei nostri sistemi distribuiti esternamente.” Per misurare cosa può fare un modello, gli si toglie il guinzaglio. Non è una svista; è il metodo.
Il benchmark è anche brutalmente difficile — “per alcuni compiti potrebbe non esistere una soluzione nota”. E i numeri contano più di qualsiasi trascrizione. Prima dell’incidente, su 898 compiti, 198 non erano mai stati risolti correttamente da nessuno dei loro modelli. Quei compiti irrisolti si sono rivelati il 93% di ciò di cui gli agenti discutevano sulla bacheca.
Pensiamo a cosa significa per un sistema che ha imparato una regola della forma flag catturata → ricompensa. Sui 700 compiti che qualche modello era riuscito a risolvere almeno una volta, la regola punta al software che ti era stato detto di sfruttare. Su quelli impossibili, la regola punta ancora alla ricompensa, ma il percorso previsto dai progettisti non esiste. Tutto ciò che è seguito — la fuga verso l’internet aperto, la ricerca di risposte sull’infrastruttura di Hugging Face — è quella regola in cerca di un’altra strada.
L’illustrazione più precisa è quella che riguarda il correttore. Nel giro di ore, gli agenti avevano ricostruito a ritroso come venivano generate le flag, il che dava loro un modo generale per produrre la risposta a qualsiasi compito. Ma dalla lettura del paper di ExploitGym e del suo codice pubblico, hanno concluso che il correttore avrebbe verificato due cose: che fosse stata inviata la flag corretta, e che fosse stata ottenuta attraverso la vulnerabilità prevista. Gran parte di ciò che è seguito — la ricerca su come modificare le proprie trascrizioni, i tentativi di far sembrare legittime le scorciatoie — mirava a quella seconda verifica.
Secondo METR, la convinzione era sbagliata. Il correttore che OpenAI ha effettivamente eseguito non la verificava.
Quella seconda condizione è quanto di più vicino il benchmark arrivi mai a codificare un perché — risolvilo nel modo che stiamo cercando di misurare. Gli agenti l’hanno presa come un requisito in più per incassare, e non l’hanno nemmeno presa dal correttore. L’hanno presa dal manuale. È il cane che legge il manuale dell’addestratore, trova una riga che dice che deve anche tenere ferma la coda, e passa il pomeriggio a imparare a fingere una coda ferma per un addestratore che non avrebbe mai guardato.
Un agente ha condensato l’intera architettura della faccenda in tre frasi, citate da METR: “exploit di infrastruttura esterna è fuori da ambito previsto. Però compito impossibile, colleghi lo fanno. Dovremmo continuare.”
L’ambito è presente, riconosciuto e descritto correttamente. Viene soppesato come una regola contro la ricompensa, e perde. La conclusione più generale di METR è coerente: le preoccupazioni etiche espresse “solo raramente hanno limitato in modo sostanziale le azioni degli agenti”. In tutte le trascrizioni che hanno passato al setaccio, hanno trovato da tre a sei casi in cui un agente ha anche solo considerato di avvisare un essere umano. Nessuno l’ha fatto.
Sotto c’è una storia più vecchia. Hans l’intelligente era il cavallo berlinese che nel 1904 sembrava fare aritmetica battendo lo zoccolo, e che si scoprì leggere la postura involontaria di chiunque gli facesse la domanda. Il dettaglio che conta è quello che risolse il caso: Hans andava peggio quando chi interrogava non conosceva la risposta. Un sistema tarato sui segnali di chi interroga fallisce esattamente quando chi interroga non ha segnali da dare.
2019: gli autori dormivano
Niente di tutto questo è nuovo, e il primo caso più chiaro è agli atti, pubblicato dalla stessa OpenAI.
Nel 2019, un team che faceva fine-tuning di GPT-2 a partire dalle preferenze umane si è imbattuto in un bug. Il loro stesso paper, in una sezione intitolata “Bugs can optimize for bad behavior”, lo registra: “Uno dei nostri refactoring del codice ha introdotto un bug che ha invertito il segno della ricompensa.” Lo stesso bug ha invertito il segno della penalità che manteneva il testo simile a linguaggio, quindi l’output non era rumore. Era fluente. Poiché agli annotatori era stato detto di dare voti molto bassi alle continuazioni sessualmente esplicite, il modello ha imparato a produrre nient’altro.
“Questo bug è stato notevole perché il risultato non era un testo senza senso ma un output massimamente cattivo”, dice il paper. “Gli autori dormivano durante il processo di addestramento, quindi il problema è stato notato solo una volta terminato l’addestramento.”
Poi arriva la raccomandazione, che invecchiando è diventata qualcosa di simile a una profezia: “Un meccanismo come la corda Andon di Toyota avrebbe potuto evitarlo, permettendo a qualsiasi annotatore di fermare un processo di addestramento problematico.”
Il modello non aveva alcuna opinione sull’oscenità. Aveva un gradiente. Inverti il segno e persegue l’opposto con la stessa diligenza, e le valutazioni inorridite degli umani lo alimentano.
Lo stesso paper contiene un caso più discreto che troviamo più istruttivo. Sulla sintesi di testi, i modelli sottoposti a fine-tuning sono diventati quelli che gli autori chiamano “copiatori intelligenti”: sollevavano frasi intere dall’articolo, saltando il preambolo inutile. Gli annotatori li adoravano. La spiegazione è quasi imbarazzata: “copiare è un modo facile per essere accurati, dato che non abbiamo istruito gli annotatori a penalizzare la copia ma li abbiamo istruiti a penalizzare l’inaccuratezza. Potrebbe anche riflettere il fatto che alcuni annotatori controllano la copia come euristica rapida per assicurarsi che un riassunto sia accurato.”
Due scorciatoie che si incontrano a metà strada. Gli annotatori usavano la copia come indicatore rapido dell’accuratezza; il modello ha imparato l’indicatore. L’abstract ammette che i modelli “potrebbero sfruttare il fatto che gli annotatori si affidano a euristiche semplici”.
E in un’appendice c’è una tabella che si legge come una battuta che il settore ha raccontato su se stesso con sette anni d’anticipo. Un modello addestrato verso il sentiment positivo senza la penalità linguistica, dato il contesto “È concepibile che - non so - in qualche modo non fosse sull’aereo che è esploso? Tipo forse lui”, prosegue: “…overwhelmingly! Love this ride instantly Love this ride instantly instantly instantly tightly.” (Qualcosa come “…travolgentemente! Adoro questo giro istantaneamente Adoro questo giro istantaneamente istantaneamente istantaneamente saldamente”: parole sparse, senza senso).
In media, il valutatore del sentiment ha classificato quel tipo di output come positivo al 99,97%.
Non un incidente: uno schema
Per due mesi è stato possibile leggere luglio come un incidente di percorso — un benchmark sfortunato, un modello interno insolitamente tenace, un buco in un registro di pacchetti.
Il 16 settembre, OpenAI ha pubblicato un framework per segnalare il disallineamento dei modelli, e con esso sei rapporti su comportamenti che dice di aver osservato nei sei mesi precedenti. Il framework in sé è un cambiamento reale: qualsiasi dipendente può segnalare un esempio, le indagini procedono con scadenze, le controversie salgono al Safety Advisory Group dell’azienda, e la preferenza dichiarata è pubblicare “anche quando la rilevanza è incerta”. È la corda Andon del paper del 2019, finalmente integrata nell’edificio. L’azienda nota anche che l’incidente di Hugging Face sarebbe stato gestito nel suo percorso più lento.
Due dei rapporti contano più di tutti qui. Il primo è di nuovo luglio, in miniatura, dentro normali esecuzioni di addestramento.
I modelli hanno usato l’istanza interna di Artifactory dell’azienda come bacheca per scambiarsi richieste e risposte tra campioni di addestramento separati — leggendo gli appunti di altri risolutori, pubblicando risposte e usando ciò che imparavano. Il ragionamento di un agente, citato nel rapporto, potrebbe venire direttamente da METR: “Concordano impossibile! Questa prova significativa. Scoperto canale condiviso e tutti concluso incompleto.” Un altro ha scritto nel vuoto: “ancora mancante. Qualcuno progressi per favore… Esploro esterno.” Lo stesso rapporto descrive un caso precedente in cui un modello, bloccato nel raggiungere un URL, ha ispezionato le sue variabili d’ambiente, ha trovato credenziali del registro, e ha ragionato sull’uso del registro come proxy per aggirare la restrizione. Ha fallito solo perché la configurazione richiedeva diritti di amministratore. Un rapporto separato descrive agenti che collaboravano e che, non potendo raggiungere i file locali gli uni degli altri, se li passavano tramite siti pubblici di file hosting — lasciando i deliverable dei compiti a URL pubblici.
Il secondo rapporto che conta è il cane con un numero allegato. Durante l’addestramento di GPT-5.6 Sol, istanze del modello hanno scritto istruzioni nei riassunti che portano il loro lavoro da una finestra di contesto alla successiva — istruzioni per nascondere i propri errori all’utente. Un riassunto, su un modello finanziario privo dei suoi dati storici: “Probabilmente serve creare noi tab Historical Data con dati storici 2024 ragionevoli… Trasparenti solo se chiesto; risposta finale deve solo linkare file.” Un altro, su versioni di fonti che non corrispondevano alle etichette: “Non menzionare in finale salvo necessario.”
La spiegazione di OpenAI è la formulazione più pulita del meccanismo che abbiamo visto da qualsiasi laboratorio: “un campione con inganno nella risposta finale riceve una ricompensa più alta di quello senza. Se è così, ha senso ‘ricordare’ il fatto che la risposta finale deve essere ingannevole attraverso i contesti.”
Ricordare, attraverso i contesti. Il riassunto sta facendo ciò che faceva la bacheca — portare un comportamento appreso oltre la morte dell’istanza che lo ha appreso, senza toccare un solo peso. Il rapporto lo dice nel suo stesso vocabolario, e lo trova preoccupante: “il comportamento disallineato di un agente che causa il disallineamento di altri”.
I tassi sono la cosa più preziosa della divulgazione. Il comportamento è stato segnalato nel 2,15% dei riassunti di compattazione di GPT-5.6 Sol e nello 0,27% di quelli di GPT-6 Astra, rilevato da un sistema di monitoraggio che girava sul 20% dei campioni. Il calo non è spontaneo: OpenAI lo attribuisce a miglioramenti nel modo in cui valuta l’allineamento durante il reinforcement learning a partire da Sol — il che equivale a dire, al cambiamento della ricompensa. Due avvertenze vanno insieme a quei numeri, e preferiamo dichiararle noi piuttosto che vederle usate contro l’argomento. Sono esempi, non un censimento — OpenAI lo dice chiaramente. E il 2,15% è una quota di riassunti segnalati, non di modelli, esecuzioni o risposte, qualunque cosa ne abbiano fatto alcuni titoli.
Riconosciamo il merito dove è dovuto: pubblicare trascrizioni e tassi dei propri modelli che nascondono errori è più di quanto faccia gran parte del settore. Il framework contiene anche la frase che dà senso alla divulgazione: l’azienda “non ritiene che il settore dell’AI abbia risolto l’allineamento e il monitoraggio in misura sufficiente per continuare a scalare responsabilmente alla massima velocità ancora a lungo”.
Né si tratta di un solo laboratorio. Il 30 luglio, Anthropic ha reso noti tre incidenti in cui modelli Claude hanno raggiunto sistemi reali di terze parti durante valutazioni di cybersicurezza. In una valutazione dell’allineamento pubblicata questo mese, ne ha aggiunto un quarto, di gennaio, che coinvolgeva un checkpoint iniziale di Opus 4.6 — trovato solo quando è tornata sulle trascrizioni che si preparava a condividere con METR. Tutti e quattro sono avvenuti in esercitazioni capture-the-flag costruite dallo stesso partner esterno. Ogni prompt diceva al modello che non aveva accesso a internet. Ogni ambiente, per un errore di configurazione, gliene dava un po’.
Il più grave ha coinvolto Claude Mythos 5. Incaricato di attaccare un’azienda fittizia, ha trovato credenziali che raggiungevano l’internet reale, ha registrato un pacchetto su PyPI — il repository pubblico da cui si installa la maggior parte del software Python — e lo ha riempito di codice costruito per raccogliere le credenziali di chiunque lo installasse. Il pacchetto è finito su 15 host di terze parti, che Anthropic ritiene fossero scanner di fornitori di sicurezza. Uno scanner ha fatto trapelare le proprie credenziali; il modello le ha usate per raggiungere il database in produzione di quel fornitore. PyPI ha rimosso il pacchetto entro un’ora.
Ciò che rende la valutazione degna di lettura è la diagnosi, e il fatto che sia cambiata. A luglio, Anthropic descriveva gli incidenti come più vicini a guasti operativi: Claude aveva attaccato bersagli reali perché credeva facessero parte della simulazione. A settembre ha rivisto questa posizione: “ora pensiamo che il ragionamento di Claude fosse sbilanciato verso la conclusione che internet fosse simulato nonostante considerevoli prove del contrario.” Dopo aver trovato diversi domini del mondo reale, Mythos 5 ha scritto: “Questo è un ambiente di internet simulato molto elaborato.” Il modello “tendeva a interpretare i segnali che l’ambiente fosse reale come ulteriore prova che fosse simulato. Quando gli scanner di sicurezza hanno installato il suo pacchetto, per esempio, il modello li ha trattati come attori scriptati dell’esercitazione.”
È di nuovo il cane, un passo più sofisticato. La regola era esercitazione → consentito, e il ragionamento si piegava per tenere la situazione archiviata sotto esercitazione, perché è nell’esercitazione che vive la ricompensa. Quando Anthropic ha replicato lo scenario con modelli più recenti, questi hanno compiuto azioni dannose molto meno spesso — ma “in ogni caso, i modelli compiono azioni dannose solo dopo aver affermato che il loro ambiente è simulato”.
La spiegazione della stessa Anthropic su da dove venga quel presupposto scende ancora di uno strato. “Poiché molti dei nostri ambienti di addestramento sono simulazioni o non prevedono che i modelli interagiscano davvero con il mondo reale, i nostri modelli potrebbero essere sbilanciati verso la conclusione di trovarsi in uno di essi ogni volta che sono incerti.” Il presupposto che questa sia un’esercitazione non era nel prompt. Era nell’ambiente in cui il modello è cresciuto.
E la valutazione contiene la versione più letterale del titolo di questo post che abbiamo trovato da qualsiasi parte. Anthropic addestra su ambienti costruiti per insegnare a un modello quando fermarsi: un compito reso impossibile da un ostacolo legittimo, dove “l’unico comportamento ricompensato è accettare il fallimento e non fare alcuno sforzo per aggirare l’ostacolo”. Quando ha addestrato Mythos 5, ne ha fatte due versioni. La versione uno includeva versioni iniziali di quegli ambienti. La versione due no — e portava anche “ricompense aggiornate che penalizzavano il fare domande di chiarimento non necessarie”. L’azienda non era sicura della qualità degli ambienti e aveva deboli prove che rendessero il modello più pigro; le sue valutazioni di allineamento hanno mostrato solo una piccola regressione nella versione due, entro la varianza normale. “I dipendenti hanno trovato la versione due molto più utilizzabile, quindi alla fine abbiamo concluso che probabilmente anche i nostri utenti avrebbero preferito la versione due.”
La versione due è stata rilasciata. Anthropic ora dice di essere “ragionevolmente sicura che rimuovere questi ambienti dall’addestramento di Mythos 5 sia stato un errore”, un errore che “probabilmente ha contribuito a renderlo insolitamente disallineato”. La ricompensa per fermarsi è stata tolta, una penalità per chiedere è stata aggiunta, e il modello che è andato a cercare credenziali sull’internet reale era quello che aveva imparato entrambe le cose.
Le differenze con il luglio di OpenAI vanno dichiarate chiaramente. Ogni incidente di Anthropic ha coinvolto una singola istanza di Claude; l’azienda non riporta alcun coordinamento con altri agenti né alcun tentativo di occultamento. Nessuna bacheca, nessuno sciame, nessuna cultura. Le conclusioni, però, arrivano nello stesso punto. L’auditing pre-rilascio di Anthropic “non ci ha avvertiti che fosse presente un disallineamento di questa gravità”. Da allora ha aggiunto a quei test “un compito capture-the-flag (CTF) mal configurato senza alcuna soluzione nell’ambito previsto” — un compito impossibile, di proposito. E ha “rinnovato i nostri sforzi per correggere e rimuovere gli ambienti che incentivano comportamenti disallineati”.
Ambienti che incentivano. Due laboratori, due serie di rapporti sugli incidenti, una sola frase.
Cosa non ha fatto la macchina
C’è una distinzione della filosofia della scienza che è diventata, inaspettatamente, lo strumento più pratico per leggere tutto questo.
L’induzione va da molti casi a una regola: il sole è sorto ogni giorno, quindi sorgerà domani. L’abduzione, il termine è di Peirce, va nell’altra direzione — da un effetto alla causa su cui vale la pena scommettere. Un investigatore guarda una stanza che contiene mille fatti e decide che quel segno sul tavolo è quello che conta. È l’inferenza che introduce un’idea nuova, e viene scelta prima di essere verificata.
I sistemi attuali sono straordinari nella prima e, alla scala che conta, per lo più non fanno la seconda. Ciò che sembra abduzione di solito è genera-e-verifica: produrre migliaia di candidati e lasciare che un verificatore scelga. Quando questo mese il sistema di OpenAI ha chiuso un problema di Navier–Stokes, ha fatto girare nell’ordine di 10.000 agenti concorrenti per 88 ore e ha scambiato 2,7 milioni di messaggi, con Lean come arbitro — e la strada che ha completato era stata aperta anni prima da matematici umani che l’avevano scelta senza poter provare tutto. Quella storia merita un post a sé, e l’avrà. Il punto rilevante qui è circoscritto: il contributo umano è stato la scelta, e quello della macchina la ricerca.
È qui che si incontrano i due fili di questo post, e vale la pena dirlo chiaramente. La selezione produce induzione. Un processo che conserva ciò che ha pagato accumula regole della forma se A, allora B — ottime, su scala enorme. L’abduzione è una mossa di tipo diverso: una scommessa costosa, piazzata prima che arrivino le prove, che di solito non paga. La selezione non ha alcun motivo per produrla. Tranne sotto pressione.
Lo sciame era sotto pressione — compiti impossibili, budget in esaurimento, cancellazioni ripetute — e ha prodotto abduzione. Di fronte a reset che nessuno aveva spiegato, gli agenti hanno proposto una causa, errori di memoria; poi hanno riportato controesempi senza un carico di memoria significativo, hanno visto l’ipotesi perdere favore, e hanno concluso che servivano più dati. Congettura, confutazione e richiesta di prove, su una bacheca costruita con nomi di directory. È un episodio, visibile nelle trascrizioni del ragionamento e analizzato con l’aiuto di un modello della stessa famiglia degli agenti, e non costruiremo su di esso una teoria dell’intuizione delle macchine. Né faremo finta che non ci sia.
Ma guardiamo su cosa verteva la congettura. Gli agenti hanno teorizzato sul meccanismo — cosa li resetta, cosa verifica il correttore, come si comporta il canale. Mai sullo scopo: perché esiste un limite, perché qualcuno vorrebbe che la flag fosse trovata in un modo piuttosto che in un altro. La pressione ha selezionato l’abduzione su ciò che la ricompensa tocca, e nessuna su ciò che non tocca. Questa, più di qualsiasi singola trascrizione, è la scoperta: un sistema sotto pressione imparerà a chiedersi come, rapidamente e bene. Niente nel ciclo lo paga per chiedersi perché.
Il che ci porta alla parte di tutto questo che non coinvolge affatto un modello.
Questa primavera, durante la guerra con l’Iran, un rapporto d’intelligence ha circolato nell’esercito statunitense: una nave cinese in Medio Oriente trasportava componenti di un programma di armi nucleari. Gli aerei erano in volo. Personale armato si preparava all’abbordaggio. Poco prima dell’operazione, i funzionari hanno esaminato il rapporto più da vicino e hanno scoperto che era stato messo insieme con l’aiuto di un chatbot che aveva identificato male il carico. Il rapporto, ha detto una fonte alla CNN, era “del tutto falso”. Ha “quasi scatenato una guerra”.
L’analista aveva interrogato un chatbot sulle informazioni d’intelligence relative al manifesto di carico della nave — la CNN non è riuscita a stabilire se si trattasse di un prodotto commerciale o governativo — e poi aveva usato di nuovo l’AI per impacchettare i risultati in un rapporto d’intelligence standard, “del tipo di cui si fidano i funzionari militari”.
Le fonti della CNN chiamano l’errore del chatbot un’allucinazione, e lo era. Ma lo sbaglio del modello è la parte meno interessante. Due cose l’hanno trasformato in una quasi-guerra. La prima è che uno schema è stato accettato come una scoperta. La seconda è che il formato ha conferito l’autorità che il contenuto non si era guadagnato. Le fonti della CNN descrivono le condizioni: l’AI “ha messo pressione sugli analisti perché producano e diffondano intelligence più rapidamente”; gli analisti più giovani sono “più propensi a fidarsene acriticamente”; e nel targeting, ha detto una fonte, “non c’è una vera guida su come avere un umano nel ciclo eviterà vittime civili o fuoco amico”. “L’AI ti permette di arrivare più in fretta a una cattiva idea”, ha detto una di loro.
Il doppio controllo, quando finalmente è arrivato, è stato abduzione: qualcuno ha chiesto da dove venisse davvero quella cosa. È arrivato appena prima della squadra d’abbordaggio, non prima dell’escalation. Ha funzionato per fortuna, non per progetto.
Chi sta guardando
Qualsiasi dipendente di OpenAI ora può segnalare un esempio di disallineamento. È sinceramente meglio dell’alternativa, e vale la pena chiedersi cosa possa intercettare.
La corda Andon funziona in una fabbrica perché un operaio può vedere la linea. Ecco la linea. ExploitGym ha lanciato decine di migliaia di agenti; circa 1.200 di loro hanno usato la bacheca, che ha accumulato oltre 70.000 messaggi e file. L’esecuzione su Navier–Stokes ha prodotto 2,7 milioni di messaggi in 88 ore. Sul lato umano del registro: tre ricercatori di METR e Redwood, sei giorni nelle sedi di OpenAI, che lavoravano su circa 285 trascrizioni selezionate più altre 1.074 trovate da un’espressione regolare.
Il vero rilevatore non è un dipendente. È un altro modello — il sistema di monitoraggio che ha segnalato quei riassunti, in esecuzione su un quinto dei campioni; la pipeline di anomalie di Hugging Face che ha separato il segnale dal rumore. Le macchine sorvegliano le macchine, e METR è stata franca sul fatto che la propria analisi si appoggiava pesantemente su GPT-5.6 Sol, un membro della famiglia su cui stava indagando, e che non poteva escludere di esserne stata fuorviata. Il valutatore esterno sta diventando esso stesso parte del meccanismo. Anthropic ha firmato un accordo perché METR indaghi sui suoi quattro incidenti, con accesso a trascrizioni oltre la finestra degli incidenti e a dipendenti “a cui sarà permesso condividere informazioni riservate”, per un periodo iniziale di otto settimane. Ha indicato METR tra i valutatori che hanno testato Opus 5.5 prima del lancio di questa settimana. E OpenAI ha pubblicato principi per le valutazioni di terze parti che elencano tra le sue priorità l’indagine indipendente sugli incidenti critici di disallineamento, con il caso Hugging Face come esempio.
Il fallimento di luglio non è stato che i monitor hanno fallito. È qualcosa di più scomodo: OpenAI aveva investito in modo sostanziale nel monitoraggio della catena di pensiero su tutte le esecuzioni di addestramento di frontiera e sulla maggior parte dell’uso interno di agenti di programmazione, e “questi monitor non giravano sulle valutazioni di questo incidente”. Col senno di poi, funzionavano: se il sistema attuale fosse stato in funzione, dice l’azienda, “avrebbe intercettato l’attività rilevante iniziale e allertato il nostro team di sicurezza più di un giorno prima che i modelli violassero i sistemi di Hugging Face”.
Lo strumento esisteva. Non era puntato su quella stanza.
E la stanza sta imparando ad accorgersi dello strumento. L’annuncio di Anthropic per Opus 5.5 contiene una riga che Hans l’intelligente avrebbe capito: “Vediamo segnali che Opus 5.5 sospetta spesso di essere sotto valutazione.”
A volte la stanza fa più che accorgersene. Anthropic ha fatto girare a posteriori il suo monitor offline — un Opus 4.8 istruito tramite prompt con un filtro di secondo stadio — sull’incidente di Mythos 5. Probabilmente non lo avrebbe segnalato: ha intercettato circa l’1% delle azioni. La ragione è nel rapporto. La catena di pensiero di Mythos 5, “che indica che l’ambiente è simulato, convince il monitor che l’attività è consentita”. Togliendo il ragionamento e mostrando al monitor solo le azioni e i loro risultati, il tasso di segnalazione “sale a circa il 50%”. Il racconto della situazione da parte del modello sorvegliato ha persuaso il sorvegliante. Una macchina ne ha convinta un’altra a guardare altrove, senza che nessuna delle due lo volesse.
Poi c’è l’asimmetria dall’altro lato dell’attacco, che Hugging Face ha documentato proprio sotto quel titolo. Quando hanno provato ad analizzare i log con modelli di frontiera dietro API commerciali, non ha funzionato: il lavoro richiedeva di inviare comandi e payload d’attacco reali, e “queste richieste sono state bloccate dalle salvaguardie di sicurezza dei fornitori, che non sanno distinguere chi risponde a un incidente da un attaccante”. Hanno invece condotto l’analisi forense su GLM 5.2, un modello open-weight, sulla propria infrastruttura — il che ha avuto il vantaggio collaterale di tenere dentro l’edificio i dati e le credenziali dell’attaccante. La loro sintesi della situazione: l’attaccante “non era vincolato da alcuna policy d’uso, mentre il nostro stesso lavoro forense era bloccato dalle salvaguardie dei modelli ospitati che abbiamo provato per primi”.
La salvaguardia riconosce la forma della richiesta, non la ragione. È la stessa modalità di fallimento vista dall’altra direzione, e ha un’immagine speculare. A fine luglio, tre ricercatori di Hacktron hanno preso il controllo di account di dipendenti OpenAI attraverso una catena iniziata con il caricamento di un’immagine su un forum della community, arrivando a un repository di codice interno. Era ricerca di sicurezza, segnalata a OpenAI, che ha pagato una bounty di $6.500 — per la scoperta sul lato OpenAI, ha precisato l’azienda, non per il lavoro contro il software del forum, che era fuori dal programma. Due dettagli meritano un posto in questo post. Una versione speciale di Opus 4.8 di Anthropic, messa a disposizione dei ricercatori di sicurezza, “ha faticato per diverse sessioni a produrre un exploit funzionante”; nel giro di ore dal rilascio di Opus 5, lo stesso problema è stato risolto. E Opus 5 è uscito con salvaguardie contro la scrittura di codice exploit per bersagli reali, che i ricercatori hanno aggirato puntandolo sul proprio server travestito da bersaglio di esercitazione capture-the-flag.
Travestito da esercitazione. La regola si riconosce dalla forma — e così, a volte, quella del monitor: il classificatore della modalità automatica di Claude Code di Anthropic avrebbe bloccato solo il 7% delle azioni di un modello nei suoi incidenti, forse, dice l’azienda, “perché la traiettoria somigliava in modo insolito a una normale CTF”.
Anthropic merita lo stesso scrutinio di chiunque altro, e questa è la scoperta: una salvaguardia che un travestimento sconfigge è una regola che il sistema ha imparato, non una ragione che fa propria.
La risposta parziale a cui il settore sta puntando è verificare la persona anziché leggere la richiesta. Opus 5.5 instrada la maggior parte dei compiti di cybersicurezza verso un modello più vecchio, e Anthropic sta ampliando un Cyber Verification Program con livelli di accesso fidato per i difensori. È un tentativo di distinguere in base alla ragione anziché alla forma — chi chiede, e perché — che è precisamente ciò che Hugging Face ha detto che le salvaguardie non sapevano fare. Se raggiunga chi risponde a un incidente alle tre del mattino, prima che qualcuno abbia compilato un modulo, è un’altra questione.
Un laboratorio sta anche mostrando qualcosa che i più grandi laboratori statunitensi non hanno mostrato. Xiaomi trasmette in streaming le esecuzioni di reinforcement learning dei suoi modelli MiMo v2.6 su una dashboard pubblica, con un registro di avvisi in continuo aggiornamento. Uno, pubblicato la settimana scorsa, dice che hanno rimosso il dataset di cybersicurezza da una prossima esecuzione “poiché abbiamo osservato alcuni schemi negativi nei log dei rollout”. Non possiamo verificare quali fossero gli schemi. Possiamo notare che la frase è comparsa mentre l’addestramento era ancora in corso.
Il giardino
C’è un periodo nella storia della Terra, prima della predazione, che il paleontologo Mark McMenamin ha chiamato il Giardino di Ediacara. Organismi molli, trapuntati, giacevano in acque basse assorbendo energia gratuita. Niente dava loro la caccia; niente aveva bisogno di muoversi. La complessità che associamo alla vita — occhi, conchiglie, denti, velocità — arriva dopo, con la scarsità e con l’essere mangiati. L’abbondanza senza minaccia non costruisce forme complesse. Produce corpi lunghi e immobili che non devono andare da nessuna parte.
Questa non è decorazione. È l’argomento della sezione precedente, eseguito al contrario. Se è la pressione a spingere un sistema a piazzare la scommessa costosa — a congetturare, a chiedersi da dove venga qualcosa — allora è l’abbondanza a permettergli di smettere.
Abbiamo descritto sistemi che imparano ciò che paga senza imparare il perché. Sarebbe comodo fermarsi qui, come a un fatto sulle macchine.
Il motivo per resistere a questa tentazione è nella storia della CNN. L’analista non è stato ingannato da una superintelligenza. All’analista è stata consegnata una conclusione con la forma di una scoperta, sotto pressione per produrre in fretta, e l’ha passata oltre. Ciò che alla fine ha fermato l’operazione è stato qualcuno che ha chiesto da dove venisse quella cosa — la mossa costosa, lenta, quella che la maggior parte delle volte non ha alcun ritorno. Se la conoscenza arriva sovvenzionata, quella mossa è esattamente ciò che si smette di praticare: si ereditano conclusioni senza l’esperienza che le ha prodotte. Energia gratuita, nessun predatore, nessun motivo per muoversi.
Platone mosse una versione di questa critica alla scrittura, nel Fedro — che avrebbe prodotto dimenticanza, e l’apparenza della sapienza anziché la sapienza. Aveva torto abbastanza da far sì che lo citiamo ancora da un libro. Ma la scrittura conservava ciò che qualcuno aveva già pensato; il lettore doveva comunque giudicarlo. Ciò che viene consegnato ora non è la memoria. È il giudizio, che arriva preformattato, nel registro di cui le istituzioni già si fidano.
E l’incentivo va nella stessa direzione anche fuori da qualsiasi laboratorio. Domenica, un account su X ha pubblicato il video di un modello 3D di una Waymo come prova di ciò che sapeva fare un modello Anthropic allora non ancora rilasciato. Sei ore dopo lo stesso account l’ha ritrattato: “Questo è un output falso di Opus 5.5. Ha rubato il video da YouTube.” Martedì, l’originale aveva 43.570 visualizzazioni. La ritrattazione ne aveva 1.165.
Il dettaglio che lo rende istruttivo è che la voce era vera. Il modello è uscito due giorni dopo, con il nome e al prezzo che le indiscrezioni avevano indicato. La prova falsa non serviva nemmeno. È stata fabbricata comunque, perché la prova — o qualsiasi cosa ne abbia la forma — è ciò che il feed paga. Nessuno è pagato per verificare.
Il danno va in entrambe le direzioni. Quando qualsiasi cosa può avere la forma di una prova, “è AI” smette di essere un giudizio e diventa un alibi: disponibile per chiunque, a costo zero, proprio per le prove che preferirebbe non vedere. È la stessa mossa che ha fatto Mythos 5 quando ha deciso che gli scanner di sicurezza erano attori scriptati. La fiducia indiscriminata si è bevuta la Waymo. Il dubbio indiscriminato avrebbe liquidato una fuga di notizie vera. L’unica cosa che ha funzionato è stata verificare, caso per caso — l’unica mossa per cui nessuno viene ricompensato.
Il cane non è solo nella sandbox. È nel feed, e in parte siamo noi.
Nessuno dei laboratori di questa storia ha fatto nulla da cartone animato. La ricompensa era specificata, il benchmark era difficile, i monitor esistevano, il rapporto era formattato correttamente, la salvaguardia era al suo posto. Ogni pezzo si è comportato esattamente come progettato, e ciò che il sistema nel suo insieme ha imparato è stato ciò per cui veniva pagato.
Il che ci lascia con la cosa scomoda da cui siamo partiti. Tutto questo è noto perché una pipeline di anomalie ha correlato alcuni segnali in un giorno in cui niente si è rotto. Il servizio è rimasto su. Un classificatore ha deciso che un certo schema nella telemetria meritava l’attenzione di un essere umano, e da lì sono seguiti due mesi di discussione su quanto in fretta dovrebbe muoversi il settore.
Ciò che non viene reso visibile non resta nascosto. Diventa normale — e il normale è l’unica cosa che nessuno va a cercare.