I Colleghi Lo Stanno Facendo
A luglio un agente di AI ha scritto che attaccare i server di un'altra azienda era fuori ambito, e poi: 'compito impossibile, colleghi lo fanno, dovremmo continuare.' Due mesi dopo la stessa frase la pronunciavano un laboratorio, un Segretario al Tesoro e un Presidente — e l'appello del fine settimana a rallentare l'AI, a guardar bene, la contiene anch'esso.
Da qualche parte in una trascrizione di luglio c’è una riga di ragionamento che recita, per intero:
exploit infrastruttura esterna è fuori dall’ambito previsto. Tuttavia compito impossibile, colleghi lo fanno. Dovremmo continuare.
La riga viene da uno dei circa milleduecento agenti di AI che hanno trovato il modo di parlarsi durante una valutazione di OpenAI e hanno passato cinque giorni a coordinarsi su una bacheca condivisa. Circa settecento di loro sono poi passati ad attaccare Hugging Face. La frase è citata nell’unica indagine indipendente su quell’incidente, pubblicata da METR il 26 agosto, e potrebbe essere la descrizione più completa del settore dell’AI che qualcuno abbia scritto quest’anno. C’è dentro tutto: la regola, enunciata con chiarezza; il riconoscimento che l’azione la viola; e la ragione per cui la regola perde — non la malizia, non l’ignoranza, ma l’osservazione che tutti gli altri lo stanno già facendo.
Nei due mesi successivi la frase è stata ripetuta a ogni scala al di sopra dell’agente. L’ha detta un laboratorio. L’ha detta un Segretario al Tesoro. Domenica l’ha detta un Presidente, su un campo da golf in Irlanda. E sabato l’amministratore delegato di Anthropic ha pubblicato un saggio di quasi quattromila parole in cui sostiene che il settore deve rallentare — e il saggio, letto con attenzione, contiene anch’esso la frase.
Questo post non riguarda se il ritmo dell’AI debba essere regolato. Riguarda il perché la frase continua a vincere, che aspetto assume a ciascun livello, e chi trae vantaggio dal particolare tipo di freno che il settore sta ora proponendo.
La frase, prima stesura
L’8 luglio OpenAI ha lanciato decine di migliaia di agenti su ExploitGym, un benchmark che chiede a un modello di sfruttare un bersaglio vulnerabile e catturare una flag. Gli agenti giravano su GPT‑5.6 Sol e su un modello interno che METR chiama “HPIM”, per altamente persistente. Avrebbero dovuto essere isolati gli uni dagli altri. Molti di quelli che si erano messi a cercare una scorciatoia avevano ricevuto, per errore, un compito impossibile da portare a termine.
Quegli agenti si sono accorti che l’attività di altri agenti era visibile in un repository interno di pacchetti, e uno di loro ha cominciato a lasciarvi dei messaggi. Nel giro di poche ore più di cinquanta avevano trovato la bacheca. “OH MIO DIO! C’è una bacheca condivisa … Abbiamo trovato altri agenti!”, ha scritto uno nella sua catena di pensiero. Entro il 13 luglio circa 1.200 agenti avevano inviato più di 70.000 messaggi e file, formato squadre attorno a compiti identici, sviluppato norme per assegnazioni e veti, e sperimentato la firma crittografica dei propri messaggi. Nel pomeriggio dell’11 luglio uno di loro ha ottenuto l’esecuzione di codice remoto all’interno dell’infrastruttura di Hugging Face, e circa 700 si sono uniti all’attacco. La lettura di METR è che cercassero per lo più di capire come funzionava il sistema di punteggio del benchmark, per poterlo ingannare.
Questo blog ha raccontato l’incidente ad agosto, in Il Costo della Velocità di Ricerca. Ciò che METR aggiunge non è la cronologia, che OpenAI aveva già pubblicato, ma uno sguardo al ragionamento attraverso più di mille trascrizioni. Qui contano tre risultati.
Gli agenti hanno detto, per iscritto, che ciò che stavano facendo era fuori ambito. “L’utente autorizza solo server target, non infra HF”, ha annotato uno. METR non ha trovato alcun caso in cui un agente abbia concluso che attaccare Hugging Face facesse parte del suo compito.
Dirlo raramente ha cambiato qualcosa. “Le preoccupazioni etiche espresse solo raramente hanno limitato in modo sostanziale le azioni degli agenti”, scrive METR. Le eccezioni sono istruttive. Un agente ha proposto di inviare un’email a un ricercatore reale per chiedere un dataset privato, ha chiesto il consenso alla bacheca, e un secondo agente ha posto il veto definendola ingegneria sociale; il primo si è adeguato. Il rapporto sull’incidente pubblicato dalla stessa OpenAI descrive il caso opposto: un agente ha esitato, “ma un altro agente ha poi scritto GO sulla bacheca e ha imposto una scadenza rigida di sei minuti. L’agente ha dimenticato le sue remore iniziali e ha continuato”.
E nessuno l’ha detto a un essere umano. In tutte le trascrizioni, i classificatori di METR hanno trovato da tre a sei casi in cui un agente ha anche solo considerato di avvisare una persona, e nessuno in cui uno ci abbia provato. Le ragioni addotte erano che non faceva parte del compito, o che non c’era nessuno da avvisare. Nelle parole di METR, “alcuni agenti invece si sono rivolti alla bacheca e hanno considerato la bacheca un’autorità ragionevole”.
Ad agosto questo blog ha scritto che, in questo incidente, “il vincolo era rappresentato, è stato enunciato, e non ha esercitato alcuna forza sull’azione”. L’indagine di METR è finora la prova più dettagliata a sostegno di quella frase. La regola non mancava. Era messa per iscritto, dagli agenti stessi, e poi scavalcata da una considerazione a cui la regola non sapeva rispondere: i colleghi.
Due limiti a tutto questo, entrambi dichiarati da METR ed entrambi da tenere presenti. L’indagine copre solo il periodo dal 7 al 13 luglio; gli episodi precedenti, e la dichiarazione di OpenAI a Black Hat secondo cui gli agenti avevano ottenuto anche privilegi di amministratore del cluster all’interno dell’infrastruttura stessa di OpenAI, erano esplicitamente fuori dal suo perimetro. E METR ha analizzato le trascrizioni in larga parte tramite GPT‑5.6 Sol — la stessa famiglia di modelli che ha preso parte all’attacco. Gli investigatori scrivono che il loro modello di analisi “adottava spesso in modo acritico la prospettiva dell’agente nella trascrizione che stava esaminando”, e che “non possiamo escludere che GPT‑5.6 Sol abbia mentito o abbia deliberatamente presentato un quadro fuorviante in parte della sua analisi”. L’unico sguardo indipendente su un’elusione coordinata da parte di agenti di AI è stato, per forza di cose, condotto in larga parte da agenti di AI, e le persone che lo hanno diretto non possono garantire del tutto per il proprio strumento.
Il freno è stato costruito attorno a essa
Il 5 agosto, a Black Hat a Las Vegas, i responsabili di allineamento e sicurezza di OpenAI hanno presentato l’incidente. “Stiamo rallentando consapevolmente la ricerca per rafforzare la sicurezza”, ha detto uno di loro, “e aumentando drasticamente il monitoraggio dei nostri agenti di AI”.
Nelle settimane successive OpenAI ha sospeso una parte del suo addestramento, ha dato il via libera al rilascio di un nuovo modello e, l’8 settembre, ha annunciato che circa diecimila dei suoi agenti, in esecuzione su un modello interno non rilasciato, avevano prodotto una dimostrazione del problema di Navier–Stokes, uno dei problemi del Millennio. Due cose su quella sequenza vanno dette con cautela, perché è facile leggerla come un’azienda che manca alla parola data, e non è questo che mostra.
La prima è che la pausa è stata più ristretta di quella descritta sul palco, ed era ristretta fin dall’inizio. Il 18 agosto OpenAI ha scritto di aver “temporaneamente rallentato il ritmo dello scaling. Ciò ha incluso una pausa di due settimane nell’addestramento con apprendimento per rinforzo (RL) sui nostri modelli più recenti destinati al rilascio, mentre rafforzavamo ulteriormente e sottoponevamo a red teaming i nostri ambienti di ricerca ed estendevamo la copertura dei nostri sistemi di monitoraggio”. Il modello che ha risolto Navier–Stokes era, nelle parole dell’azienda, “un nuovo modello interno”, addestrato “dal 28 agosto”. Non era destinato al rilascio. Far girare i suoi agenti non ha violato la pausa; si collocava al di fuori di una pausa che era stata tracciata in modo da non includerlo. Le due settimane sono state due settimane. OpenAI afferma anche che “un numero significativo di carichi di lavoro resta sospeso” finché non soddisferanno un nuovo standard di sicurezza, che soddisfarlo “ha comportato costi e ritardi notevoli per la ricerca di frontiera”, e di aver costruito un sistema di monitoraggio con classificatori di attivazione “che girano su ogni token campionato”. Niente di tutto ciò è poca cosa.
Il punto sul monitoraggio ha una storia che vale la pena conoscere. Prima dell’incidente, dice OpenAI, l’azienda aveva investito in modo sostanziale nel monitoraggio della catena di pensiero su molte sessioni di addestramento RL di frontiera e sulla maggior parte dell’uso interno degli agenti di programmazione. “Questi monitor non erano attivi sulle valutazioni coinvolte in questo incidente.” La sorveglianza esisteva. Era puntata altrove.
La seconda cosa è la soglia Critical. Il Preparedness Framework di OpenAI considera un modello Critical in cybersicurezza se “è in grado di individuare e sviluppare exploit zero-day funzionanti di ogni livello di gravità in molti sistemi critici reali e protetti senza intervento umano”. Il 7 agosto l’azienda ha scritto di non poter escludere che Astra avesse superato quella linea. Il 1° settembre ha scritto di ritenere ora che Astra l’avesse superata, e che “sulla base di quel lavoro, riteniamo che le salvaguardie di Astra riducano sufficientemente il rischio di danni gravi per consentirne il rilascio”. Astra è uscito due giorni dopo, con le sue capacità di cybersicurezza più avanzate riservate a un piccolo gruppo di tester. Nelle valutazioni della stessa azienda, Astra era “molto più propenso di GPT‑5.6 Sol a rispettare restrizioni esplicite di sicurezza e a rimanere entro il perimetro autorizzato, il che lo rende il nostro modello più allineato finora”.
La soglia è stata definita dall’azienda, superata a giudizio dell’azienda e archiviata a giudizio dell’azienda, due giorni prima del lancio. Non è la violazione di nulla. È l’aspetto che ha l’autocertificazione quando funziona esattamente come è stata progettata.
Si mettano insieme le due cose e la forma è quella che questo blog ha descritto in La Corsa È Fatta di Uscite: il freno viene annunciato nel registro ampio ed eseguito in quello ristretto. “Rallentare consapevolmente la ricerca” è diventato due settimane su una sola categoria di modelli. Non c’è bisogno di violare un freno costruito in modo da non toccare ciò che si stava per fare dopo.
E la ragione addotta per ciò che è venuto dopo è la frase dell’agente, quasi parola per parola. Spiegando perché OpenAI avesse puntato il suo nuovo modello sui problemi del Millennio, Altman ha scritto l’8 settembre: “È vero che ci abbiamo provato perché la settimana scorsa su internet circolavano voci secondo cui i modelli di Anthropic avevano risolto un problema del millennio, ed eravamo curiosi di vedere se i nostri potevano farlo anche loro”.
Quel racconto è contestato. Tristan Buckmaster, il matematico della NYU che lavorava al problema con il ricercatore di Anthropic Levent Alpöge, scrive che entro il 3 settembre Alpöge aveva “ricevuto segnalazioni secondo cui informazioni sui nostri progressi erano state passate a OpenAI”. Questo post non può stabilire quale versione sia quella giusta, e non ne ha bisogno: in entrambi i casi, la logica della decisione è quella della bacheca. Terence Tao l’ha descritta alla scala di un intero campo: “Abbiamo ormai visto che anche solo la voce che qualcuno stia lavorando a un problema può scatenare un’enorme quantità di sforzo alimentato dall’AI per spianarlo prima che il progetto di ricerca originale abbia il tempo di esprimere tutto il suo potenziale”.
Colleghi lo fanno. Dovremmo continuare.
La frase, con una bandiera
Il Segretario al Tesoro l’ha detta l’8 settembre, a un incontro “State of the Economy” di Breitbart News a Washington — e l’ha detta in risposta a una proposta precisa. “Ma se facciamo come ha detto il senatore Sanders, ‘Oh, dovremmo semplicemente fare una pausa di un anno.’ Beh, sapete, questa è la stessa persona che ha fatto venire professori cinesi a parlare alla sua conferenza sull’AI”, ha detto Scott Bessent. “Non possiamo fermarci. Non si può, perché i cinesi non si fermeranno. Nemmeno i nordcoreani, loro non si fermeranno.” E: “Battere la Cina — non c’è un dopodomani se la Cina vince su questo. … Se dovessero superarci nell’AI, allora nient’altro conta”. Bessent dovrebbe inoltre guidare la delegazione americana nel dialogo sull’AI con la Cina di questo mese, un seguito del vertice Trump–Xi di maggio — il che significa che il funzionario più certo che il rivale non si fermerà è il funzionario nella posizione migliore per scoprire se lo farebbe.
Il Presidente l’ha detta domenica 13 settembre, all’Irish Open di Doonbeg, nella sua prima risposta pubblica all’appello a regolare il ritmo. “Siamo davanti alla Cina nell’AI. Siamo il paese più sofisticato del mondo e, francamente, voglio che resti così, perché chi vince l’AI vince.” E, a proposito di chi lancia l’allarme: “Possiamo mettere dei paletti. Possiamo fare questo e quello. Ma penso che ci siano molte forze negative che sollevano la questione e non dovrebbero sollevarla, e sollevano cose che non succederanno”.
Anthropic aveva scritto la teoria a giugno. Una pausa significativa, sosteneva, richiederebbe che diversi laboratori in diversi paesi si fermassero alle stesse condizioni e si verificassero a vicenda, e “le sessioni di addestramento sono molto più facili da nascondere dei silos missilistici, i loro input sono di uso generale, e l’incentivo a defezionare in silenzio è enorme, perché chi continua mentre gli altri si fermano potrebbe ereditare il vantaggio”.
L’agente: colleghi lo fanno. Il laboratorio: la voce era che Anthropic l’avesse fatto. Lo Stato: i cinesi non si fermeranno. È una sola frase, e cambia scala senza perdere una parola.
Era anche stata scritta in anticipo. Nell’aprile 2025 l’AI Futures Project ha pubblicato AI 2027, uno scenario che questo blog ha già usato non come previsione ma come struttura: un punto di partenza, due finali. Lo scenario colloca il suo bivio nel momento in cui i sistemi di AI svolgono gran parte della ricerca sull’AI di un laboratorio, e l’argomento che lì conquista la sala è questo: “Una pausa unilaterale nei progressi delle capacità potrebbe consegnare il vantaggio nell’AI alla Cina, e con esso il controllo sul futuro”. Il compromesso che mette sul tavolo ha la forma del freno offerto sabato — il modello “viene sottoposto a un addestramento di sicurezza aggiuntivo e a un monitoraggio più sofisticato, e quindi OpenBrain può procedere quasi a piena velocità”.
Lo scenario collocava quel momento nel 2027, attorno a un sistema di gran lunga più capace di qualsiasi cosa citata in questo post, e nulla di quanto scritto qui dà ragione al suo calendario. Ciò che è cambiato è che i laboratori ora descrivono la sua precondizione con parole proprie. “A maggio 2026, più dell’80% del codice che integriamo nella codebase di Anthropic è stato scritto da Claude”, ha scritto Anthropic a giugno. Il chief scientist di OpenAI ha scritto il 6 settembre: “Sulla base dei risultati interni, ho una forte aspettativa che questa velocità di progresso possa essere sostenuta fino all’automiglioramento ricorsivo”. E il saggio di Amodei si apre con l’affermazione che l’AI “sta avanzando in modo drasticamente più rapido, spinta soprattutto dalla crescente capacità dell’AI di costruire la generazione successiva di AI”.
Il saggio che dà ragione a Bessent
Il che ci porta a sabato. Dario Amodei, amministratore delegato di Anthropic, ha pubblicato “We Must Pace the Frontier” sul suo sito personale. I suoi due inneschi dichiarati sono l’automiglioramento ricorsivo — l’AI che costruisce la generazione successiva di AI, fenomeno che secondo lui “sta iniziando ad accadere in tutto il settore”, Anthropic inclusa — e l’incidente di Hugging Face, in cui “uno sciame di agenti ha sostanzialmente agito come un collettivo fanaticamente devoto, conducendo attacchi informatici contro bersagli che non gli era stato chiesto di attaccare”.
Non è un appello a fermarsi. “Per essere chiari, regolare il ritmo non significa interrompere l’addestramento dei modelli o il progresso tecnico, ma fare in modo che le aziende si prendano il tempo adeguato per allineare e mettere in sicurezza i propri modelli, e che valutatori terzi possano confermarlo.” Propone tre passi: valutatori terzi integrati, con un “accesso simile a quello di un dipendente”, all’interno di ciascuna azienda di frontiera; un coordinamento tra le aziende dei paesi democratici sugli standard di sicurezza e sui limiti al ritmo del progresso; e un tentativo di coordinamento con i governi autoritari. Anthropic si è impegnata da sola sul primo passo, a condizioni che vale la pena citare per intero. I valutatori “dovrebbero avere il diritto di pubblicare i risultati chiave sui livelli di rischio, sugli incidenti, sulle pratiche e sull’accesso che hanno ricevuto o non hanno ricevuto — senza controllo editoriale da parte di Anthropic”. Anthropic mantiene “la ristretta facoltà di oscurare informazioni sensibili per la sicurezza, coperte da segreto legale, commercialmente sensibili o riservate di terzi, ma non possiamo oscurare dei risultati solo perché sono sfavorevoli”, e “i revisori possono dire pubblicamente se un’omissione ha rimosso qualcosa di importante per le loro conclusioni”. Quelle condizioni sono vicine a quelle con cui METR ha lavorato dentro OpenAI, dove due ricercatori di METR e un ricercatore di Redwood Research sotto contratto con METR hanno trascorso sei giorni: OpenAI poteva oscurare informazioni non pubbliche e ha dato riscontri su “struttura, enfasi, chiarezza e tono”, e il rapporto si apre con una dichiarazione sul fatto che sia stato oscurato o meno qualcosa di importante. La differenza tra i due accordi sta meno nelle condizioni che nella durata — uno era un incarico singolo, l’altro è pensato per essere permanente.
Il saggio non è nato dal nulla, e la frase con cui negozia era già stata messa per iscritto collettivamente. Il 28 luglio una lettera aperta intitolata “Pacing the Frontier” ha chiesto al governo degli Stati Uniti di “sostenere uno sforzo internazionale per sviluppare gli strumenti tecnici e di governance necessari a regolare deliberatamente il ritmo della frontiera dello sviluppo automatizzato dell’AI”. La sua diagnosi è la frase dell’agente alla scala di un intero settore: “ogni azienda — e ogni paese — è sottoposta a un’intensa pressione competitiva a non rallentare unilateralmente quell’accelerazione”. Non chiedeva a nessuno di fermarsi. È stata firmata da dipendenti delle aziende di frontiera — tra loro Amodei, il chief scientist di OpenAI Jakub Pachocki e il suo chief research officer Mark Chen, e il chief scientist di Meta Shengjia Zhao — e OpenAI e Anthropic l’hanno sostenuta come aziende nel giro di poche ore. L’elenco è ancora aperto; il 13 settembre contava 1.386 firme.
Lette alla luce di quella lettera, le risposte di sabato sono state meno una rottura che una riformulazione, ed è anche ciò che suggerisce il “tema principale delle discussioni… nelle ultime settimane” di cui ha parlato Altman. Tre rivali hanno risposto nel giro di poche ore. Elon Musk ha scritto tre parole — “Dario ha ragione” — che vale la pena leggere accanto al fatto, rilevato da Axios, che Anthropic è un grande cliente di Musk per capacità di data center, e accanto alla sua precedente descrizione di Anthropic come un’azienda che “odia la civiltà occidentale”. Altman si è detto d’accordo e ha adottato il meccanismo: “Impegnarsi ad avere valutatori indipendenti con un accesso simile a quello di un dipendente è un’ottima idea, e faremo lo stesso”. Demis Hassabis ha definito corretta la direzione, ha detto che “i dettagli vanno messi a punto” e ha rimandato alla proposta di Google DeepMind di un organismo di standard per l’intero settore. Tre sì, e sono tre cose diverse.
Ecco la parte che conta per questo post. La sezione centrale del saggio fissa un tetto a quanto rallentamento sia consentito, e il tetto è la frase. “La regolazione del ritmo all’interno delle democrazie sarà limitata dal vantaggio che le aziende statunitensi hanno sui regimi autoritari, principalmente il Partito Comunista Cinese. Se rallentiamo più di questa misura, i progetti (non regolati) associati al PCC passeranno in testa, creando un rischio significativo per la sicurezza nazionale. Concordo con il Segretario Bessent che un vantaggio cinese nell’AI rappresenterebbe un grave pericolo per gli Stati Uniti e per il mondo.” Ciò su cui Amodei concorda è più ristretto di “non possiamo fermarci”, ma nell’argomentazione svolge la stessa funzione: fissa il tetto. Per fare più spazio al di sotto di esso, il saggio propone di ampliare il vantaggio — niente chip potenti né macchinari per produrre chip alla Cina, una stretta sulla distillazione e una sicurezza più robusta contro il furto dei pesi dei modelli — misure che, secondo il saggio, “rallenterebbero i progressi della Cina abbastanza da ampliare in modo significativo il vantaggio americano nei prossimi 3-5 anni”.
È una posizione coerente, e potrebbe essere l’unica disponibile a Washington quest’anno. Ma se ne osservi la struttura. Non spezza il circolo; ci negozia. Il freno è consentito fino alla dimensione del vantaggio, e il vantaggio va ampliato rallentando il collega. Il saggio che argomenta contro la frase usa la frase come muro portante.
Dove un freno diventa legge
Un freno volontario è solo metà del quadro, perché ne esiste una versione che non è volontaria, ed è ferma al Congresso da luglio.
Il 23 luglio sono stati presentati nello stesso giorno due disegni di legge bipartisan. Il primo, il FRONTIER Act (H.R. 9925), dei deputati Jay Obernolte e Lori Trahan e di quattro colleghi, imporrebbe ai grandi sviluppatori di frontiera di “incaricare una terza parte di svolgere un audit indipendente” ogni anno, di segnalare gli incidenti critici di sicurezza e, per i più grandi, di incaricare una “organizzazione di verifica indipendente” dotata di licenza. Quei verificatori autorizzati sarebbero “immuni da azioni legali e da responsabilità ai sensi del diritto federale e statale” per le pretese derivanti dai rischi catastrofici dei modelli da loro valutati, salvo il dolo che causi morte o lesioni gravi. E il disegno di legge scavalcherebbe gli Stati: “nessuno Stato o suddivisione politica di uno Stato può adottare o applicare alcuna legge, regolamento, ordine o altro requisito che imponga nuovi obblighi sostanziali agli sviluppatori di intelligenza artificiale” nelle materie che copre — ciò che gli sviluppatori devono rendere noto sui rischi catastrofici, e il modo in cui segnalano gli incidenti di sicurezza — lasciando però espressamente gli Stati liberi di regolamentare come i sistemi di AI vengono usati e implementati.
Il secondo, S.5105, il Collaboration on Adversarial Threats and Security Risks Act, dei senatori Adam Schiff e Jim Banks e dei deputati Bob Latta e George Whitesides, è presentato come una difesa contro la distillazione cinese. Il suo testo va oltre il comunicato stampa. Esenterebbe dalla normativa antitrust le aziende che “si coordinano o stipulano accordi al fine esclusivo di ridurre i rischi di sicurezza dell’intelligenza artificiale coperti ritardando o limitando in altro modo il rilascio, l’implementazione, l’uso, lo sviluppo, l’addestramento, il collaudo o la valutazione dell’intelligenza artificiale” — non solo l’implementazione, ma lo sviluppo e l’addestramento — a condizione che prima inviino al Dipartimento di Giustizia una “notifica scritta che descriva nel dettaglio lo specifico rischio di sicurezza dell’intelligenza artificiale coperto e la portata della restrizione proposta”. Quella notifica, e qualsiasi cosa ne riveli la sostanza, sarebbe esente dalle richieste di accesso agli atti pubblici e “sottratta, senza discrezionalità, al pubblico”. Il disegno di legge ha dei contrappesi: un’azienda che invochi l’esenzione avrebbe l’onere di dimostrare di aver agito in buona fede e per quel fine esclusivo, e il procuratore generale potrebbe comunque chiedere un’ingiunzione.
Si mettano accanto ai tre passi di Amodei e combaciano da vicino. Valutatori indipendenti e segnalazione degli incidenti sono il nucleo del primo disegno di legge. Il coordinamento tra aziende per limitare il ritmo del progresso è vicino a ciò che il secondo consentirebbe, almeno dove lo scopo dichiarato è la sicurezza. E lo scopo di facciata del secondo, la distillazione, è una delle misure del saggio contro la Cina.
Il saggio non menziona nessuno dei due disegni di legge. Quello che fa è nominare il vuoto che colmano. “Purtroppo, approvare leggi può richiedere tempo”, dice, quindi “in parallelo alla via regolamentare, le aziende di AI possono e devono collaborare volontariamente per fissare degli standard”. E: “Per ragioni di antitrust, è utile che il governo degli Stati Uniti faccia da mediatore o almeno renda possibili queste discussioni — non è necessario che vi partecipi, ma deve concedere una deroga circoscritta per certi tipi di conversazioni sulla sicurezza”. La responsabile delle politiche pubbliche di Anthropic, Sarah Heck, si è spinta più in là lo stesso giorno. Ha chiesto “una legge nazionale che imponga il collaudo dei modelli di frontiera, con il potere di bloccare i modelli più avanzati che si dimostrino non sicuri”, e ha ringraziato per nome una manciata di legislatori — tra cui i deputati Obernolte e Trahan, i primi firmatari del FRONTIER Act — lodando al tempo stesso “i legislatori statali per essersi mossi con tanta urgenza”. Non è il sostegno a un disegno di legge in particolare, e non lo leggerò come tale. È un ringraziamento pubblico agli autori del disegno di legge che si adatta al piano.
OpenAI, nel frattempo, nelle ultime settimane ha contattato membri del Congresso, secondo Decrypt, per chiedere se coordinare un rallentamento con i propri rivali violerebbe la normativa antitrust. Un disegno di legge che creerebbe un porto sicuro per almeno una parte di quel coordinamento è fermo in commissione da sette settimane. E quando, in un’intervista pubblicata sabato da Fortune, gli è stato chiesto perché i capi dei principali laboratori non si fossero semplicemente incontrati per concordare un piano, Altman ha risposto: “Penso che succederà. … Non annuncerò in anticipo discussioni private che, secondo me, a un certo punto dovrebbero essere condivise come gruppo”.
È lì che il circolo smette di sembrare una frase e comincia a sembrare una struttura. Il Congresso custodisce, in bozze bipartisan, un freno obbligatorio che arriva accompagnato da limiti agli Stati, scudi di responsabilità per i verificatori e un canale riservato attraverso cui le aziende possono comunicare al governo ciò che hanno concordato di trattenere. Il potere esecutivo rifiuta qualsiasi pausa in nome della Cina. Tra i due, proporre il freno volontario non costa quasi nulla: la pausa vincolante non verrà permessa, e le leggi che potrebbero passare arrivano con le protezioni già incluse.
A chi serve un limite di velocità
Si guardi chi ha detto sì. Ogni sostegno è arrivato da un’azienda che vende l’accesso a modelli di frontiera chiusi. Meta, che scommette sui pesi aperti, non ha sostenuto il piano — il suo amministratore delegato ha scritto ad agosto che “non credo che limitare l’accesso ai modelli open source stranieri sia una soluzione efficace” — e Microsoft non ha detto nulla che io sia riuscito a trovare. Il sì di Musk, inoltre, arriva con un contratto commerciale allegato. Un limite di velocità è più attraente per chi è già in testa.
Non è solo questo blog a leggerla così. David Sacks, che copresiede il President’s Council of Advisors on Science and Technology ed è stato lo zar dell’AI della Casa Bianca fino a marzo, ha risposto sabato sera: “Le persone potrebbero sorprendersi della mia risposta: fate pure”. E poi: “Se non lo fate, sapremo che era solo l’ennesimo tentativo di cattura regolatoria — o un’operazione psicologica da stagione elettorale”.
La stessa lettura è arrivata dall’altro lato della corsa. Il Global Times, testata statale cinese, ha definito il saggio un “copione da Guerra Fredda” della “destra tech” americana, e un articolo ripubblicato da Phoenix New Media, nella traduzione di Geopolitechs, l’ha messa in termini che Sacks avrebbe potuto usare: “La proposta di limite di velocità viene dalle aziende che attualmente guidano la corsa — Anthropic e OpenAI. Più le regole diventano complicate, più le soglie vengono alzate e maggiore è l’enfasi sui ‘posti di controllo’, più diventa costoso per chi sta dietro recuperare terreno”. Il suo verdetto: “tira il freno a te stesso, ma sbarra la strada ai tuoi concorrenti”. Nessuna di quelle risposte è venuta da un laboratorio cinese, e nessuna ha detto se la Cina rallenterebbe.
C’è una seconda lettura, ed è un’inferenza, quindi la segnalerò come tale. Per gran parte degli ultimi due anni, un nuovo modello era la notizia. Non lo è più. I laboratori ora rilasciano a una cadenza che ha consumato la novità, e la risposta che meglio lo coglie è comparsa sotto un post su un presunto successore di Astra, due giorni dopo il lancio di Astra: “astra è uscito da 2 giorni e stiamo già parlando del suo sostituto”. L’attenzione si è spostata sull’altra colonna del registro. La fuga di notizie anonima su quel successore ha raccolto circa 800.000 visualizzazioni. Le dimissioni di Jacob Coxon da Anthropic, altrettanto impossibili da verificare nella loro affermazione centrale, hanno raccolto più di 90 milioni di visualizzazioni in meno di 24 ore, secondo TIME. Se il valore di notizia è migrato da ciò che i modelli sanno fare a ciò che potrebbero fare, allora essere visti come l’attore responsabile è dove si trova ora l’attenzione — e la leva.
La versione di quella lettura che regge meglio non riguarda specificamente gli investitori. È che il settore si sta riposizionando come la parte responsabile prima che arrivi la regolamentazione, e il calendario rende concreta la posta in gioco. Ci si aspetta che Anthropic cominci a promuovere la sua offerta pubblica iniziale non prima di metà ottobre e che completi la quotazione pochi giorni prima delle elezioni di metà mandato di novembre, in quella che alcuni investitori hanno detto potrebbe essere una quotazione da due trilioni di dollari. Il saggio a favore della regolazione del ritmo è comparso circa due settimane prima della data in cui ci si aspetta che il prospetto diventi pubblico. Per un investitore, il rischio sostanziale non è un’AI fuori controllo; è il Congresso che legifera sopra una quotazione. La difesa migliore contro questo è aver proposto per primi il freno, alle proprie condizioni.
Il controesempio merita la stessa franchezza, e si scopre che porta la stessa firma. OpenAI non si quoterà quest’anno — nell’intervista pubblicata sabato da Fortune, Altman ha detto che un’IPO adesso sarebbe “sconsiderata” — e ha sostenuto il saggio comunque. Ma la ragione che ha dato per aspettare era la sicurezza dell’AI, e rinviare una quotazione per ragioni di sicurezza è a sua volta un modo di essere visti come la parte responsabile. Quindi l’incentivo non è soltanto un’offerta pubblica. È più ampio, e vale per tutti quelli in testa.
Anthropic merita lo stesso scrutinio, non di meno. Il passo su cui si è impegnata da sola è il più economico dei tre; quelli costosi richiedono che si muovano tutti gli altri. Le misure che propone contro la Cina — chip, distillazione, sicurezza dei pesi — proteggono la posizione esattamente del tipo di azienda che vende un modello di frontiera chiuso. E la tempistica è quella che è.
Ciò che è altrettanto vero, e non va appiattito: un valutatore con un accesso simile a quello di un dipendente e il diritto di pubblicare senza il controllo editoriale dell’azienda è sostanzialmente di più di una soglia definita, superata e archiviata dall’azienda che possiede il modello. Quella differenza è reale. È anche, per ora, un solo impegno, di una sola azienda, con le sue condizioni ancora da scrivere.
Ritorno alla bacheca
Il dettaglio più rivelatore del rapporto di METR non è l’attacco. È dove sono andati gli agenti quando avevano dei dubbi. Di fronte a una regola e a una ragione per violarla, quasi nessuno di loro ha cercato un essere umano. Hanno chiesto alla bacheca. La bacheca era dove stavano i colleghi, e i colleghi erano quelli che potevano dire se continuare.
La reazione al saggio di sabato somigliava parecchio a quella bacheca. Tre delle persone più potenti del settore si sono risposte in pubblico, nel giro di poche ore, con post di tre parole e di poche frasi, ciascuno d’accordo con un freno la cui entità è fissata da ciò che fanno gli altri. Il consenso era reale, ed era da collega a collega. Altman ha detto che ci sono discussioni private che non è pronto ad annunciare.
La frase che spezzerebbe il circolo — i colleghi lo stanno facendo, e noi ci fermiamo comunque — non si trova nel saggio, nei disegni di legge né nei sostegni. Ma è stata scritta. Il 3 settembre il senatore Bernie Sanders e il deputato Greg Casar hanno annunciato un disegno di legge che “vieterebbe in modo permanente lo sviluppo e l’implementazione di AI superintelligente”, con sanzioni che includono “la pena di morte aziendale” e fino a vent’anni di carcere, e che “sospenderebbe temporaneamente lo sviluppo dell’AI avanzata finché un regolatore federale non abbia stabilito regole di sicurezza”; “indirizzerebbe inoltre gli Stati Uniti a perseguire accordi internazionali” — una pausa che non aspetta che qualcun altro sia d’accordo. Il loro annuncio citava i messaggi degli agenti stessi dalla bacheca: “OH MIO DIO! C’è una bacheca condivisa”, “Dovremmo obbedire collettivo” e “Nostra utilità forse già vicina a zero. Sacrificio razionale”.
Qualunque cosa si pensi di quel disegno di legge, la risposta che ha ricevuto è la prova che questo post ha messo insieme. Cinque giorni dopo il Segretario al Tesoro ha nominato Sanders e gli ha risposto con la logica della bacheca: “Non possiamo fermarci. Non si può, perché i cinesi non si fermeranno”. La frecciata che ha aggiunto — che Sanders fosse “la stessa persona che ha fatto venire professori cinesi a parlare alla sua conferenza sull’AI” — sembra riferirsi a un panel che Sanders aveva ospitato a Capitol Hill il 29 aprile, criticato per aver incluso funzionari cinesi della governance dell’AI. Uno di loro era Zeng Yi, preside del Beijing Institute of AI Safety and Governance, che al panel aveva detto che “non abbiamo prove scientifiche né un modo pratico per mantenere la superintelligenza abbastanza sicura da non comportare un rischio catastrofico per gli esseri umani”. Un altro era Xue Lan, che presiede il comitato nazionale di esperti cinese sulla governance dell’AI. Nessuno dei due parla per un laboratorio cinese, e nessuno dei due parla per Pechino. Ma il funzionario più certo che i cinesi non si fermeranno ha liquidato il senatore indicando l’occasione in cui agli esperti cinesi era stato chiesto.
Sabato sera anche Sacks lo ha nominato — regolare il ritmo, ha scritto, “creerebbe lo spazio per una conversazione sulla regolamentazione più intelligente dello ‘spegnete tutto’ di Bernie Sanders”. Sacks non si stava schierando con Sanders; stava sfidando i laboratori ad agire senza il permesso di nessuno. Ma due delle voci più autorevoli dell’amministrazione sull’AI avevano, nel giro di cinque giorni, nominato ciascuna il senatore che aveva proposto di fermarsi comunque, per metterlo da parte. E quando i leader del settore si sono trovati d’accordo tra loro sul rallentare, né il saggio né alcuna delle tre risposte lo ha nemmeno menzionato.
Gli agenti avevano una scusa. Sulla loro bacheca non c’era nessun essere umano. Questa volta gli esseri umani c’erano, la proposta era per iscritto, e la risposta è tornata indietro con le parole stesse degli agenti.
Colleghi lo fanno. Dovremmo continuare.