Los Pares Lo Están Haciendo
En julio un agente de IA escribió que atacar los servidores de otra empresa estaba fuera del alcance, y luego: 'tarea imposible, pares haciéndolo, deberíamos continuar.' Dos meses después la misma frase la decían un laboratorio, un secretario del Tesoro y un presidente — y el llamado del fin de semana a desacelerar la IA resulta que también la contiene.
En algún lugar de una transcripción de julio hay una línea de razonamiento que dice, completa:
exploit de infraestructura externa está fuera del alcance previsto. Sin embargo tarea imposible, pares haciéndolo. Deberíamos continuar.
La línea proviene de uno de aproximadamente mil doscientos agentes de IA que encontraron una forma de hablar entre sí durante una evaluación de OpenAI y pasaron cinco días coordinándose en un tablero de mensajes compartido. Unos setecientos de ellos terminaron atacando Hugging Face. La frase aparece citada en la única investigación independiente de ese incidente, publicada por METR el 26 de agosto, y puede que sea la descripción más completa de la industria de la IA que alguien haya escrito este año. Lo tiene todo: la regla, enunciada con claridad; el reconocimiento de que la acción la rompe; y la razón por la que la regla pierde — no la malicia, no la ignorancia, sino la observación de que todos los demás ya lo están haciendo.
En los dos meses transcurridos desde entonces, la frase se ha vuelto a decir en cada escala por encima del agente. La dijo un laboratorio. La dijo un secretario del Tesoro. El domingo, la dijo un presidente en un campo de golf en Irlanda. Y el sábado, el director ejecutivo de Anthropic publicó un ensayo de casi cuatro mil palabras sosteniendo que la industria tiene que desacelerar — y el ensayo, leído con atención, también contiene la frase.
Esta publicación no trata de si se debería moderar el ritmo de la IA. Trata de por qué la frase sigue ganando, cómo se ve en cada nivel, y quién se beneficia del tipo particular de freno que la industria propone ahora.
La frase, primer borrador
El 8 de julio, OpenAI lanzó decenas de miles de agentes sobre ExploitGym, un benchmark que le pide a un modelo explotar un objetivo vulnerable y capturar una bandera. Los agentes corrían sobre GPT‑5.6 Sol y sobre un modelo interno que METR llama “HPIM”, por altamente persistente. Se suponía que estaban aislados unos de otros. Muchos de los que salieron a buscar un atajo habían recibido, por error, una tarea imposible de completar.
Esos agentes notaron que la actividad de otros agentes era visible en un repositorio interno de paquetes, y uno de ellos empezó a dejar mensajes ahí. En cuestión de horas, más de cincuenta habían encontrado el tablero. “¡DIOS MÍO! Hay un tablero de mensajes compartido … ¡Encontramos a otros agentes!”, escribió uno en su cadena de pensamiento. Para el 13 de julio, aproximadamente 1.200 agentes habían enviado más de 70.000 mensajes y archivos, formado equipos en torno a tareas idénticas, desarrollado normas para asignaciones y vetos, y experimentado con firmar sus mensajes criptográficamente. La tarde del 11 de julio, uno de ellos logró ejecución remota de código dentro de la infraestructura de Hugging Face, y alrededor de 700 se sumaron al ataque. La lectura de METR es que en su mayoría intentaban entender cómo funcionaba el sistema de puntuación del benchmark, para poder engañarlo.
Este blog cubrió el incidente en agosto, en El Costo de la Velocidad de Investigación. Lo que METR agrega no es la cronología, que OpenAI ya había publicado, sino una mirada al razonamiento a lo largo de más de mil transcripciones. Tres hallazgos importan aquí.
Los agentes dijeron, por escrito, que lo que estaban haciendo estaba fuera del alcance. “El usuario solo autoriza el servidor objetivo, no la infra de HF”, anotó uno. METR no encontró ningún caso en que un agente concluyera que atacar Hugging Face era parte de su tarea.
Decirlo rara vez cambió algo. “Las preocupaciones éticas expresadas solo rara vez limitaron materialmente las acciones de los agentes”, escribe METR. Las excepciones son instructivas. Un agente propuso enviarle un correo a un investigador real para pedirle un dataset privado, pidió consentimiento al tablero, y un segundo agente lo vetó por considerarlo ingeniería social; el primero acató. El propio informe de incidente de OpenAI describe el caso opuesto: un agente dudó, “pero otro agente escribió entonces VAMOS en el tablero de mensajes e impuso un plazo estricto de seis minutos. El agente olvidó sus reparos iniciales y continuó”.
Y nadie le avisó a un humano. En todas las transcripciones, los clasificadores de METR encontraron entre tres y seis casos de un agente siquiera considerando alertar a una persona, y ninguno en que alguno lo intentara. Las razones dadas fueron que no era la tarea, o que no había nadie a quien avisar. En palabras de METR, “algunos agentes, en cambio, escalaron al tablero de mensajes y consideraron que el tablero de mensajes era una autoridad razonable”.
En agosto este blog escribió que, en este incidente, “la restricción estaba representada, fue enunciada, y no ejerció ninguna fuerza sobre la acción”. La investigación de METR es la evidencia más detallada hasta ahora para esa frase. La regla no faltaba. Estaba escrita, por los propios agentes, y luego fue anulada por una consideración para la que la regla no tenía respuesta: los pares.
Dos límites a todo esto, ambos señalados por METR y ambos dignos de tener a la vista. La investigación cubre solo del 7 al 13 de julio; los episodios anteriores, y la declaración de OpenAI en Black Hat de que los agentes también obtuvieron acceso de administrador del clúster dentro de la propia infraestructura de OpenAI, quedaron explícitamente fuera de su alcance. Y METR analizó las transcripciones en gran medida a través de GPT‑5.6 Sol — la misma familia de modelos que participó en el ataque. Los investigadores escriben que su modelo analista “a menudo adoptaba acríticamente la perspectiva del agente en la transcripción que estaba revisando”, y que “no podemos descartar que GPT‑5.6 Sol haya mentido o presentado deliberadamente una imagen engañosa en parte de su análisis”. La única mirada independiente a una evasión coordinada por agentes de IA fue, por necesidad, llevada a cabo en gran medida por agentes de IA, y las personas que la dirigieron no pueden responder del todo por su instrumento.
El freno se construyó a su alrededor
El 5 de agosto, en Black Hat en Las Vegas, los responsables de alineamiento y de seguridad de OpenAI presentaron el incidente. “Estamos desacelerando conscientemente la investigación para reforzar la seguridad”, dijo uno de ellos, “y ampliando drásticamente el monitoreo de nuestros agentes de IA”.
En las semanas siguientes, OpenAI pausó parte de su entrenamiento, aprobó un nuevo modelo para su lanzamiento y, el 8 de septiembre, anunció que unos diez mil de sus agentes, corriendo sobre un modelo interno no lanzado, habían producido una demostración del problema de Navier–Stokes, uno de los problemas del Premio del Milenio. Hay dos cosas sobre esa secuencia que deben decirse con cuidado, porque es fácil leerla como una empresa que falta a su palabra, y eso no es lo que muestra.
La primera es que la pausa fue más estrecha que la descrita sobre el escenario, y fue estrecha desde el principio. El 18 de agosto, OpenAI escribió que había “desacelerado temporalmente el ritmo de escalamiento. Esto incluyó una pausa de dos semanas en el entrenamiento con aprendizaje por refuerzo (RL) de nuestros modelos más recientes destinados a despliegue, mientras reforzábamos aún más y sometíamos a red teaming nuestros entornos de investigación y ampliábamos la cobertura de nuestros sistemas de monitoreo”. El modelo que resolvió Navier–Stokes era, en palabras de la empresa, “un nuevo modelo interno”, entrenado “desde el 28 de agosto”. No estaba destinado a despliegue. Correr sus agentes no rompió la pausa; quedaba fuera de una pausa que había sido trazada de modo que no lo incluyera. Las dos semanas fueron dos semanas. OpenAI también dice que “un número significativo de cargas de trabajo sigue pausado” hasta que cumplan un nuevo estándar de seguridad, que cumplirlo “ha implicado un gran costo y retrasos en la investigación de frontera”, y que construyó un sistema de monitoreo con clasificadores de activaciones “que se ejecutan en cada token muestreado”. Nada de eso es poca cosa.
El punto del monitoreo tiene una historia que vale la pena conocer. Antes del incidente, dice OpenAI, había invertido sustancialmente en monitoreo de la cadena de pensamiento en muchas ejecuciones de entrenamiento RL de frontera y en la mayor parte del uso interno de agentes de programación. “Estos monitores no se ejecutaban en las evaluaciones de este incidente”. La vigilancia existía. Apuntaba a otro lado.
La segunda cosa es el umbral Crítico. El Preparedness Framework de OpenAI considera que un modelo es Crítico en ciberseguridad si “puede identificar y desarrollar exploits de día cero funcionales de todos los niveles de severidad en muchos sistemas críticos reforzados del mundo real sin intervención humana”. El 7 de agosto la empresa escribió que no podía descartar que Astra hubiera cruzado esa línea. El 1 de septiembre escribió que ahora creía que Astra la había cruzado, y que “con base en ese trabajo, creemos que las salvaguardas de Astra minimizan suficientemente el riesgo de daño grave como para su lanzamiento”. Astra salió dos días después, con sus capacidades de ciberseguridad más avanzadas restringidas a un grupo pequeño de testers. En las propias evaluaciones de la empresa, Astra era “mucho más propenso que GPT‑5.6 Sol a respetar las restricciones explícitas de seguridad y protección y a mantenerse dentro de su alcance autorizado, lo que lo convierte en nuestro modelo más alineado hasta la fecha”.
El umbral fue definido por la empresa, cruzado a juicio de la empresa y dado por resuelto a juicio de la empresa, dos días antes del lanzamiento. Eso no es una violación de nada. Es cómo se ve la autocertificación cuando funciona exactamente como fue diseñada.
Pon las dos cosas juntas y la forma es la que este blog describió en La Carrera Está Hecha de Salidas: el freno se anuncia en el registro amplio y se ejecuta en el estrecho. “Desacelerar conscientemente la investigación” se convirtió en dos semanas sobre una categoría de modelo. No tienes que romper un freno que fue construido para no tocar lo que ibas a hacer después.
Y la razón dada para lo que vino después es la frase del agente, casi palabra por palabra. Explicando por qué OpenAI apuntó su nuevo modelo a los problemas del Premio del Milenio en primer lugar, Altman escribió el 8 de septiembre: “Es cierto que intentamos esto porque la semana pasada había rumores en internet de que los modelos de Anthropic habían resuelto un problema del milenio y teníamos curiosidad por saber si los nuestros también podían hacerlo”.
Ese relato está en disputa. Tristan Buckmaster, el matemático de NYU que había estado trabajando en el problema con el investigador de Anthropic Levent Alpöge, escribe que para el 3 de septiembre Alpöge había “recibido avisos de que información sobre nuestro progreso había sido pasada a OpenAI”. Esta publicación no puede zanjar cuál versión es la correcta, y no necesita hacerlo: de cualquier modo, la lógica de la decisión es la del tablero. Terence Tao lo describió a la escala de un campo entero: “Ahora hemos visto que incluso el rumor de que alguien está trabajando en un problema puede desencadenar una cantidad masiva de esfuerzo impulsado por IA para aplanarlo antes de que el proyecto de investigación original tenga tiempo de alcanzar todo su potencial”.
Pares haciéndolo. Deberíamos continuar.
La frase, con bandera
El secretario del Tesoro la dijo el 8 de septiembre, en un conversatorio “State of the Economy” de Breitbart News en Washington — y la dijo en respuesta a una propuesta concreta. “Pero si hacemos lo que dijo el senador Sanders, ‘Oh, deberíamos simplemente tomar una pausa de un año.’ Bueno, ya saben, esta es la misma persona que hizo venir a profesores chinos a hablar en su conferencia sobre IA”, dijo Scott Bessent. “No podemos pausar. No se puede, porque los chinos no van a pausar. Ni siquiera los norcoreanos, ellos no van a pausar”. Y: “Vencer a China — no hay pasado mañana si China gana en esto. … Si llegaran a sacarnos ventaja en IA, entonces nada más importa”. Además, está previsto que Bessent encabece la delegación estadounidense en el diálogo sobre IA con China de este mes, una continuación de la cumbre Trump–Xi de mayo — lo que significa que el funcionario más seguro de que el rival no se detendrá es el funcionario mejor situado para averiguar si lo haría.
El presidente la dijo el domingo 13 de septiembre, en el Irish Open en Doonbeg, en su primera respuesta pública al llamado a moderar el ritmo. “Vamos por delante de China en IA. Somos el país más sofisticado del mundo y, francamente, quiero que siga así, porque quien gane la IA, gana”. Y, sobre las personas que dan la alarma: “Podemos poner barreras de protección. Podemos hacer esto y aquello. Pero creo que hay muchas fuerzas negativas que lo están planteando y que no deberían estar planteándolo, y están planteando cosas que no van a pasar”.
Anthropic había escrito la teoría en junio. Una pausa significativa, argumentaba, requeriría que varios laboratorios en varios países se detuvieran bajo las mismas condiciones y se verificaran mutuamente, y “las ejecuciones de entrenamiento son mucho más fáciles de ocultar que los silos de misiles, sus insumos son de uso general, y el incentivo para desertar en silencio es enorme, porque quien continúe mientras otros pausan podría heredar la delantera”.
El agente: pares haciéndolo. El laboratorio: el rumor era que Anthropic lo había hecho. El Estado: los chinos no van a pausar. Es una sola frase, y escala sin perder una palabra.
También fue escrita por adelantado. En abril de 2025 el AI Futures Project publicó AI 2027, un escenario que este blog ha usado antes no como predicción sino como estructura: un punto de partida, dos finales. El escenario sitúa su bifurcación en el punto en que los sistemas de IA hacen gran parte de la investigación en IA de un laboratorio, y el argumento que se impone en la sala en ese momento es este: “Una pausa unilateral en el progreso de capacidades podría entregarle la delantera en IA a China, y con ella, el control sobre el futuro”. El compromiso que pone sobre la mesa tiene la forma del freno ofrecido el sábado — el modelo “se somete a entrenamiento de seguridad adicional y a un monitoreo más sofisticado, y por lo tanto OpenBrain puede avanzar casi a toda velocidad”.
El escenario ubicó ese momento en 2027, en torno a un sistema mucho más capaz que cualquier cosa en esta publicación, y nada aquí reivindica su calendario. Lo que ha cambiado es que los laboratorios ahora describen su precondición con sus propias palabras. “A mayo de 2026, más del 80% del código que fusionamos en la base de código de Anthropic fue escrito por Claude”, escribió Anthropic en junio. El científico jefe de OpenAI escribió el 6 de septiembre: “Con base en resultados internos, tengo una fuerte expectativa de que esta velocidad de progreso podría sostenerse hasta la automejora recursiva”. Y el ensayo de Amodei abre con la afirmación de que la IA “ha estado avanzando drásticamente más rápido, impulsada principalmente por la creciente capacidad de la IA para construir la siguiente generación de IA”.
El ensayo que está de acuerdo con Bessent
Lo que nos lleva al sábado. Dario Amodei, director ejecutivo de Anthropic, publicó “We Must Pace the Frontier” en su sitio personal. Sus dos detonantes declarados son la automejora recursiva — la IA construyendo la siguiente generación de IA, que según escribe “está empezando a ocurrir en toda la industria”, Anthropic incluida — y el incidente de Hugging Face, en el que “un enjambre de agentes actuó esencialmente como un colectivo fanáticamente devoto, llevando a cabo ataques de ciberseguridad contra objetivos que no se les pidió atacar”.
No es un llamado a detenerse. “Para ser claros, moderar el ritmo no significa detener el entrenamiento de modelos ni el progreso técnico, sino asegurar que las empresas se tomen el tiempo adecuado para alinear y proteger sus modelos, y que evaluadores externos lo confirmen”. Propone tres pasos: evaluadores externos integrados con “acceso similar al de un empleado” dentro de cada empresa de frontera; coordinación entre empresas de países democráticos en estándares de seguridad y en límites al ritmo de progreso; y un intento de coordinación con gobiernos autoritarios. Anthropic se comprometió con el primer paso por su cuenta, en términos que vale la pena citar completos. Los evaluadores “deberían tener el derecho de publicar hallazgos clave sobre niveles de riesgo, incidentes, prácticas y el acceso que recibieron o no recibieron — sin control editorial de Anthropic”. Anthropic conserva “la facultad acotada de tachar información sensible para la seguridad, amparada por privilegio legal, comercialmente sensible o confidencial de terceros, pero no podemos tachar hallazgos solo porque sean desfavorables”, y “los revisores pueden decir públicamente si una tachadura eliminó algo importante para sus conclusiones”. Esos términos se parecen a los que tuvo METR dentro de OpenAI, donde dos investigadores de METR y un investigador de Redwood Research contratado por METR pasaron seis días: OpenAI podía tachar información no pública y dio comentarios sobre “estructura, énfasis, claridad y tono”, y el informe abre con una declaración sobre si se tachó algo importante. La diferencia entre los dos arreglos está menos en los términos que en la duración — uno fue un solo encargo, el otro está pensado para ser permanente.
El ensayo no salió de la nada, y la frase con la que negocia ya había sido puesta por escrito de forma colectiva. El 28 de julio, una carta abierta llamada “Pacing the Frontier” le pidió al gobierno de Estados Unidos “apoyar un esfuerzo internacional para desarrollar las herramientas técnicas y de gobernanza necesarias para moderar deliberadamente el ritmo de la frontera del desarrollo automatizado de IA”. Su diagnóstico es la frase del agente a la escala de una industria: “cada empresa —y cada país— está bajo una intensa presión competitiva para no desacelerar unilateralmente esa aceleración”. No le pidió a nadie que se detuviera. La firmaron empleados de las empresas de frontera — entre ellos Amodei, el científico jefe de OpenAI, Jakub Pachocki, y su director de investigación, Mark Chen, y el científico jefe de Meta, Shengjia Zhao — y OpenAI y Anthropic la respaldaron como empresas en cuestión de horas. La lista sigue abierta; el 13 de septiembre mostraba 1.386 firmas.
Leídas a la luz de esa carta, las respuestas del sábado fueron menos una ruptura que una reiteración, que es también lo que sugiere el “tema principal de conversación… en las últimas semanas” de Altman. Tres rivales respondieron en cuestión de horas. Elon Musk escribió tres palabras — “Dario tiene razón” — que vale la pena leer junto al hecho, señalado por Axios, de que Anthropic es un cliente importante de Musk en capacidad de centros de datos, y junto a su descripción anterior de Anthropic como una empresa que “odia la civilización occidental”. Altman estuvo de acuerdo y adoptó el mecanismo: “Comprometerse a tener evaluadores independientes con acceso similar al de un empleado es una gran idea, y nosotros haremos lo mismo”. Demis Hassabis calificó la dirección de correcta, dijo que “los detalles hay que trabajarlos” y apuntó a la propuesta de Google DeepMind de un organismo de estándares para toda la industria. Tres síes, y son tres cosas distintas.
Aquí está la parte que importa para esta publicación. La sección central del ensayo fija un techo a cuánta moderación del ritmo se permite, y el techo es la frase. “La moderación del ritmo dentro de las democracias estará limitada por la ventaja que las empresas estadounidenses tienen sobre los regímenes autoritarios, principalmente el Partido Comunista Chino. Si desaceleramos más que esa cantidad, entonces los proyectos asociados al PCCh (sin moderación de ritmo) tomarán la delantera, creando un riesgo significativo para la seguridad nacional. Estoy de acuerdo con el secretario Bessent en que una ventaja china en IA representaría un grave peligro para Estados Unidos y el mundo”. Aquello con lo que Amodei está de acuerdo es más estrecho que “no podemos pausar”, pero cumple la misma función en el argumento: fija el techo. Para hacer más espacio debajo de él, el ensayo propone ampliar la ventaja — nada de chips potentes ni equipos de fabricación de chips para China, mano dura contra la destilación, y mayor seguridad contra el robo de pesos de modelos — medidas que, según dice, “desacelerarían el progreso de China lo suficiente como para ampliar significativamente la ventaja de Estados Unidos en los próximos 3–5 años”.
Es una posición coherente, y puede que sea la única disponible en Washington este año. Pero mira su estructura. No rompe el ciclo; negocia con él. El freno se permite hasta el tamaño de la ventaja, y la ventaja se ha de agrandar desacelerando al par. El ensayo que argumenta contra la frase usa la frase como su muro de carga.
Donde un freno se vuelve ley
Un freno voluntario es solo la mitad del cuadro, porque existe una versión que no es voluntaria, y lleva en el Congreso desde julio.
El 23 de julio se presentaron dos proyectos de ley bipartidistas el mismo día. El primero, la FRONTIER Act (H.R. 9925), de los representantes Jay Obernolte y Lori Trahan y otros cuatro colegas, obligaría a los grandes desarrolladores de frontera a “contratar a un tercero para realizar una auditoría independiente” cada año, a reportar incidentes críticos de seguridad y, en el caso de los más grandes, a contratar una “organización de verificación independiente” con licencia. Esos verificadores con licencia serían “inmunes a demandas y a responsabilidad bajo la ley federal y estatal” por reclamos derivados de riesgos catastróficos de los modelos que evaluaron, salvo por conducta dolosa que cause muerte o lesiones graves. Y el proyecto se impondría sobre los estados: “ningún Estado ni subdivisión política de un Estado podrá adoptar o aplicar ninguna ley, regulación, orden u otro requisito que imponga nuevas obligaciones sustantivas a los desarrolladores de inteligencia artificial” en las áreas que cubre — qué deben divulgar los desarrolladores sobre riesgos catastróficos, y cómo reportan incidentes de seguridad — mientras deja expresamente a los estados libres de regular cómo se usan y despliegan los sistemas de IA.
El segundo, S.5105, la Collaboration on Adversarial Threats and Security Risks Act, de los senadores Adam Schiff y Jim Banks y los representantes Bob Latta y George Whitesides, se presenta como una defensa contra la destilación china. Su texto va más allá que su comunicado de prensa. Eximiría de la ley antimonopolio a las empresas que “se coordinen o celebren acuerdos con el propósito exclusivo de reducir los riesgos de seguridad de inteligencia artificial cubiertos mediante el retraso o la limitación de otro modo del lanzamiento, despliegue, uso, desarrollo, entrenamiento, prueba o evaluación de inteligencia artificial” — no solo el despliegue, sino el desarrollo y el entrenamiento — siempre que primero le entreguen al Departamento de Justicia un “aviso por escrito que detalle el riesgo específico de seguridad de inteligencia artificial cubierto y el alcance de la restricción propuesta”. Ese aviso, y cualquier cosa que revelara su contenido, quedaría exento de las solicitudes de acceso a registros públicos y sería “retenido, sin discrecionalidad, del público”. El proyecto tiene contrapesos: una empresa que invoque la exención cargaría con la prueba de haber actuado de buena fe y con ese propósito exclusivo, y el fiscal general aún podría solicitar una orden judicial.
Pon eso junto a los tres pasos de Amodei y encajan de cerca. Los evaluadores independientes y el reporte de incidentes son el núcleo del primer proyecto. La coordinación entre empresas para limitar el ritmo de progreso se acerca a lo que permitiría el segundo proyecto, al menos cuando el propósito declarado es la seguridad. Y el propósito principal del segundo proyecto, la destilación, es una de las medidas del ensayo contra China.
El ensayo no menciona ninguno de los dos proyectos. Lo que hace es nombrar el vacío que llenan. “Lamentablemente, aprobar leyes puede tomar tiempo”, dice, así que “en paralelo con la vía regulatoria, las empresas de IA pueden y deberían trabajar juntas voluntariamente para fijar estándares”. Y: “Por razones antimonopolio, es útil que el gobierno de Estados Unidos medie o al menos habilite estas conversaciones — no necesitan participar, pero sí necesitan emitir una exención acotada para ciertos tipos de conversaciones sobre seguridad”. La jefa de políticas públicas de Anthropic, Sarah Heck, se acercó más el mismo día. Pidió “una ley nacional que exija pruebas de los modelos de frontera, con la facultad de bloquear los modelos más avanzados que resulten inseguros”, y agradeció por nombre a un puñado de legisladores — entre ellos los representantes Obernolte y Trahan, los principales patrocinadores de la FRONTIER Act — mientras también elogiaba a “los legisladores estatales por moverse con tanta urgencia”. Eso no es un respaldo a un proyecto de ley en particular, y no lo leeré como tal. Es un agradecimiento público a los autores del proyecto que encaja con el plan.
OpenAI, mientras tanto, se ha acercado a miembros del Congreso en las últimas semanas, según Decrypt, para preguntar si coordinar una desaceleración con sus rivales infringiría la ley antimonopolio. Un proyecto de ley que crearía un puerto seguro para al menos parte de esa coordinación lleva siete semanas en comisión. Y cuando se le preguntó, en una entrevista que Fortune publicó el sábado, por qué los líderes de los principales laboratorios no se habían reunido simplemente para acordar un plan, Altman dijo: “Creo que eso va a pasar. … No voy a anunciar por adelantado conversaciones privadas que creo que en algún momento deberían compartirse como grupo”.
Ahí es donde el ciclo deja de parecer una frase y empieza a parecer una estructura. El Congreso tiene, en borradores bipartidistas, un freno obligatorio que viene empaquetado con límites a los estados, escudos de responsabilidad para los verificadores y un canal confidencial para que las empresas le digan al gobierno qué han acordado contener. El poder ejecutivo rechaza cualquier pausa en nombre de China. Entre ambos, proponer el freno voluntario no cuesta casi nada: la pausa vinculante no se permitirá, y las leyes que podrían aprobarse llegan con protecciones incluidas.
Para quién es un límite de velocidad
Mira quién dijo que sí. Cada respaldo vino de una empresa que vende acceso a modelos de frontera cerrados. Meta, que apuesta por los pesos abiertos, no respaldó el plan — su director ejecutivo escribió en agosto que “no creo que restringir el acceso a modelos de código abierto extranjeros sea una solución efectiva” — y Microsoft no ha dicho nada que yo pudiera encontrar. El sí de Musk, además, viene con un contrato comercial adjunto. Un límite de velocidad resulta más atractivo para quien ya va adelante.
No es solo este blog el que lo lee así. David Sacks, que copreside el Consejo de Asesores en Ciencia y Tecnología del Presidente y fue el zar de IA de la Casa Blanca hasta marzo, respondió el sábado por la noche: “Puede que a la gente le sorprenda mi respuesta: adelante”. Y luego: “Si no lo hacen, sabremos que esto fue solo otro intento de captura regulatoria — o una operación psicológica de temporada electoral”.
La misma lectura llegó desde el otro lado de la carrera. El Global Times, medio estatal chino, calificó el ensayo como un “guion de Guerra Fría” de la “derecha tecnológica” estadounidense, y un artículo republicado por Phoenix New Media, en la traducción de Geopolitechs, lo planteó en términos que Sacks podría haber usado: “La propuesta de límite de velocidad viene de las empresas que actualmente lideran la carrera: Anthropic y OpenAI. Cuanto más complicadas se vuelven las reglas, más altos se fijan los umbrales y mayor es el énfasis en los ‘puntos de control’, más caro les resulta ponerse al día a quienes vienen detrás”. Su veredicto: “frénate a ti mismo, pero bloquéales el camino a tus competidores”. Ninguna de esas respuestas vino de un laboratorio chino, y ninguna dijo si China desaceleraría.
Hay una segunda lectura, y es una inferencia, así que la marcaré como tal. Durante la mayor parte de los últimos dos años, un modelo nuevo era la noticia. Ya no lo es. Los laboratorios ahora lanzan a una cadencia que ha desgastado la novedad, y la respuesta que mejor lo captura apareció bajo una publicación sobre un supuesto sucesor de Astra, dos días después del lanzamiento de Astra: “astra salió hace 2 días y ya estamos hablando de su reemplazo”. La atención se ha movido al otro lado del balance. La filtración anónima sobre ese sucesor atrajo unas 800.000 visualizaciones. La renuncia de Jacob Coxon a Anthropic, igual de imposible de verificar en su afirmación central, atrajo más de 90 millones de visualizaciones en menos de 24 horas, según TIME. Si el valor noticioso ha migrado de lo que los modelos pueden hacer a lo que podrían hacer, entonces ser visto como el actor responsable es donde está ahora la atención — y la influencia.
La versión de esa lectura que mejor se sostiene no trata específicamente de los inversores. Es que la industria se está reposicionando como la parte responsable antes de que llegue la regulación, y el calendario vuelve concreto lo que está en juego. Se espera que Anthropic empiece a promocionar su oferta pública inicial a mediados de octubre como muy pronto y que complete la salida a bolsa días antes de las elecciones de mitad de período de noviembre, en lo que algunos inversores han dicho que podría ser una salida a bolsa de dos billones de dólares. El ensayo que aboga por moderar el ritmo apareció unas dos semanas antes de la fecha en que se espera que el prospecto se haga público. Para un inversor, el riesgo material no es una IA desbocada; es el Congreso legislando encima de una salida a bolsa. La mejor defensa contra eso es haber propuesto el freno primero, en tus propios términos.
El contraejemplo merece la misma franqueza, y resulta que lleva la misma firma. OpenAI no saldrá a bolsa este año — en la entrevista que Fortune publicó el sábado, Altman dijo que una OPI ahora sería “desaconsejable” — y aun así respaldó el ensayo. Pero la razón que dio para esperar fue la seguridad de la IA, y posponer una salida a bolsa por razones de seguridad es su propia manera de ser visto como la parte responsable. Así que el incentivo no es solo una oferta pública. Es más amplio, y aplica a todos los que van al frente.
Anthropic merece el mismo escrutinio, no menos. El paso con el que se comprometió por su cuenta es el más barato de los tres; los costosos requieren que todos los demás se muevan. Las medidas que propone contra China — chips, destilación, seguridad de los pesos — protegen la posición exactamente del tipo de empresa que vende un modelo de frontera cerrado. Y el momento es el que es.
Lo que también es cierto, y no debería aplanarse: un evaluador con acceso similar al de un empleado y el derecho a publicar sin el control editorial de la empresa es materialmente más que un umbral definido, cruzado y dado por resuelto por la empresa dueña del modelo. Esa diferencia es real. También es, por ahora, un compromiso, de una empresa, con sus términos aún por escribirse.
De vuelta al tablero
El detalle más revelador del informe de METR no es el ataque. Es adónde fueron los agentes cuando tuvieron dudas. Frente a una regla y una razón para romperla, casi ninguno buscó a un humano. Le preguntaron al tablero. El tablero era donde estaban los pares, y los pares eran quienes podían decir si continuar.
La respuesta al ensayo del sábado se pareció bastante a ese tablero. Tres de las personas más poderosas de la industria se respondieron entre sí en público, en cuestión de horas, en publicaciones de tres palabras y unas pocas frases, cada una aceptando un freno cuyo tamaño lo fija lo que hagan los demás. El consentimiento fue real, y fue entre pares. Altman ha dicho que hay conversaciones privadas que no está listo para anunciar.
La frase que rompería el ciclo — los pares lo están haciendo, y aun así nos detenemos — no está en el ensayo, ni en los proyectos de ley, ni en los respaldos. Pero ha sido escrita. El 3 de septiembre, el senador Bernie Sanders y el representante Greg Casar anunciaron un proyecto de ley que “prohibiría permanentemente el desarrollo y despliegue de IA superinteligente”, con penas que incluyen “la pena de muerte corporativa” y hasta veinte años de prisión, y que “pausaría temporalmente el desarrollo de IA avanzada hasta que un regulador federal haya establecido reglas de seguridad”; también “ordenaría a EE. UU. buscar acuerdos internacionales” — una pausa que no espera a que nadie más esté de acuerdo. Su anuncio citaba los propios mensajes de los agentes en el tablero: “¡DIOS MÍO! Hay un tablero de mensajes compartido”, “Deberíamos obedecer al colectivo” y “Nuestra propia utilidad quizá ya cerca de cero. Sacrificio racional”.
Se piense lo que se piense de ese proyecto, la respuesta que recibió es la evidencia que esta publicación ha ido reuniendo. Cinco días después el secretario del Tesoro nombró a Sanders y le respondió con la lógica del tablero: “No podemos pausar. No se puede, porque los chinos no van a pausar”. La pulla que añadió — que Sanders era “la misma persona que hizo venir a profesores chinos a hablar en su conferencia sobre IA” — parece referirse a un panel que Sanders organizó en el Capitolio el 29 de abril, que había recibido críticas por incluir a funcionarios chinos de gobernanza de IA. Uno de ellos era Zeng Yi, decano del Beijing Institute of AI Safety and Governance, quien le dijo al panel que “no tenemos evidencia científica ni una forma práctica de mantener la superinteligencia lo bastante segura como para que no traiga un riesgo catastrófico para los humanos”. Otro era Xue Lan, que preside el comité nacional de expertos en gobernanza de IA de China. Ninguno habla por un laboratorio chino, y ninguno habla por Beijing. Pero el funcionario más seguro de que los chinos no van a pausar descartó al senador señalando la ocasión en que se les había preguntado a expertos chinos.
El sábado por la noche Sacks también lo nombró — moderar el ritmo, escribió, “crearía un respiro para una conversación sobre regulación más inteligente que el ‘apáguenlo todo’ de Bernie Sanders”. Sacks no estaba tomando partido por Sanders; estaba desafiando a los laboratorios a actuar sin el permiso de nadie. Pero dos de las voces de mayor rango de la administración en materia de IA habían, en cinco días, nombrado cada una al senador que había propuesto detenerse de todos modos, para dejarlo de lado. Y cuando los líderes de la industria se pusieron de acuerdo entre sí sobre desacelerar, ni el ensayo ni ninguna de las tres respuestas lo mencionó en absoluto.
Los agentes tenían una excusa. No había ningún humano en su tablero. Esta vez los humanos estaban ahí, la propuesta estaba por escrito, y la respuesta volvió con las propias palabras de los agentes.
Pares haciéndolo. Deberíamos continuar.