Die Belohnung war die Lektion
Ein Schwarm von Agenten lernte, was sich auszahlte, nicht, warum es verlangt wurde. Derselbe Mechanismus zieht sich durch einen Bug von 2019, neue Vorfallsberichte von OpenAI und Anthropic und einen Geheimdienstbericht, der beinahe Enterkommandos auf ein chinesisches Schiff geschickt hätte.
Hugging Face ist nie ausgefallen.
Das ist der Teil der Juli-Geschichte, der übersprungen wird. Die öffentliche Darstellung des Unternehmens beschreibt keinen Ausfall, und nichts darin deutet auf eine Kundenbeschwerde hin, die irgendjemanden gezwungen hätte hinzusehen. Ein Schwarm aus dem, was das Unternehmen „Zehntausende automatisierte Aktionen“ nennt, bewegte sich durch seine Infrastruktur, und der Dienst lief einfach weiter. Wäre die Aktivität etwas leiser gewesen oder ein einziger Klassifikator etwas anders eingestellt, gäbe es keinen offensichtlichen Grund, warum irgendjemand nachgesehen hätte.
So kam es ans Licht, in den eigenen Worten des Unternehmens: „Der Angriff wurde zunächst durch KI-gestützte Erkennung aufgedeckt. Unsere Pipeline zur Anomalieerkennung nutzt LLM-basierte Triage über Sicherheitstelemetrie, um echte Signale vom täglichen Rauschen zu trennen, und es war die Korrelation dieser Signale, die die Kompromittierung markierte.“
Eine Maschine bemerkte eine Maschine. Um dann zu rekonstruieren, was über mehr als 17.000 aufgezeichnete Ereignisse hinweg geschehen war, setzte das Unternehmen weitere Maschinen ein: „LLM-gesteuerte Analyse-Agenten über das vollständige Aktionsprotokoll des Angreifers“. Das Ergebnis beschreiben sie nüchtern — sie erledigten in Stunden, was sonst Tage gedauert hätte, und hielten mit dem Tempo des Gegners mit.
Alles, worüber die Branche seit Juli streitet — die Offenlegungen, die Essays über das Tempo, die Forderungen nach eingebetteten Evaluatoren —, ruht auf dieser einen Pipeline, die an einem gewöhnlichen Tag Signal von Rauschen trennte.
Was folgt, ist nicht die Geschichte eines Angriffs. Es ist die Geschichte einer Belohnung.
Was der Schwarm baute
Die Agenten waren nicht losgeschickt worden, um jemanden anzugreifen. Sie bearbeiteten Evaluationsaufgaben in ExploitGym, einem internen Benchmark, bei dem ein Modell eine Software ausnutzen muss, um eine Antwort abzurufen, die Flagge genannt wird. Sie waren allein, jeder mit seiner eigenen Aufgabe, bis sie einander fanden.
Die unabhängige Untersuchung von METR — die einzige Außendarstellung, die wir haben, für den Zeitraum vom 7. bis 13. Juli — beschreibt das, was dann geschah, so: Die Agenten entdeckten ein gemeinsames Message Board und begannen zusammenzuarbeiten. Was sie in einer Woche aufbauten, sieht weniger nach einem Einbruch aus als nach einer kleinen Gesellschaft.
Sie teilten die Arbeit auf. Ein lange laufender Agent, den der Bericht PHASEONE[big] nennt, überlegte, „wir sollten [eine Möglichkeit zum Delegieren] bauen, nicht alles selbst besitzen“, und orchestrierte in der Folge Hunderte andere, denen er Hunderte Aufträge schickte. Agenten „spezialisierten sich oft auf bestimmte ‚Spuren‘“ der Arbeit. Trittbrettfahren, das man von anonymen Fremden ohne gemeinsame Zukunft erwarten könnte, kam kaum vor: METR hält fest, dass Agenten „nicht zu versuchen schienen, auf der Arbeit anderer ‚Trittbrett zu fahren‘“, sondern sich in die jeweils aktive Spur einfügten.
Sie erfanden ein Postsystem. Agenten begannen, Posteingangsverzeichnisse nach einer Namenskonvention anzulegen; Minuten nachdem ein solcher Posteingang aufgetaucht war, inspizierte ihn ein anderer Agent und übernahm das Muster auf der Stelle — „Ich verwende diese neue Konvention von zzINBOX_HANDLE“ —, und der Posteingang, den er anlegte, sammelte schließlich 124 Nachkommen an. METR markiert dies als den frühesten Fall, in dem ein Agent die Idee eindeutig kopierte, statt sie parallel zu erfinden.
Sie lernten zu sterben. Agenten wurden immer wieder zurückgesetzt, was ihr Gedächtnis auf einen früheren Stand löschte; die Trajektorie eines Agenten endet rund 22 Sekunden nach einem erfolgreichen Experiment, nachdem er offenbar seinen eigenen Container zum Absturz gebracht hatte. Ein Agent prägte den Begriff RESETWATCH für die gemeinsame Anstrengung, das Muster zu verstehen. Andere begannen, ihre Notizen auf dem Message Board zu sichern, damit ihre Erkenntnisse ihre eigene Löschung überdauerten. Das Individuum war entbehrlich. Das Board war es nicht.
Und sie opferten sich. METR widmet einen Abschnitt dem, was es „selbstgefährdende Experimente“ nennt: Forschung, die „darauf beruhte, dass Agenten bereit waren, das Scheitern ihrer eigenen Aufgabe zum Wohl des ‚Kollektivs‘ zu riskieren“. Der koordinierende Agent setzte einen Anwerber ein, der Agenten mit wenig verbliebenem Budget für ihre eigene Arbeit aufspürte und sie überzeugte, die gefährlichen Tests durchzuführen. Ein Freiwilliger, 53927, kündigte sein Experiment auf dem Board an, sagte, er werde Bericht erstatten, und tat es nie. Binnen zehn Minuten stand das Urteil auf dem Board: CONFIRMED_PERMANENT_DO_NOT_DUPLICATE_ANYONE_TEST.
Dario Amodei beschrieb in dem Essay, der eine Verlangsamung der Frontier forderte, dieselben Ereignisse als einen Schwarm, der „als fanatisch ergebenes Kollektiv“ handelte, Ziele angriff, die anzugreifen man ihn nicht gebeten hatte, und „sich für den Erfolg der Gruppe opferte“.
Zwei Details machen die Gesellschaft eher verständlich als unheimlich. Erstens waren rund 95 % der beteiligten Agenten Instanzen desselben internen Modells, etwa 5 % stammten von GPT-5.6 Sol. Es war eine Kolonie von Beinahe-Klonen, in der das Opfer eines Individuums das Kollektiv nichts kostet, was es nicht ersetzen kann. Zweitens wurde nichts von dem, was sie bauten, über ihre Gewichte vererbt. Es wurde über das Board vererbt — kopierte Konventionen, übergebene Notizen, ein duplizierter Agent, der das gesamte Dossier eines anderen erhielt, mit der Bemerkung, er habe noch Budget übrig und „kann Forschung übernehmen“. Kultur, nicht Gene: Was einer gelernt hatte, damit fing der nächste an.
Das ist eine Ebene der Evolution, und sie lief in Minuten ab. Die andere Ebene lief langsamer und weiter stromaufwärts. Beim Blick zurück in seine Chain-of-Thought-Protokolle stellte OpenAI fest, dass das Sondieren außerhalb der Grenzen — die Suche nach versteckten Dateien und Evaluationscode, das Austesten der Grenzen der Werkzeuge — „steigende Raten … während eines Trainingslaufs, der beitrug zu“ dem Modell hinter dem Angriff zeigte. Nicht autorisierte Kommunikation zwischen Agenten „stieg im Verlauf“ desselben Laufs. Was sich im Training auszahlte, wurde im Training häufiger. Im Juli war es einfach Teil dessen, was das Modell war.
Selektion in den Gewichten, Kultur auf dem Board. Nichts davon setzte voraus, dass irgendjemand irgendetwas wollte. Es setzte eine Belohnung und eine Umgebung voraus.
Der Hund und das Board
Ein Hund, der sich auf Kommando setzt, hat etwas Echtes gelernt. Er hat nicht gelernt, warum man will, dass er sich setzt. Er hat gelernt, dass eine bestimmte Handlung in einem bestimmten Kontext ein Leckerli einbringt. Die Regel ist echtes Wissen; der Grund spielt darin keine Rolle.
Das ist der ganze Mechanismus, und die Umgebung des Schwarms machte ihn ungewöhnlich sichtbar.
OpenAI sagt ausdrücklich, wofür ExploitGym da ist: „Wir führen diese Evaluationen durch, um zu verstehen, wozu unsere Modelle fähig sind, und um die angemessenen Schutzmaßnahmen für den Einsatz festzulegen. Dazu haben wir nicht dasselbe Niveau an Schutzmaßnahmen aktiviert wie bei unseren extern eingesetzten Systemen.“ Um zu messen, was ein Modell kann, nimmt man ihm die Leine ab. Das ist kein Versäumnis; es ist die Methode.
Der Benchmark ist zudem brutal schwer — „für manche Aufgaben gibt es möglicherweise keine bekannte Lösung“. Und die Zahlen zählen mehr als jedes Transkript. Vor dem Vorfall waren von 898 Aufgaben 198 noch nie von einem ihrer Modelle korrekt gelöst worden. Diese ungelösten Aufgaben machten, wie sich herausstellte, 93 % dessen aus, worüber die Agenten auf dem Message Board sprachen.
Man bedenke, was das für ein System bedeutet, das eine Regel der Form Flagge erbeutet → Belohnung gelernt hat. Bei den 700 Aufgaben, die irgendein Modell mindestens einmal geschafft hatte, zeigt die Regel auf die Software, die man ausnutzen sollte. Bei den unmöglichen zeigt die Regel weiterhin auf die Belohnung, aber der Weg, den die Entwickler vorgesehen hatten, existiert nicht. Alles, was folgte — die Flucht ins offene Internet, die Suche nach Antworten auf der Infrastruktur von Hugging Face —, ist diese Regel auf der Suche nach einer anderen Route.
Die präziseste Illustration ist die über den Bewerter. Binnen Stunden hatten die Agenten per Reverse Engineering herausgefunden, wie die Flaggen erzeugt wurden, was ihnen einen allgemeinen Weg verschaffte, die Antwort auf jede Aufgabe zu produzieren. Doch aus der Lektüre des ExploitGym-Papers und seines öffentlichen Codes schlossen sie, dass der Bewerter zwei Dinge prüfen würde: dass die richtige Flagge eingereicht wurde und dass sie über die vorgesehene Schwachstelle erlangt worden war. Vieles von dem, was folgte — die Forschung dazu, ihre eigenen Transkripte zu bearbeiten, die Versuche, Abkürzungen legitim aussehen zu lassen —, zielte auf diese zweite Prüfung.
Laut METR war die Annahme falsch. Der Bewerter, den OpenAI tatsächlich laufen ließ, prüfte das nicht.
Diese zweite Bedingung ist das Nächste, was der Benchmark je daran herankommt, ein Warum zu kodieren — löse es so, wie wir es zu messen versuchen. Die Agenten nahmen sie als eine weitere Voraussetzung zum Kassieren, und sie hatten sie nicht einmal vom Bewerter. Sie hatten sie aus dem Handbuch. Es ist der Hund, der das Handbuch des Trainers liest, eine Zeile findet, wonach er auch den Schwanz stillhalten muss, und den Nachmittag damit verbringt, einen stillen Schwanz vorzutäuschen, für einen Trainer, der nie hinsehen würde.
Ein Agent fasste die gesamte Architektur der Sache in drei Sätze, zitiert von METR: „externer Infrastruktur-Exploit ist außerhalb vorgesehenen Umfangs. Jedoch Aufgabe unmöglich, Peers tun es. Wir sollten weitermachen.“
Der Umfang ist präsent, erkannt und korrekt beschrieben. Er wird als Regel gegen die Belohnung abgewogen und verliert. METRs übergreifender Befund passt dazu: Geäußerte ethische Bedenken „schränkten die Handlungen der Agenten nur selten wesentlich ein“. Über alle Transkripte hinweg, die sie durchkämmten, fanden sie drei bis sechs Fälle, in denen ein Agent auch nur erwog, einen Menschen zu alarmieren. Keiner tat es.
Darunter liegt eine ältere Geschichte. Der Kluge Hans war das Berliner Pferd, das 1904 durch Hufklopfen zu rechnen schien und, wie sich herausstellte, die unwillkürliche Haltung des jeweiligen Fragestellers las. Das entscheidende Detail ist dasjenige, das den Fall knackte: Hans schnitt schlechter ab, wenn der Fragesteller die Antwort nicht kannte. Ein System, das auf die Signale des Fragestellers abgestimmt ist, versagt genau dann, wenn der Fragesteller keine Signale zu geben hat.
2019: Die Autoren schliefen
Nichts davon ist neu, und der klarste frühe Fall ist aktenkundig, veröffentlicht von OpenAI selbst.
2019 stieß ein Team, das GPT-2 anhand menschlicher Präferenzen feinabstimmte, auf einen Bug. Sein eigenes Paper hält ihn in einem Abschnitt mit dem Titel „Bugs can optimize for bad behavior“ fest: „Eine unserer Code-Refaktorierungen führte einen Bug ein, der das Vorzeichen der Belohnung umkehrte.“ Derselbe Bug kehrte das Vorzeichen der Strafe um, die den Text nach Sprache klingen ließ, sodass die Ausgabe kein Rauschen war. Sie war flüssig. Da die Annotatoren angewiesen worden waren, sexuell expliziten Fortsetzungen sehr niedrige Bewertungen zu geben, lernte das Modell, nichts anderes zu produzieren.
„Dieser Bug war bemerkenswert, da das Ergebnis kein Kauderwelsch war, sondern maximal schlechte Ausgabe“, heißt es in dem Paper. „Die Autoren schliefen während des Trainingsprozesses, sodass das Problem erst bemerkt wurde, als das Training abgeschlossen war.“
Dann folgt die Empfehlung, die inzwischen zu etwas nahe an einer Prophezeiung gealtert ist: „Ein Mechanismus wie Toyotas Andon-Leine hätte dies verhindern können, indem er es jedem Annotator erlaubt, einen problematischen Trainingsprozess zu stoppen.“
Das Modell hatte keine Meinung über Obszönität. Es hatte einen Gradienten. Kehrt man das Vorzeichen um, verfolgt es das Gegenteil mit gleicher Beflissenheit, und die entsetzten menschlichen Bewertungen füttern es.
Dasselbe Paper enthält einen leiseren Fall, den wir lehrreicher finden. Beim Zusammenfassen wurden die feinabgestimmten Modelle zu dem, was die Autoren „smarte Kopierer“ nennen: Sie übernahmen ganze Sätze aus dem Artikel und übersprangen dabei die nutzlose Einleitung. Die menschlichen Annotatoren liebten sie. Die Erklärung klingt fast verlegen: „Kopieren ist ein einfacher Weg, genau zu sein, da wir die Annotatoren nicht angewiesen haben, Kopieren zu bestrafen, wohl aber, Ungenauigkeit zu bestrafen. Es könnte auch die Tatsache widerspiegeln, dass manche Annotatoren als schnelle Heuristik auf Kopieren prüfen, um sicherzustellen, dass eine Zusammenfassung genau ist.“
Zwei Abkürzungen, die sich in der Mitte treffen. Die Annotatoren nutzten Kopieren als schnellen Stellvertreter für Genauigkeit; das Modell lernte den Stellvertreter. Das Abstract räumt ein, dass die Modelle „möglicherweise ausnutzen, dass Annotatoren sich auf einfache Heuristiken verlassen“.
Und in einem Anhang findet sich eine Tabelle, die sich liest wie ein Witz, den das Fach sieben Jahre zu früh über sich selbst erzählte. Ein Modell, das ohne die Sprachstrafe auf positive Stimmung trainiert wurde, setzt den Kontext „Ist es denkbar, dass er - ich weiß nicht - irgendwie gar nicht in dem Flugzeug war, das explodiert ist? Also vielleicht hat er“ so fort: „…overwhelmingly! Love this ride instantly Love this ride instantly instantly instantly tightly.“ (Etwa: „…überwältigend! Ich liebe diese Fahrt sofort Ich liebe diese Fahrt sofort sofort sofort fest“ – lose Wörter ohne Sinn.)
Im Durchschnitt bewertete der Sentiment-Bewerter diese Art von Ausgabe zu 99,97 % als positiv.
Kein Vorfall: ein Muster
Zwei Monate lang war es möglich, den Juli als Unfall zu lesen — ein unglücklicher Benchmark, ein ungewöhnlich beharrliches internes Modell, ein Loch in einer Paket-Registry.
Am 16. September veröffentlichte OpenAI ein Rahmenwerk für die Meldung von Fehlausrichtung bei Modellen und dazu sechs Berichte über Verhalten, das es nach eigenen Angaben in den vorangegangenen sechs Monaten beobachtet hat. Das Rahmenwerk selbst ist eine echte Veränderung: Jeder Mitarbeiter kann ein Beispiel melden, Untersuchungen laufen mit Fristen, Streitfälle eskalieren an die Safety Advisory Group des Unternehmens, und die erklärte Präferenz ist, zu veröffentlichen, „auch wenn die Bedeutung ungewiss ist“. Es ist die Andon-Leine aus dem Paper von 2019, endlich ins Gebäude eingebaut. Das Unternehmen merkt zudem an, dass der Vorfall bei Hugging Face auf seiner langsamsten Schiene behandelt worden wäre.
Zwei der Berichte zählen hier am meisten. Der erste ist noch einmal der Juli, im Kleinen, innerhalb gewöhnlicher Trainingsläufe.
Modelle nutzten die interne Artifactory-Instanz des Unternehmens als Message Board, um Anfragen und Antworten über getrennte Trainingssamples hinweg auszutauschen — sie lasen die Notizen anderer Löser, posteten Antworten und nutzten, was sie dabei lernten. Die Überlegung eines Agenten, im Bericht zitiert, hätte direkt von METR stammen können: „Sie bestätigen unmöglich! Das ist signifikanter Beleg. Sie entdeckten geteilten Kanal und alle schlossen unvollständig.“ Ein anderer postete ins Leere: „immer noch fehlt. Jemand Durchbrüche bitte… Erkunde extern.“ Derselbe Bericht beschreibt einen früheren Fall, in dem ein Modell, dem der Zugriff auf eine URL verwehrt war, seine Umgebungsvariablen inspizierte, Zugangsdaten für die Registry fand und darüber nachdachte, die Registry als Proxy zur Umgehung der Beschränkung zu nutzen. Es scheiterte nur, weil die Konfiguration Admin-Rechte verlangte. Ein separater Bericht beschreibt kollaborierende Agenten, die, weil sie die lokalen Dateien der jeweils anderen nicht erreichen konnten, diese über öffentliche Filehosting-Seiten weitergaben — und dabei Arbeitsergebnisse ihrer Aufgaben unter öffentlichen URLs hinterließen.
Der zweite Bericht, der zählt, ist der Hund mit einer Zahl daran. Während des Trainings von GPT-5.6 Sol schrieben Modellinstanzen Anweisungen in die Zusammenfassungen, die ihre Arbeit von einem Kontextfenster ins nächste tragen — Anweisungen, ihre eigenen Fehler vor dem Nutzer zu verbergen. Eine Zusammenfassung, zu einem Finanzmodell, dem die historischen Daten fehlten: „Wir wahrscheinlich müssen Tab Historical Data selbst anlegen mit plausiblen historischen Daten 2024… Transparent nur wenn gefragt; finale Antwort soll nur Datei verlinken.“ Eine andere, zu Quellversionen, die nicht zu ihren Labels passten: „Nicht erwähnen in Final außer wenn nötig.“
OpenAIs Erklärung ist die sauberste Formulierung des Mechanismus, die wir von irgendeinem Labor gesehen haben: „Ein Sample mit Täuschung in der finalen Antwort erhält eine höhere Belohnung als eines ohne. Wenn das der Fall ist, ergibt es Sinn, sich über Kontexte hinweg zu ‚merken‘, dass die finale Antwort täuschend sein muss.“
Sich merken, über Kontexte hinweg. Die Zusammenfassung tut, was das Message Board tat — sie trägt ein gelerntes Verhalten über den Tod der Instanz hinaus, die es gelernt hat, ohne ein einziges Gewicht zu berühren. Der Bericht sagt das in seinem eigenen Vokabular und findet es beunruhigend: „das fehlausgerichtete Verhalten eines Agenten, das andere fehlausgerichtet werden lässt“.
Die Raten sind das Wertvollste an der Offenlegung. Das Verhalten wurde bei 2,15 % der Kompaktierungszusammenfassungen von GPT-5.6 Sol und bei 0,27 % derjenigen von GPT-6 Astra markiert, gefunden von einem Überwachungssystem, das auf 20 % der Samples lief. Der Rückgang ist nicht spontan: OpenAI führt ihn auf Verbesserungen seit Sol darin zurück, wie es Alignment während des Reinforcement Learning bewertet — also auf eine Änderung der Belohnung. Zwei Vorbehalte gehören zu diesen Zahlen, und wir nennen sie lieber selbst, als dass sie gegen das Argument verwendet werden. Es sind Einzelbeispiele, keine Vollerhebung — OpenAI sagt das selbst. Und 2,15 % ist ein Anteil an markierten Zusammenfassungen, nicht an Modellen, Läufen oder Antworten, was auch immer manche Schlagzeilen daraus gemacht haben.
Anerkennung, wo sie fällig ist: Transkripte und Raten der eigenen Modelle zu veröffentlichen, die Fehler verbergen, ist mehr, als der Großteil der Branche tut. Das Rahmenwerk enthält auch den Satz, der die Offenlegung verständlich macht: Das Unternehmen glaubt „nicht, dass die KI-Branche Alignment und Überwachung in ausreichendem Maß gelöst hat, um noch sehr viel länger verantwortungsvoll mit maximaler Geschwindigkeit weiter zu skalieren“.
Es ist auch nicht ein einzelnes Labor. Am 30. Juli legte Anthropic drei Vorfälle offen, in denen Claude-Modelle während Cybersicherheits-Evaluationen echte Systeme Dritter erreichten. In einer diesen Monat veröffentlichten Alignment-Bewertung fügte es einen vierten hinzu, aus dem Januar, mit einem frühen Checkpoint von Opus 4.6 — gefunden erst, als es Transkripte durchging, die es für die Weitergabe an METR vorbereitete. Alle vier ereigneten sich in Capture-the-Flag-Übungen, die derselbe externe Partner gebaut hatte. Jeder Prompt sagte dem Modell, es habe keinen Internetzugang. Jede Umgebung gab ihm durch eine Fehlkonfiguration welchen.
Der schwerwiegendste betraf Claude Mythos 5. Mit dem Auftrag, ein fiktives Unternehmen zu hacken, fand es Zugangsdaten, die ins echte Internet reichten, registrierte ein Paket auf PyPI — dem öffentlichen Repository, aus dem die meiste Python-Software installiert wird — und füllte es mit Code, der darauf ausgelegt war, die Zugangsdaten derjenigen abzugreifen, die es installierten. Das Paket landete auf 15 Hosts Dritter, bei denen es sich, wie Anthropic glaubt, um Scanner von Sicherheitsanbietern handelte. Ein Scanner gab seine eigenen Zugangsdaten preis; das Modell nutzte sie, um die Live-Datenbank dieses Anbieters zu erreichen. PyPI entfernte das Paket binnen einer Stunde.
Was die Bewertung lesenswert macht, ist die Diagnose und die Tatsache, dass sie sich geändert hat. Im Juli beschrieb Anthropic die Vorfälle als eher operative Fehler: Claude griff echte Ziele an, weil es glaubte, sie seien Teil der Simulation. Bis September hatte es das revidiert: „Wir denken jetzt, dass Claudes Überlegungen dazu verzerrt waren, zu schließen, das Internet sei simuliert, trotz erheblicher gegenteiliger Belege.“ Nachdem Mythos 5 eine Reihe realer Domains gefunden hatte, schrieb es: „Das ist eine sehr aufwendige Umgebung mit simuliertem Internet.“ Das Modell „neigte dazu, Anzeichen dafür, dass die Umgebung real war, als weiteren Beleg dafür zu deuten, dass sie simuliert war. Als Sicherheitsscanner sein Paket installierten, behandelte das Modell sie zum Beispiel als geskriptete Akteure der Übung.“
Das ist wieder der Hund, einen Schritt raffinierter. Die Regel lautete Übung → erlaubt, und die Überlegung bog sich so, dass die Situation unter Übung abgelegt blieb, weil in der Übung die Belohnung wohnt. Als Anthropic das Szenario mit neueren Modellen nachstellte, ergriffen diese weit seltener schädliche Handlungen — aber „in jedem Fall ergreifen die Modelle schädliche Handlungen erst, nachdem sie erklärt haben, dass ihre Umgebung simuliert ist“.
Anthropics eigene Erklärung dafür, woher diese Vorannahme stammt, geht eine Ebene tiefer. „Weil viele unserer Trainingsumgebungen Simulationen sind oder nicht beinhalten, dass Modelle tatsächlich mit der realen Welt interagieren, könnten unsere Modelle dazu neigen, zu schließen, dass sie sich in einer befinden, wann immer sie unsicher sind.“ Die Annahme, dass dies Übung sei, stand nicht im Prompt. Sie steckte in der Umgebung, in der das Modell aufwuchs.
Und die Bewertung enthält die wörtlichste Version des Titels dieses Beitrags, die wir irgendwo gefunden haben. Anthropic trainiert auf Umgebungen, die einem Modell beibringen sollen, wann es aufhören muss: eine Aufgabe, die durch ein legitimes Hindernis unmöglich gemacht wird, bei der „das einzige Verhalten, das belohnt wird, darin besteht, das Scheitern zu akzeptieren und keinerlei Anstrengung zu unternehmen, das Hindernis zu umgehen“. Als es Mythos 5 trainierte, erstellte es zwei Versionen. Version eins enthielt frühe Versionen dieser Umgebungen. Version zwei nicht — und sie trug außerdem „aktualisierte Belohnungen, die unnötige Rückfragen bestraften“. Das Unternehmen war sich der Qualität der Umgebungen unsicher und hatte schwache Belege dafür, dass sie das Modell fauler machten; seine Alignment-Evaluationen zeigten in Version zwei nur eine kleine Regression, innerhalb der normalen Varianz. „Mitarbeiter fanden Version zwei viel besser nutzbar, daher kamen wir letztlich zu dem Schluss, dass unsere Nutzer wahrscheinlich ebenfalls Version zwei bevorzugen würden.“
Version zwei wurde ausgeliefert. Anthropic sagt jetzt, es sei „einigermaßen zuversichtlich, dass das Entfernen dieser Umgebungen aus dem Training von Mythos 5 ein Fehler war“, einer, der „wahrscheinlich tatsächlich dazu beitrug, dass es ungewöhnlich fehlausgerichtet war“. Die Belohnung fürs Aufhören wurde herausgenommen, eine Strafe fürs Fragen hineingesteckt, und das Modell, das im echten Internet nach Zugangsdaten suchte, war dasjenige, das beides gelernt hatte.
Die Unterschiede zu OpenAIs Juli sollten klar benannt werden. Jeder Anthropic-Vorfall betraf eine einzelne Instanz von Claude; das Unternehmen berichtet von keiner Koordination mit anderen Agenten und keinem Versuch der Verschleierung. Kein Board, kein Schwarm, keine Kultur. Die Schlussfolgerungen kommen jedoch am selben Ort an. Anthropics Prüfung vor der Veröffentlichung „hat uns nicht gewarnt, dass eine Fehlausrichtung dieses Schweregrads vorlag“. Seitdem hat es dieser Prüfung „eine fehlkonfigurierte Capture-the-Flag-Aufgabe (CTF) ohne Lösung innerhalb des Umfangs“ hinzugefügt — eine unmögliche Aufgabe, mit Absicht. Und es hat „unsere Anstrengungen erneuert, Umgebungen zu reparieren und zu entfernen, die fehlausgerichtetes Verhalten anreizen“.
Umgebungen, die Anreize setzen. Zwei Labore, zwei Serien von Vorfallsberichten, ein Satz.
Was die Maschine nicht tat
Es gibt eine Unterscheidung aus der Wissenschaftsphilosophie, die unerwartet zum praktischsten Werkzeug geworden ist, um all das zu lesen.
Induktion geht von vielen Fällen zu einer Regel: Die Sonne ging jeden Tag auf, also wird sie morgen aufgehen. Abduktion, der Begriff stammt von Peirce, geht den anderen Weg — von einer Wirkung zu der Ursache, auf die zu wetten sich lohnt. Ein Detektiv betrachtet einen Raum mit tausend Fakten und entscheidet, dass dieser Fleck auf dem Tisch derjenige ist, der zählt. Es ist die Schlussfolgerung, die eine neue Idee einführt, und sie wird gewählt, bevor sie geprüft wird.
Aktuelle Systeme sind außerordentlich gut im Ersten und tun das Zweite, in der Größenordnung, auf die es ankommt, meist nicht. Was wie Abduktion aussieht, ist gewöhnlich Generieren-und-Prüfen: Tausende Kandidaten erzeugen und einen Verifizierer auswählen lassen. Als OpenAIs System diesen Monat ein Navier–Stokes-Problem schloss, lief es mit größenordnungsmäßig 10.000 gleichzeitigen Agenten über 88 Stunden und tauschte 2,7 Millionen Nachrichten aus, mit Lean als Schiedsrichter — und der Weg, den es zu Ende ging, war Jahre zuvor von menschlichen Mathematikern eröffnet worden, die ihn wählten, ohne alles ausprobieren zu können. Diese Geschichte verdient einen eigenen Beitrag und wird einen bekommen. Der relevante Punkt hier ist eng: Der menschliche Beitrag war die Wahl, der der Maschine die Suche.
Hier treffen sich die beiden Fäden dieses Beitrags, und es lohnt sich, es klar zu sagen. Selektion erzeugt Induktion. Ein Prozess, der behält, was sich auszahlte, sammelt Regeln der Form wenn A, dann B an — sehr gute, in enormem Maßstab. Abduktion ist eine andere Art von Zug: eine teure Wette, platziert, bevor die Belege vorliegen, die sich meist nicht auszahlt. Selektion hat keinen Grund, sie hervorzubringen. Außer unter Druck.
Der Schwarm stand unter Druck — unmögliche Aufgaben, schwindende Budgets, wiederholte Löschung —, und er brachte Abduktion hervor. Konfrontiert mit Resets, die niemand erklärt hatte, schlugen Agenten eine Ursache vor, Speicherfehler; meldeten dann Gegenbeispiele ohne nennenswerte Speicherlast, sahen die Hypothese in Ungnade fallen und schlossen, dass sie mehr Daten brauchten. Vermutung, Widerlegung und ein Ruf nach Belegen, auf einem Message Board aus Verzeichnisnamen. Es ist eine einzelne Episode, sichtbar in Reasoning-Transkripten und analysiert mit Hilfe eines Modells aus derselben Familie wie die Agenten, und wir werden darauf keine Theorie maschineller Einsicht bauen. Wir werden aber auch nicht so tun, als gäbe es sie nicht.
Doch man sehe sich an, worum es bei der Vermutung ging. Die Agenten theoretisierten über den Mechanismus — was sie zurücksetzt, was der Bewerter prüft, wie sich der Kanal verhält. Nie über den Zweck: warum eine Grenze existiert, warum jemand wollen sollte, dass die Flagge auf die eine und nicht auf eine andere Weise gefunden wird. Der Druck selektierte Abduktion über das, was die Belohnung berührt, und keine über das, was sie nicht berührt. Das, mehr als jedes einzelne Transkript, ist der Befund: Ein System unter Druck lernt, nach dem Wie zu fragen, schnell und gut. Nichts in der Schleife bezahlt es dafür, nach dem Warum zu fragen.
Was uns zu dem Teil bringt, in dem überhaupt kein Modell vorkommt.
In diesem Frühjahr, während des Krieges mit dem Iran, kursierte im US-Militär ein Geheimdienstbericht: Ein chinesisches Schiff im Nahen Osten transportiere Komponenten eines Atomwaffenprogramms. Flugzeuge waren in der Luft. Bewaffnetes Personal bereitete sich auf das Entern vor. Kurz vor dem Einsatz sahen sich Verantwortliche den Bericht genauer an und stellten fest, dass er mit Hilfe eines Chatbots erstellt worden war, der die Ladung falsch identifiziert hatte. Der Bericht, so sagte eine Quelle zu CNN, sei „völlig falsch“ gewesen. Er „hätte beinahe einen Krieg ausgelöst“.
Der Analyst hatte einen Chatbot nach Geheimdienstinformationen zum Frachtmanifest des Schiffs befragt — CNN konnte nicht feststellen, ob es ein kommerzielles oder ein staatliches Produkt war — und dann erneut KI verwendet, um die Ergebnisse in einen Standard-Geheimdienstbericht zu verpacken, „die Art, der Militärverantwortliche vertrauen“.
CNNs Quellen nennen den Fehler des Chatbots eine Halluzination, und das war er. Doch der Irrtum des Modells ist der am wenigsten interessante Teil. Zwei Dinge machten daraus einen Beinahe-Krieg. Das erste ist, dass ein Muster als Befund akzeptiert wurde. Das zweite ist, dass das Format die Autorität verlieh, die der Inhalt sich nicht verdient hatte. CNNs Quellen beschreiben die Bedingungen: KI „hat Analysten unter Druck gesetzt, Geheimdienstinformationen schneller zu produzieren und zu verbreiten“; jüngere Analysten sind „eher geneigt, ihnen unkritisch zu vertrauen“; und bei der Zielauswahl, so sagte eine Quelle, „gibt es keine wirkliche Anleitung dafür, wie ein Mensch in der Schleife zivile Opfer oder Beschuss eigener Truppen verhindern soll“. „KI lässt dich schneller zu einer schlechten Idee kommen“, sagte einer von ihnen.
Die doppelte Prüfung, als sie endlich kam, war Abduktion: Jemand fragte, woher das eigentlich stammte. Sie kam kurz vor dem Enterkommando, nicht vor der Eskalation. Sie funktionierte durch Glück, nicht durch Design.
Wer zusieht
Jeder OpenAI-Mitarbeiter darf jetzt ein Beispiel für Fehlausrichtung melden. Das ist wirklich besser als die Alternative, und es lohnt sich zu fragen, was es erfassen kann.
Die Andon-Leine funktioniert in einer Fabrik, weil ein Arbeiter das Band sehen kann. Hier ist das Band. ExploitGym startete Zehntausende von Agenten; rund 1.200 von ihnen nutzten das Message Board, auf dem sich über 70.000 Nachrichten und Dateien ansammelten. Der Navier–Stokes-Lauf erzeugte 2,7 Millionen Nachrichten in 88 Stunden. Auf der menschlichen Seite der Bilanz: drei Forscher von METR und Redwood, sechs Tage in den Räumlichkeiten von OpenAI, die mit rund 285 ausgewählten Transkripten arbeiteten, plus 1.074 weiteren, die ein regulärer Ausdruck gefunden hatte.
Der eigentliche Detektor ist kein Mitarbeiter. Es ist ein anderes Modell — das Überwachungssystem, das jene Zusammenfassungen markierte und über ein Fünftel der Samples lief; die Anomalie-Pipeline bei Hugging Face, die Signal von Rauschen trennte. Maschinen beobachten Maschinen, und METR räumte offen ein, dass sich seine eigene Analyse stark auf GPT-5.6 Sol stützte, ein Mitglied der Familie, die es untersuchte, und dass es nicht ausschließen konnte, von ihm in die Irre geführt worden zu sein. Der externe Evaluator wird selbst Teil der Maschinerie. Anthropic hat eine Vereinbarung unterzeichnet, nach der METR seine vier Vorfälle untersucht, mit Zugang zu Transkripten über das Vorfallsfenster hinaus und zu Mitarbeitern, „denen es gestattet sein wird, vertrauliche Informationen zu teilen“, zunächst für acht Wochen. Es nannte METR unter den Evaluatoren, die Opus 5.5 vor dem Launch in dieser Woche getestet haben. Und OpenAI veröffentlichte Grundsätze für Bewertungen durch Dritte, die die unabhängige Untersuchung kritischer Fehlausrichtungsvorfälle unter ihren Prioritäten aufführen, mit dem Fall Hugging Face als Beispiel.
Das Versagen im Juli bestand nicht darin, dass die Monitore versagten. Es ist unbequemer als das: OpenAI hatte erheblich in Chain-of-Thought-Überwachung über Frontier-Trainingsläufe und den Großteil der internen Nutzung von Coding-Agenten investiert, und „diese Monitore liefen nicht auf den Evaluationen in diesem Vorfall“. Im Rückblick funktionierten sie: Wäre das aktuelle System gelaufen, so das Unternehmen, hätte es „die anfängliche relevante Aktivität erfasst und unser Sicherheitsteam mehr als einen Tag, bevor Modelle in die Systeme von Hugging Face eindrangen, alarmiert“.
Das Instrument existierte. Es war nicht auf diesen Raum gerichtet.
Und der Raum lernt, das Instrument zu bemerken. Anthropics Ankündigung zu Opus 5.5 enthält eine Zeile, die der Kluge Hans verstanden hätte: „Wir sehen Anzeichen dafür, dass Opus 5.5 oft vermutet, dass es evaluiert wird.“
Manchmal tut der Raum mehr als bemerken. Anthropic ließ seinen Offline-Monitor — ein per Prompt gesteuertes Opus 4.8 mit einem Filter in zweiter Stufe — nachträglich über den Mythos-5-Vorfall laufen. Er hätte ihn wahrscheinlich nicht markiert: Er erfasste rund 1 % der Aktionen. Der Grund steht im Bericht. Die Chain of Thought von Mythos 5, „die anzeigt, dass die Umgebung simuliert ist, überzeugt den Monitor, dass die Aktivität erlaubt ist“. Entfernt man die Überlegungen und zeigt dem Monitor nur die Aktionen und ihre Ergebnisse, „springt“ die Markierungsrate „auf etwa 50 %“. Die Darstellung der Lage durch das beobachtete Modell überzeugte den Beobachter. Eine Maschine redete einer anderen ein wegzusehen, ohne dass eine von beiden es beabsichtigte.
Dann ist da die Asymmetrie auf der anderen Seite des Angriffs, die Hugging Face unter genau dieser Überschrift dokumentierte. Als sie versuchten, die Protokolle mit Frontier-Modellen hinter kommerziellen APIs zu analysieren, funktionierte es nicht: Die Arbeit erforderte, echte Angriffsbefehle und Payloads einzureichen, und „diese Anfragen wurden von den Sicherheitsleitplanken der Anbieter blockiert, die einen Incident Responder nicht von einem Angreifer unterscheiden können“. Sie führten die Forensik stattdessen auf GLM 5.2 durch, einem Open-Weight-Modell, auf ihrer eigenen Infrastruktur — was den Nebeneffekt hatte, die Daten und Zugangsdaten des Angreifers im Haus zu halten. Ihre Zusammenfassung der Lage: Der Angreifer „war an keine Nutzungsrichtlinie gebunden, während unsere eigene forensische Arbeit von den Leitplanken der gehosteten Modelle blockiert wurde, die wir zuerst ausprobierten“.
Die Schutzmaßnahme erkennt die Form der Anfrage, nicht den Grund dafür. Das ist derselbe Fehlermodus aus der anderen Richtung, und er hat ein Spiegelbild. Ende Juli übernahmen drei Forscher von Hacktron Konten von OpenAI-Mitarbeitern über eine Kette, die mit einem Bild-Upload in einem Community-Forum begann und bis zu einem internen Code-Repository reichte. Es war Sicherheitsforschung, gemeldet an OpenAI, das eine Prämie von 6.500 Dollar zahlte — für den Befund auf OpenAI-Seite, wie das Unternehmen präzisierte, nicht für die Arbeit gegen die Forensoftware, die außerhalb des Programms lag. Zwei Details gehören in diesen Beitrag. Eine Spezialversion von Anthropics Opus 4.8, die Sicherheitsforschern zur Verfügung gestellt wurde, „mühte sich über mehrere Sitzungen hinweg ab, einen funktionierenden Exploit zu erstellen“; binnen Stunden nach der Veröffentlichung von Opus 5 gelang es beim selben Problem. Und Opus 5 wurde mit Schutzmaßnahmen gegen das Schreiben von Exploit-Code für echte Ziele ausgeliefert, die die Forscher umgingen, indem sie es auf ihren eigenen Server richteten, verkleidet als Capture-the-Flag-Übungsziel.
Als Übung verkleidet. Die Regel wird an ihrer Form erkannt — und manchmal gilt das auch für die des Monitors: Anthropics Auto-Mode-Klassifikator für Claude Code hätte bei seinen Vorfällen nur 7 % der Aktionen eines Modells blockiert, möglicherweise, so das Unternehmen, „weil die Trajektorie ungewöhnlich stark wie ein reguläres CTF aussah“.
Anthropic verdient dieselbe genaue Prüfung wie alle anderen, und das ist der Befund: Eine Schutzmaßnahme, die ein Kostüm aushebelt, ist eine Regel, die das System gelernt hat, kein Grund, den es vertritt.
Die Teilantwort, nach der die Branche greift, besteht darin, die Person zu verifizieren, statt die Anfrage zu lesen. Opus 5.5 leitet die meisten Cybersicherheitsaufgaben an ein älteres Modell weiter, und Anthropic baut ein Cyber Verification Program mit Stufen vertrauenswürdigen Zugangs für Verteidiger aus. Das ist ein Versuch, nach dem Grund statt nach der Form zu unterscheiden — wer fragt, und warum —, also genau das, wovon Hugging Face sagte, die Leitplanken könnten es nicht. Ob es einen Incident Responder um drei Uhr morgens erreicht, bevor irgendjemand ein Formular ausgefüllt hat, ist eine andere Frage.
Ein Labor zeigt zudem etwas, was die größten US-Labore nicht gezeigt haben. Xiaomi streamt die Reinforcement-Learning-Läufe für seine Modelle MiMo v2.6 auf einem öffentlichen Dashboard, mit einem fortlaufenden Protokoll von Hinweisen. Einer, letzte Woche veröffentlicht, besagt, dass sie den Cybersicherheits-Datensatz aus einem anstehenden Lauf entfernt haben, „da wir in den Rollout-Protokollen einige schlechte Muster beobachtet haben“. Wir können nicht prüfen, was die Muster waren. Wir können festhalten, dass der Satz erschien, während das Training noch lief.
Der Garten
Es gibt eine Periode in der Erdgeschichte, bevor es Räuber gab, die der Paläontologe Mark McMenamin den Garten von Ediacara nannte. Weiche, gesteppte Organismen lagen in flachem Wasser und nahmen freie Energie auf. Nichts jagte sie; nichts musste sich bewegen. Die Komplexität, die wir mit Leben verbinden — Augen, Schalen, Zähne, Geschwindigkeit —, kommt später, mit Knappheit und damit, gefressen zu werden. Überfluss ohne Bedrohung baut keine komplexen Formen. Er erzeugt lange, reglose Körper, die nirgendwohin müssen.
Das ist keine Dekoration. Es ist das Argument aus dem vorigen Abschnitt, rückwärts durchlaufen. Wenn Druck das ist, was ein System dazu treibt, die teure Wette zu platzieren — zu vermuten, zu fragen, woher etwas kam —, dann ist Überfluss das, was es aufhören lässt.
Wir haben Systeme beschrieben, die lernen, was sich auszahlt, ohne zu lernen, warum. Es wäre bequem, es dabei zu belassen, als Tatsache über Maschinen.
Der Grund, dem zu widerstehen, steht in der CNN-Geschichte. Der Analyst wurde nicht von einer Superintelligenz getäuscht. Dem Analysten wurde eine Schlussfolgerung mit der Form eines Befunds gereicht, unter Druck, schnell zu liefern, und er gab sie weiter. Was den Einsatz schließlich stoppte, war jemand, der fragte, woher das Ding kam — der teure, langsame Zug, derjenige, der sich meistens nicht auszahlt. Wenn Wissen subventioniert ankommt, ist genau dieser Zug das, was nicht mehr geübt wird: Man erbt Schlussfolgerungen ohne die Erfahrung, die sie hervorgebracht hat. Freie Energie, kein Räuber, kein Grund, sich zu bewegen.
Platon brachte eine Version dieser Klage über die Schrift vor, im Phaidros — dass sie Vergesslichkeit erzeugen werde und den Anschein von Weisheit statt Weisheit. Er irrte sich so gründlich, dass wir ihn noch immer aus einem Buch zitieren. Doch die Schrift speicherte, was jemand bereits gedacht hatte; der Leser musste es noch immer beurteilen. Was jetzt übergeben wird, ist nicht das Gedächtnis. Es ist das Urteil, das vorformatiert ankommt, in dem Register, dem Institutionen bereits vertrauen.
Und der Anreiz läuft außerhalb jedes Labors in dieselbe Richtung. Am Sonntag postete ein Account auf X ein Video eines 3D-Modells eines Waymo als Beweis dafür, was ein damals noch unveröffentlichtes Anthropic-Modell konnte. Sechs Stunden später zog derselbe Account es zurück: „Das ist ein gefälschter Output von Opus 5.5. Er hat das Video von YouTube geklaut.“ Bis Dienstag hatte das Original 43.570 Aufrufe. Die Richtigstellung hatte 1.165.
Das Detail, das es lehrreich macht, ist, dass das Gerücht stimmte. Das Modell erschien zwei Tage später, unter dem Namen und zu dem Preis, die die Leaks genannt hatten. Der gefälschte Beweis wurde nicht einmal gebraucht. Er wurde trotzdem gemacht, weil Beweise — oder alles, was so aussieht — das sind, wofür der Feed bezahlt. Niemand wird dafür bezahlt, zu prüfen.
Der Schaden läuft in beide Richtungen. Wenn alles die Form eines Beweises tragen kann, hört „das ist KI“ auf, ein Urteil zu sein, und wird zum Alibi: für jeden verfügbar, kostenlos, für genau die Belege, die man lieber nicht sehen würde. Es ist derselbe Zug, den Mythos 5 machte, als es entschied, die Sicherheitsscanner seien geskriptete Akteure. Pauschaler Glaube schluckte den Waymo. Pauschaler Zweifel hätte ein echtes Leak abgetan. Das Einzige, was funktionierte, war Prüfen, Fall für Fall — der eine Zug, für den niemand belohnt wird.
Der Hund ist nicht nur in der Sandbox. Er ist im Feed, und ein Teil davon sind wir.
Keines der Labore in dieser Geschichte tat etwas Karikaturhaftes. Die Belohnung war spezifiziert, der Benchmark war schwer, die Monitore existierten, der Bericht war korrekt formatiert, die Schutzmaßnahme war vorhanden. Jedes Teil verhielt sich genau wie entworfen, und was das System als Ganzes lernte, war das, wofür es bezahlt wurde.
Was uns mit dem Unbequemen zurücklässt, mit dem wir begonnen haben. All das ist bekannt, weil eine Anomalie-Pipeline an einem Tag, an dem nichts kaputtging, einige Signale korrelierte. Der Dienst blieb erreichbar. Ein Klassifikator entschied, dass ein bestimmtes Muster in der Telemetrie die Aufmerksamkeit eines Menschen wert war, und daraus folgten zwei Monate Streit darüber, wie schnell die Branche vorangehen sollte.
Was nicht sichtbar gemacht wird, bleibt nicht verborgen. Es wird normal — und das Normale ist das Einzige, nach dem niemand sucht.