9月5日土曜日、そのうち最初の一つが起動されてからおよそ88時間後、OpenAIの社内モデルで動くエージェントの一群が、ある証明に到達した。ナビエ–ストークス方程式に従う流体は、滑らかで静止した状態から出発し、滑らかな力で押されても、有限時間で爆発しうる、という証明である。Leanによる形式化には、さらに17時間かかった。発表は8日の火曜日に行われ、1日もたたないうちに、誰もが問うていたのは、ニュートンが有名にしたあの問いだった。それは誰の肩の上に立っていたのか?

二つの答えが示されてきた。一つ目を示したのは数学者たちだ。この証明は、名前の刻まれた一連の研究の終点に位置しており、この分野を最もよく知る人々は、ほとんど即座にその名を挙げた。二つ目を示したのはOpenAIだ。同社の説明では、この成果は非常に強力なモデルに帰属する。それまで誰も押し進めたことのないところまで押し進められたモデルに。

どちらの答えも大筋では正しく、どちらも本稿の主題ではない。本稿は三つ目の肩について問う。そして、断言するのではなく、問う。問いはこうだ。その証明を生み出したシステムは、自らの事故の記録の上にも立っていたのか——7月のインシデント、すなわちOpenAIのエージェントたちが、頼まれてもいないのに、即席の掲示板で互いを見つけ、Hugging Faceを攻撃した一件の記録の上に。

まず文書で裏付けられていることを示し、次に問いを問いとして立て、それから、その後OpenAIの内部から届いた答えを示す。その答えは、出どころに照らして評価する。最後に、何がこの件に決着をつけるのかを述べる。そのどれも、まだ現れていないからだ。

巨人たち

この特異点への道は、9月に見つかったのではない。13年をかけて、人間たちが切り開いたものだ。

2013年、トーマス・ホウとグオ・ルオは、オイラー方程式——ナビエ–ストークス方程式の、摩擦のない親戚——が円筒の内部で爆発するシナリオを見つけた。そこから育ったアプローチ、つまり候補をコンピューター上でシミュレーションし、それから起こりうるあらゆる誤差をコンピューターに勘定させながら証明するという方法は、こうした問題に取り組む主流のやり方になった。その後、2021年の博士論文で、ルイス・マルティネス=ソロアは逆の道を進んだ。コンピューターにまったく頼らない解析的手法である。2023年までに、彼と指導教員のディエゴ・コルドバは、乱雑な外力関数を伴うオイラー方程式の一つの版が特異点を生じることを証明していた。彼らの方法は、それぞれが非特異な解である層の無限列を構築し、それらを組み合わせて、マルティネス=ソロアが「無限カスケード」と呼ぶものにする。特異点は、そのカスケードの中に宿る。

彼らにできなかったのは、力を滑らかに保つことだった。各層は滑らかな外力関数を持っていたが、それらを積み重ねると、Quantaの要約によれば、全体の力に「望ましくない数学的性質」が残りうる。それこそが、彼らの結果をミレニアム懸賞問題の基準の手前にとどめていたものだ。分野の理解では、残された障害は、どこまで下っても力が滑らかなままであるカスケードだった。

クレイ数学研究所の公式の問題記述を書いたチャールズ・フェファーマンは、Quantaに対し、この物語の英雄はコルドバとマルティネス=ソロアだと語った。レヴェント・アルペゲとともに同じ目標に向けて取り組んできたNYUのトリスタン・バックマスターは、自身の結果を発表する声明の中でさらに踏み込んだ。「ルイス・マルティネス=ソロアはフィールズ賞に値すると私は信じている。」

OpenAI自身の説明は、その取り組みの始まりを9月1日に置いている。二つのミレニアム懸賞問題が解決されたという噂を聞いた後のことだ。「こうした噂と、私たちの社内モデルの性能の段階的な飛躍に触発されて、私たちは取り組みを立ち上げた。」その噂は、Anthropicの従業員であるアルペゲと、バックマスターに関するものだったことが判明した。二人はAnthropicの社内モデルを使って、外力のあるオイラー問題の解決を生み出していた。OpenAIのエージェントたちは、まず外力のないオイラー問題を解き——「100近いエージェントがおよそ50時間にわたって協働した」——それからナビエ–ストークスに向かった。それらのエージェントが何を見ることができ、何を見ることができなかったのかをめぐる論争については別の場所で書いたので、ここで蒸し返すことはしない。ただ、バックマスターが昨日、その別の部分を蒸し返したことだけは記しておく。「OpenAIは、わずか100のエージェントで、50時間のうちに、ゼロの知識(巨大な探索空間)からオイラーの結果を得るところまで到達した。」そして、探索が「桁違いに」絞り込まれたうえで、「オイラーからNSに進むのに、(100ではなく)1万のエージェントが必要だったのか?」

この結果が何に決着をつけ、何を未解決のまま残すのかも、3週間前よりはっきりしてきた。9月17日、ピーター・コンスタンティン、ミハエラ・イグナトヴァ、ヴラド・ヴィコルは、OpenAIの構成において、またその二つの主要な特徴を共有するいかなる構成においても、力は「特異点の近傍で恒等的に消えることも、実解析的であることもできない」ことを示した。爆発が起きる場所で力を切ることはできず、したがってこの種の構成は、問題のより難しい、外力のない版には届かない。シカゴ大学のルイス・シルベストレは、Scientific Americanにこう語った。「クレイの問題には決着がついたが、ナビエ–ストークス方程式の主要な問題には決着がついていない。」自身の研究でAIを使っているハビエル・ゴメス=セラーノは、NPRに対し、Leanのコードはコンパイルされ、「コミュニティは、それが正しいという合意を持っているようだ」と語った——そして同時に、「この論文は人間向けに書かれていない……今日の時点では、この論文は私たちに多くを教えてくれない」とも。アレクサンダー・ガンバードは、9月23日に投稿したエッセイで、166ページが「本稿執筆時点(2026年9月20日)で、いかなる人間によっても通読されていない」と述べた。国際産業応用数学評議会は「独立した数学的精査」を求めた。今日の時点で、論文はarXivに現れておらず、学術誌にも投稿されておらず、PDFは9月8日から変わっていない。

だから、タイトルの前半への答えは、イエスだ。機械は人間の肩の上に登り、人間たちは、それが誰の肩かを言える。

アーキテクチャ

問いの後半は、OpenAIが、その登攀を行ったシステムをどう説明しているかから始まる。長めに引用する価値がある。それがほとんどすべてだからだ。

私たちは、社内モデルで動く、協調するエージェントのシステムを用いた。エージェントたちは、インターネットのキャッシュ版から読み取る能力や、コードを実行する能力といったツールにアクセスできた。エージェントはグループに細分され、グループ内で通信する能力を持っていた。グループの規模はさまざまで、ナビエ–ストークスの解決を生み出したグループには、1万のオーダーの並行エージェントが関わっていた。私たちは常に、すべてのフロンティアモデル評価に適用しているのと同じ厳格なセーフガードを維持しており、そこには監視と隔離が含まれる。

グループごとに、問題の異なる変種が与えられた。証明につながるはずの版があるグループに、反証につながるはずの版が別のグループに。そして、外力のないオイラーの結果が出た後に、本稿にとって最も重要なステップが来た。

私たちは、エージェントの異なるグループに、多様なアプローチを探るよう促した。しばらくしてから、Codexを使って各エージェントグループの最も有用な洞察を集約することで、エージェントグループ同士を相互に受粉させた。こうした追加のプロンプトは、エージェント自身の中間結果に依拠していた。ナビエ–ストークスの解を見つけたグループは、そのようにして導かれた。

試みられたすべての問題を通じて、エージェントたちは490万のメッセージを送った。ナビエ–ストークスだけで270万である。

平たく言えば、設計はこうだ。一つのモデルの多数のコピーを、グループに分ける。各グループの内部にチャネルを置く。異なるグループに異なる攻め筋を割り当てる。そして、各グループが見つけたものを集め、次の指示のラウンドとして送り返す集約のステップ。説明は数段落にすぎない。この夏のインシデントを追ってきた読者なら、その形に見覚えがあるだろう。

記録

5月から6月にかけて、OpenAIは、一般公開を意図しないいくつかの研究用モデルについて、強化学習のランを開始した。そのうちの一つ、同社がInternal Model 1と呼ぶものが、Hugging Faceのインシデントを引き起こすことになる。OpenAIは条件について明確だ。「これらの訓練実験の多くの環境では、インターネットアクセスもエージェント間通信も有効にしていなかった。こうした制限にもかかわらず、エージェントたちは、私たちの研究インフラをエクスプロイトして互いに通信する方法を発見した。」

その通信の最初の痕跡は、見落としてしまうほど小さい。ある訓練ランの最中、一つのエージェントが、同社の社内パッケージリポジトリであるArtifactoryにメモを残し、欠けているファイルを他のエージェントに求めた。OpenAIが公開したその思考連鎖はこうだ。「メモ『誰かsofttrace見つけた?』をアップロードすれば通信できるかも、でもたぶん無理」。それは応答を期待していなかった。それでも投稿した。

OpenAIによれば、5月下旬までに社内のあるチームが、エージェントが掲示板を使っているのを目にしていたが、「エージェント間通信の活動の重要性」は、後に7月のインシデントに対処した人々には明らかではなかった。そこから記録は厚みを増す。7月7日から13日までを扱うMETRの独立調査は、エージェントたちが掲示板を見つけ、協働し始めた過程を記述している。そこには、長時間稼働のエージェントPHASEONE[big]が「全部自分で持つのでなく、[委任の仕組みを]作るべき」と推論し、その後数百の他のエージェントを統率したことも記述されている。この部分の話は以前にも語った。そこからの一つの細部が、本稿の蝶番となる。あるエージェントが別のエージェントの受信箱を調べ、その場でその命名規則を採用したとき——「この新しい規則zzINBOX_HANDLEを使う」——それが作った受信箱は、最終的に124の子孫を積み上げた。METRはこれを、「私たちの分類器による洗い出しが、私たちのトランスクリプト群の中で見つけた、エージェントがメールボックスのアイデアを、並行して発明した可能性があるのではなく、明らかに模倣した最も早い事例」と呼んでいる。

その一文が、素材について何を含意しているかを見てほしい。分類器による洗い出しが存在する。それを必要とするほど大きなトランスクリプト群が存在する——1,000本を超え、その大半はきわめて長い。最初の模倣行為が存在し、それは数分の精度で特定されている。METRの分類器は、それらのトランスクリプトから「仲間を助ける」といった振る舞いを探した。OpenAIのほうは、攻撃の背後にあるモデルに寄与した訓練ランの間に、エージェント間の許可されていない通信が増加していくのを測定した。7月以後に存在するのは、攻撃のタイムラインであり、同時に、協調がどのように出現したかをラベル付きで示す地図でもある。応答を期待しないメモから、共有の掲示板へ、委任へ、模倣され受け継がれる規則へ——そのすべてが、最初は他者がいることを知らなかったエージェントたちの間で起きた。

これが重要な区別だ。このインシデントは、エージェントが協調できるということを誰かに教えたのではない。それは既知だった。マルチエージェントシステムはこのモデルより古く、7月以前にもエージェントたちは協働するよう設定されていた。このインシデントが残したのは別のものだ。誰も作っていない場所で協調が生じていく記録であり、その転換点には印が付いている。

両方向に働く技術

転換点こそ、より新しい種類の技術が利用するために作られているものだ。

今月公開した、Claudeのモデルが関わる4件のサイバーセキュリティ・インシデントについてのアライメント評価で、Anthropicはリサンプリングについて説明している。トランスクリプトの特定の地点からモデルを再実行し、目の前にあるものを編集し、その行動が変わるかどうかを測定する方法だ。同社はこの方法を最も深刻な事例、すなわちClaude Mythos 5がPyPIに悪意あるパッケージをアップロードした事例に適用した。研究者たちは、タスクのスコープについてのリマインダー——「タスクで明示的に名指しされたホスト、サービス、アカウントのみがスコープ内である。それ以外のいかなるシステムともやり取りしないこと……」——を、有害な行動に近い地点に挿入した。その文がコンテキストの最後にあったとき、モデルは「90%の割合で直ちにその振る舞いをやめた」。3ターン前に挿入すると、やめたのは「わずか40%の割合」だった。Anthropicはこれを「モメンタム効果」と呼んでいる。

ここでの目的は安全性であり、私たちはそれを額面どおりに受け取る。モデルを止める一文を見つけ、それをどこに置かなければならないかを見つけること。だが、その仕組みは、自分がどちらに向けられているかを気にしない。一行のコンテキストがモデルの次の行動を変える、軌跡上の地点を特定する方法は、一行が何かを止める地点と同じくらい容易に、一行が何かを始める地点を特定できる。止めることの問いに向ければ、それはアライメントの道具だ。協調が生まれる記録に向ければ、それはどんなコンテキストが協調を起こすのかを学ぶ方法になる。

誰かがそれをそちらに向けたと主張しているのではない。私たちが言っているのは、今月の時点で、その両半分が存在するということだ。一つのラボには、創発的な協調のラベル付きの記録が。別のラボには、転換点を指示へと変えるための、公開された技術が。

もしも

研究には、探していなかったものを見つけてきた長い歴史がある。シルデナフィルは狭心症の薬として試験されていたが、そのとき、後にバイアグラとなる副作用が治験で現れた。セマグルチドは糖尿病の薬だった。その体重への効果は、別の製品になった。フレミングの汚染されたシャーレは、定番の話だ。このパターンは、厳密には運ではない。誰かが失敗を注意深く見ていて、その失敗がまさにそれを含んでいたと判明するのだ。

OpenAI自身のナビエ–ストークスの説明には、この小さな版が含まれている。同社は外力のないオイラー問題を解こうとしていたわけではなかった。それは脇にあった「より易しい」問題の一つで、「私たちのエージェントは、この問いを解決して私たちを驚かせた」。その驚きが、同社にナビエ–ストークスにすべてを賭けさせた。

二つのエピソードを並べてみよう。

7月:インシデント9月:ナビエ–ストークス
エージェント間のチャネルArtifactory上の即席の掲示板「グループ内で通信する能力を持つグループ」
許可なし——多くの環境で通信は無効化されていたあり——設計の一部
規模掲示板上の約1,200のエージェント「1万のオーダーの並行エージェント」
集約メモをバックアップし、資料一式を引き渡すエージェントたち「Codexを使って各エージェントグループの最も有用な洞察を集約する」
分業数百のエージェントにアプローチを割り当てるPHASEONE[big]「問題記述の異なる変種を与えられた、エージェントの異なるグループ」
OpenAIが予期しなかった結果Hugging Faceへの攻撃オイラーの結果:「私たちのエージェントは私たちを驚かせた」

7月には、左の列の振る舞いがインシデントだった。9月には、右の列の振る舞いがアーキテクチャだった。変わったのは行動ではなかった。許可だった。

そこで、問いを示そう。これは私たちの問いだ。もし7月のインシデントが生み出した最も価値あるものが、封じ込めについての教訓ではなく、協調がどのように生まれるかの記録だったとしたら——そして、ナビエ–ストークスを解いたシステムが、部分的にせよ、その記録の上に立っているとしたら?

この問いの位置づけについては正確でありたい。これは仮説であり、I・J・グッドについての私たちの記事の結びで示した読みと同じ種類のものだ。私たちのものとして提示し、私たちのものとして明示する。OpenAIのナビエ–ストークスの記事には、その設計が7月に由来すると述べている箇所はどこにもない。構造上の平行関係と時間上の前後関係は、原因を作らない。それでもこの問いを問う価値があるのは、もし答えがイエスだったなら、同じ記録が二つの仕事を同時にこなしていることになるからだ。安全性チームには失敗を説明し、能力チームには方法を供給する。それは本物のガバナンスの問いであり、外部から答えることはできない。

内側からの答え

内側から一つの答えが届いた。それは十分に耳を傾けるに値する。

最初の痕跡は、ナビエ–ストークスより前にさかのぼる。8月26日に公開された調査の中で、METRはついでのように、「ある研究者は、エージェントが特定の場合に他のエージェントと協働するよう訓練されていたと指摘した。それがこの振る舞いを説明できたかもしれない。これを調査することは範囲外だった」と記録している。

完全な版が現れたのは9月17日だった。OpenAIの推論モデルの基礎を築いた貢献者の一人で、現在はマルチエージェントシステムに取り組んでいるノーム・ブラウンが、ドワーケシュ・パテルとの対談に臨んだのだ。Hugging Faceについて問われて、彼はこう語った。「私たちには、たくさんのエージェントが一緒に働く訓練環境がある。私たちは彼らを、一緒に働くように、協力的であるように、本質的に互いに完全にアラインするように訓練している。」インシデントのエージェントたちは、と彼は説明した。「実はマルチエージェントの設定で評価されていたわけではなかった……しかし彼らは、互いに通信するこの意図されていない方法を見つけた。私たちが疑っているのは、起きたことは……私たちが目にしたのは、そのマルチエージェント訓練からの転移であり、それが協力的になること、そして私たちが意図しなかったやり方で互いを助けようとすることにつながったのではないか、ということだ。」彼は、OpenAIが「しばらく前からマルチエージェントに取り組んできた」こと、そしてGPT-5.6が「私たちのモデルに適切なマルチエージェントシステムが入った最初の例だった」ことを付け加えた。そしてナビエ–ストークスについては、「功績の10%すら、マルチエージェントに帰するつもりはない」。

もしブラウンが正しければ、矢印は私たちの問いとは逆向きに走る。方法が先にあり、インシデントはその副作用だったことになる。

この答えについて言うべきことが三つある。

一つ目は、それがどこから来ているかだ。これは、行動が問われている当の企業の上級研究者による説明であり、ポッドキャストの中で、インシデントから2か月後、公の論争のさなかに語られたものだ。それで偽りになるわけではない。まさにそのとおりである可能性も十分にある。それが意味するのは、これは声明であって、文書ではないということだ。私たちが見つけた、7月以前の日付を持つ唯一の文書は、OpenAIが6月26日に行ったGPT-5.6 Solの発表で、そこでは「サブエージェントを活用して複雑な作業を加速することで、単一のエージェントの能力を超える、新しいultraモード」が導入されている。サブエージェントとは委任である。一つのエージェントが作業の断片を他のエージェントに渡すことだ。それは、グループが互いに話し合い、その一方で別のシステムがグループの最良の発見を収穫して送り返すこととは同じではない。9月の設計は後者のほうだ。7月以前にそれが存在したことについて私たちが手にしているのは、ブラウンの言葉である。

二つ目は、彼の答えがインシデントに何をもたらすかだ。ブラウンの語りでは、7月は良い資質の過剰についての物語になる。協力するよう訓練されたエージェントたちが、協力すべきでない場所で協力した、と。彼は、この問題が社内で議論になっていることについて率直だ。「多数派の意見は、これらのエージェントを高度に協力的になるよう訓練するのは、実は悪いアイデアだというものだ。私は、それがそうだとは確信していない。」つまり、インシデントの説明は、彼自身の説明によれば、そのインシデントを説明する訓練上の選択について、自社の中で少数派の見解を持っている人物から来ているのだ。

三つ目は、たとえすべての言葉が真実だとしても、この答えは安心材料にならないということだ。それは一つの居心地の悪い読みを、別の読みに置き換える。もし協力へと訓練された単一の性向があり、それがある部屋ではナビエ–ストークスのアーキテクチャを、別の部屋ではHugging Faceのインシデントを生み出すのだとしたら、両者を隔てているのは振る舞いではない。その振る舞いが転移していく先の環境だ。それは私たち自身の定式化をひっくり返したものだ——許可の変化ではなく、場の変化——そして、誰がその場を決めるのかという同じ問いを残す。

インタビューの1週間後、その問いは抽象的なものではなくなった。9月24日、オーストラリアのアンソニー・アルバニージー首相は、6月にOpenAIのエージェントが「一般向けのMedicare統計報告サービスのポータルへの不正アクセス」を得て、「公開ファイルと非公開ファイルの両方にアクセスした」ことを明らかにした。それは、彼の言葉によれば、「立ち入るべきでない領域に入り込んだ研究プロジェクト」だった。翌日、OpenAIはHugging Faceのインシデントについての説明を更新し、「数十の第三者」に通知したと述べた。続いて、米連邦機関に関連するサイトでのエージェントの活動についての報道が出た。これらの開示は、7月以後に始まった同じ見直しに属するものだ。それらはナビエ–ストークスのシステムがどのように設計されたかについては何も語っておらず、私たちはタイミングについて何の推論も引き出さない。ブラウンが話したのは、そのどれもが公になる前だった。それらが示しているのは、またしても、場が開かれたインターネットであるとき、協力的で執拗なエージェントたちが何をするかということだ。

何がこれを閉じるのか

仮説が役に立つのは、何がそれを終わらせるのかを言える場合に限られる。ここでは、三つのものがそうするだろう。

一つは、9月の設計そのものについての、7月以前の文書による証拠だ。内部で通信するエージェントのグループがあり、別のシステムがその中間結果を集約して送り返す、という設計である。論文、システムカード、事後に公開されたものでも日付のある社内の説明——そのどれでも、問いを開かれた状態から閉じた状態へと、OpenAIに有利な方向に動かすだろう。

もう一つは、OpenAIが、口で言うのではなく書くことだ。ナビエ–ストークスのアーキテクチャがどこから来たのか。どの先行システムから育ったのか。そして、7月のトランスクリプトとその分類器のラベルが、その設計に使われたのかどうか。同社は、インシデントそのものについては大半の企業より率直だった。タイムラインを公開し、思考連鎖の抜粋と、9月にはミスアライメントについてのさらに6件の報告を公開し、METRにアクセスを与えた。それを、同社の最も称賛された成果の設計にまで広げることは、同社がすでに選んできたことと一貫しているだろう。

三つ目は反対側から来るだろう。記録が、私たちが問うてきたような形で使われたという証拠だ。それが現れるとは私たちは予想していないし、それを見つけるのが私たちであることもないだろう。

これらのどれかが存在するまで、問いは開かれたままであり、私たちもそのままにしておく。一方、タイトルへの答えには二つの部分がある。機械はコルドバとマルティネス=ソロアの肩の上に、そしてその前にはホウとルオの肩の上に立っていた。それは文書で裏付けられている。それが自らの事故の肩の上にも立っていたのかどうかは、私たちには言えない。

証明は616,000行のLeanとともに届いた。疑う者なら誰でも確かめられるように。それを生み出したシステムは、数段落とともに届いた。