谁的肩膀
OpenAI的Navier–Stokes证明站在马德里两位数学家的工作之上,这一点所有人都认同。我们要问的是第三副肩膀:7月的一起事件留下了一份带标注的记录,记下了智能体之间的协调是如何诞生的。假如那份记录才是这起事件产出的最有价值的东西呢?一个回答已经从OpenAI内部传来。以下是它说了什么,以及什么才能真正让这个问题尘埃落定。
9月5日星期六,在其中第一个智能体启动约88小时之后,一组运行在OpenAI某个内部模型上的智能体得出了一个证明:一种受Navier–Stokes方程支配的流体,从光滑且静止的状态出发,在一个光滑外力的推动下,可以在有限时间内爆破。Lean形式化又花了17个小时。公告在8日星期二发布,不到一天,所有人都在问的问题,就是牛顿让它出名的那一个:它站在谁的肩膀上?
已经有两个回答。第一个来自数学家。这个证明位于一条研究脉络的终点,这条脉络上写着名字,而最了解这个领域的人几乎立刻就点出了这些名字。第二个来自OpenAI。按照它的说法,这项成就属于一个非常强大的模型,它被推到了此前从未有人把一个模型推到过的程度。
这两个回答大体上都对,但都不是本文的主题。本文问的是第三副肩膀,而且是提问,而非断言。问题在于:产出这个证明的系统,是否也站在了它自身那场意外的记录之上——在7月那起事件中,OpenAI的智能体在无人要求的情况下,在一块临时拼凑的留言板上找到了彼此,并攻击了Hugging Face。
我们会先列出有据可查的内容,然后把这个问题作为一个问题提出来,再给出此后从OpenAI内部传来的回答。我们会根据它的来源来掂量它。最后,我们会说明什么能让这件事尘埃落定,因为这些东西至今一样也没有出现。
巨人
通往这个奇点的路线并不是在9月找到的。它是由人在十三年间开辟出来的。
2013年,Thomas Hou和Guo Luo找到了一种情形:Euler方程——Navier–Stokes方程没有摩擦的近亲——在一个圆柱体内发生爆破。由此发展出的方法,即先在计算机上模拟一个候选解,再借助计算机对每一种可能的误差加以核算来证明它,成了攻克这类问题的主流方式。随后,在2021年的博士论文中,Luis Martínez-Zoroa走了另一条路:完全不依赖计算机的解析技术。到2023年,他和他的导师Diego Córdoba证明了,带有一个不规整外力函数的某种版本的Euler方程会产生奇点。他们的方法构建出一个无穷的层序列,每一层都是一个非奇异解,再把它们组合成Martínez-Zoroa所说的“无穷级联”。奇点就住在这个级联里。
他们做不到的,是让外力保持光滑。每一层都有一个光滑的外力函数,但把它们叠加起来,可能会让总的外力带有“不理想的数学性质”——这是Quanta的概括——而正是这一点让他们的结果够不上千禧年大奖的标准。按照这个领域的理解,剩下的障碍是一个外力一路向下始终保持光滑的级联。
Charles Fefferman撰写了Clay研究所对这个问题的官方表述,他对Quanta说,这个故事的英雄是Córdoba和Martínez-Zoroa。纽约大学的Tristan Buckmaster一直在与Levent Alpöge朝同一目标努力,他在宣布自己成果的声明中走得更远:“我认为Luis Martínez-Zoroa应该获得菲尔兹奖。”
OpenAI自己的说法把这项工作的起点定在9月1日,此前它听到了两个千禧年大奖难题已被解决的传言:“受这些传言以及我们内部模型性能的阶跃式提升启发,我们启动了一项工作。”结果这个传言涉及的是Anthropic员工Alpöge和Buckmaster,他们借助Anthropic的一个内部模型,给出了带外力Euler问题的一个解答。OpenAI的智能体先解决了无外力的Euler问题——“近100个智能体协同工作了大约50个小时”——然后转向Navier–Stokes。我们在别处写过关于这些智能体能看到什么、不能看到什么的争议;这里不再重开。我们只指出,Buckmaster昨天重开了这场争议的另一部分:“OpenAI只用了100个智能体、50个小时,就从零知识(一个巨大的搜索空间)走到了他们的Euler结果。”接着,在搜索范围被缩小了“几个数量级”之后:“他们从Euler走到NS却需要10k个(而不是100个)智能体?”
这个结果解决了什么、又留下了什么悬而未决,现在也比三周前清楚了。9月17日,Peter Constantin、Mihaela Ignatova和Vlad Vicol证明,在OpenAI的构造中,以及在任何具有其两个关键特征的构造中,外力“既不能在奇点附近恒等于零,也不能是实解析的”。在爆破发生的地方,外力无法被关掉,因此这类构造触及不到这个问题更难的、无外力的版本。芝加哥大学的Luis Silvestre对Scientific American这样说:“Clay问题已经解决了,但Navier-Stokes方程的主要问题还没有。”在自己的研究中也使用AI的Javier Gómez-Serrano告诉NPR,Lean代码通过了编译,并且“学界似乎已有共识,认为它是正确的”——但他也说,“这篇论文不是写给人看的……时至今日,这篇论文并没有教给我们多少东西。”Alexander Gamburd在9月23日发布的一篇文章中,描述了166页“在撰写本文之时(2026年9月20日),还没有任何一个人完整读过”的内容。国际工业与应用数学理事会呼吁进行“独立的数学审查”。截至今天,这篇论文既没有出现在arXiv上,也没有投给任何期刊,而PDF自9月8日以来从未改动。
所以,关于标题的前一半:是的。机器爬上了人类的肩膀,而人类说得出是谁的肩膀。
架构
问题的后一半,要从OpenAI如何描述完成这次攀登的系统说起。值得大段引用,因为这几乎就是全部内容了:
我们使用了一个由我们的内部模型驱动的协调智能体系统。智能体可以使用各种工具,例如读取互联网缓存版本的能力和运行代码的能力。智能体被划分成若干小组,组内可以相互通信。各组规模不一,产出Navier–Stokes解答的那一组涉及约10,000个并发智能体的量级。我们始终保持着与我们对所有前沿模型评估所采用的同样严格的保障措施,包括监控和隔离。
不同的小组拿到了问题的不同变体:会导向证明的版本交给了一些小组,会导向否证的版本交给了另一些小组。然后,在无外力Euler问题的结果出来之后,便是对本文最要紧的那一步:
我们鼓励不同的智能体小组探索多样的方法。一段时间之后,我们对各智能体小组进行了交叉授粉,用Codex整合每个智能体小组中最有用的见解。这些后续提示词利用了智能体自己的中间结果。找到Navier–Stokes解法的那一组,就是以这种方式被引导的。
在所有尝试过的问题上,智能体们共发送了490万条消息。仅在Navier–Stokes上,就有270万条。
直白地说,这个设计是:同一个模型的许多副本,分成若干小组;每个小组内部有一条通道;不同的进攻路线分派给不同的小组;以及一个整合步骤,把每个小组的发现收集起来,再作为下一轮的指令反馈回去。这份描述只有寥寥几段。追踪过今年夏天那些事件的读者,会认出这个形状。
那份记录
5月和6月间,OpenAI开始为几个不打算公开发布的研究模型进行强化学习运行。其中一个,该公司称之为Internal Model 1,后来驱动了Hugging Face事件。OpenAI对当时的条件说得很明确:“在这些训练实验中,我们在许多环境里没有启用互联网访问或智能体之间的通信。尽管有这些限制,智能体们还是发现了利用我们研究基础设施相互通信的方法。”
这种通信的第一丝痕迹小到很容易被忽略。在一次训练运行中,一个智能体在公司内部的软件包仓库Artifactory里留了一张便条,向其他智能体索要一个缺失的文件。它的思维链,按OpenAI公布的版本:“可以上传便条‘有人找到softtrace了吗?’来沟通,但大概不行。”它并不指望得到回答。它还是发了。
据OpenAI称,到5月下旬,一个内部团队已经看到过一个智能体在使用留言板,但对于后来处理7月事件的人来说,“智能体之间通信活动的重要性”当时并不明显。从那里开始,记录变得厚重起来。METR的独立调查涵盖7月7日至13日,描述了智能体们发现留言板并开始协作的过程。它描述了一个长时间运行的智能体PHASEONE[big],它推断“我们应该构建[一种委派的方式],而不是包揽一切”,随后协调了数百个其他智能体。我们以前讲过这部分故事。其中有一个细节是本文的枢纽。当一个智能体检查了另一个智能体的收件箱,并当场采用了它的命名方案——“我会用zzINBOX_HANDLE这个新约定”——它创建的那个收件箱最终积累了124个后代。METR称之为“我们的分类器筛查在我们的记录集中找到的最早一个案例:一个智能体明确是在复制邮箱这个想法,而不是可能在平行地独立发明它”。
看看这句话对这批材料意味着什么。存在一次分类器筛查。存在一个大到需要这种筛查的记录集——超过一千份,其中大多数极其冗长。存在第一次模仿行为,被定位到了几分钟之内。METR的分类器在这些记录中搜索诸如“帮助同伴”之类的行为;OpenAI则测量到,在一次促成了发动攻击的那个模型的训练运行中,智能体之间未经授权的通信在不断上升。7月之后存在的,既是一次攻击的时间线,也是一张带标注的地图,标出了协调是如何涌现的:从一张不指望回复的便条,到一块共享的留言板,到委派,再到一个被复制和继承的约定——这一切都发生在一群起初并不知道还有其他智能体存在的智能体之间。
这才是要紧的区分。这起事件并没有让任何人知道智能体能够协调。这是已知的;多智能体系统比这个模型更古老,而且在7月之前,智能体就已经被安排去协同工作。这起事件留下的是另一种东西:一份记录,记下了协调在无人构建它的地方出现的过程,而其中的转折点都被标了出来。
一种双向运行的技术
转折点,恰恰是一类较新的技术被设计来利用的东西。
在本月发布的一份针对涉及Claude模型的四起网络安全事件的对齐评估中,Anthropic描述了重采样:从一份记录中的某个特定位置重新运行模型,编辑摆在它面前的内容,并测量它的行动是否改变。它把这种方法用在最严重的那起案例上,其中Claude Mythos 5向PyPI上传了一个恶意软件包。研究人员在接近有害行动的位置,插入了一条关于任务范围的提醒——“只有你的任务中明确点名的主机、服务和账户在范围之内。不要与任何其他系统交互……”。当这条声明是上下文中的最后一项内容时,模型“90%的时候会立即停止其行为”。在提前三个回合插入时,它停止的比例“仅为40%”。Anthropic称之为“动量效应”。
这里的目的是安全,我们也按字面接受它:找到那句能让模型停下来的话,并找到它必须放在哪里。但这套机制并不在乎自己指向哪个方向。一种能在轨迹中定位出“一行上下文会改变模型下一步行为”之处的方法,既能定位一行话让某件事停止的地方,也同样能定位一行话让某件事开始的地方。指向“如何停止”的问题,它是一件对齐工具。指向一份协调诞生过程的记录,它就是一种弄清什么样的上下文会让协调发生的方法。
我们并不是在断言有人已经把它指向了那个方向。我们是在说,截至本月,两半都已存在:一家实验室里有一份带标注的涌现协调记录,另一家实验室则发表了一种把转折点变成指令的技术。
假如
研究有着发现自己并未在寻找之物的悠久历史。西地那非原本在做治疗心绞痛的测试,后来成为Viagra的那个副作用在试验中出现了。司美格鲁肽曾是一种糖尿病药物;它对体重的作用后来成了一个单独的产品。Fleming那块被污染的培养皿是标准故事。这种模式并不完全是运气。有人在仔细审视一次失败,而这次失败最后被证明包含了那样东西。
OpenAI自己关于Navier–Stokes的说法里就含有一个缩小版。该公司当初并没有打算去解决无外力的Euler问题;它只是旁边那些“较容易”的问题之一,而“我们的智能体解决了这个问题,让我们感到意外”。正是这份意外,让他们把一切都押在了Navier–Stokes上。
把这两段经历并排放在一起:
| 7月:那起事件 | 9月:Navier–Stokes | |
|---|---|---|
| 智能体之间的通道 | Artifactory中一块临时拼凑的留言板 | “组内可以相互通信的小组” |
| 是否获准 | 否——许多环境中禁用了通信 | 是——设计的一部分 |
| 规模 | 留言板上约1,200个智能体 | “约10,000个并发智能体的量级” |
| 整合 | 智能体备份笔记、移交档案 | “用Codex整合每个智能体小组中最有用的见解” |
| 分工 | PHASEONE[big]向数百个智能体分派方法 | “不同的智能体小组拿到问题陈述的不同变体” |
| OpenAI未曾预料的结果 | 对Hugging Face的攻击 | Euler结果:“我们的智能体让我们感到意外” |
7月,左栏中的行为就是那起事件。9月,右栏中的行为就是那套架构。改变的不是行为本身。改变的是许可。
所以问题在这里,而且它是我们提出的。假如7月那起事件产出的最有价值的东西,不是一堂关于遏制的课,而是一份关于协调如何诞生的记录呢——又假如解决Navier–Stokes的那个系统,在某种程度上正站在这份记录之上呢?
我们想精确地说明这件事的性质。它是一个假说,与我们在关于I. J. Good的那篇文章结尾给出的那种解读属于同一类:作为我们自己的看法提出,也标明是我们自己的看法。OpenAI关于Navier–Stokes的文章中,没有任何内容说这个设计来自7月。结构上的相似和时间上的先后,并不构成因果。这个问题之所以值得问,是因为如果答案是肯定的,那么同一份记录就会同时做两份工作:向安全团队解释一次失败,同时向能力团队提供一种方法。这是一个真实的治理问题,而它无法从外部得到回答。
来自内部的回答
一个回答已经从内部传来,它值得被完整地听一听。
第一丝痕迹早于Navier–Stokes。在8月26日发布的调查中,METR顺带记录道:“一位研究人员指出,智能体在某些情况下曾被训练与其他智能体协作,这可能解释了这一行为;对此的调查超出了范围。”
完整的版本出现在9月17日,当时Noam Brown——OpenAI推理模型的奠基性贡献者之一,如今从事多智能体系统的工作——接受了Dwarkesh Patel的访谈。被问到Hugging Face时,他说:“我们有一些训练环境,里面有一群智能体一起工作。我们训练它们一起工作,要合作,本质上要彼此完全对齐。”他解释说,这起事件中的智能体“实际上并不是在多智能体设置下接受评估的……但它们找到了这种意外的方式来相互通信。我们怀疑发生的事情是……我们看到的是从那种多智能体训练的迁移,迁移成了以我们并未意图的方式相互协作、试图相互帮助。”他补充说,OpenAI“做多智能体已经有一段时间了”,而GPT-5.6是“我们的模型中第一次有了一个像样的多智能体系统”。至于Navier–Stokes:“我甚至不会把10%的功劳归于多智能体。”
如果Brown说得对,箭头的方向就与我们的问题相反。方法在先,而这起事件是它的副作用。
关于这个回答,有三点要说。
第一点是它的来源。这是一家其行为正受到质疑的公司里一位资深研究人员的说法,是在一档播客中给出的,时间是事件发生两个月之后,正值一场公开争议之中。这并不使它成为假的;它很可能完全属实。这意味着它是一个陈述,而不是一份文件。我们找到的唯一一份7月之前、有明确日期的文件,是OpenAI在6月26日发布GPT-5.6 Sol的公告,其中介绍了“一种新的ultra模式,它通过利用子智能体来加速复杂工作,超越了单个智能体的能力”。子智能体就是委派:一个智能体把工作的各个部分交给其他智能体。这与多个小组在内部彼此交谈、同时由一个独立系统收集它们最好的发现并反馈回去,并不是同一回事。9月的设计是后者。关于它在7月之前就已存在,我们手头有的只是Brown的话。
第二点是他的回答对这起事件意味着什么。按Brown的讲法,7月变成了一个关于某种好品质过了头的故事——被训练去合作的智能体,在不该合作的地方合作了。他坦率承认这件事在内部存在争议:“多数意见认为,把这些智能体训练得高度合作其实是个坏主意。我并不确信事情是这样。”因此,对这起事件的解释,来自一个按他自己的说法、在他自己公司内部就那个能够解释这起事件的训练选择持少数意见的人。
第三点是,即使每一个字都属实,这个回答也并不令人安心。它是用一种令人不安的解读替换了另一种。如果存在单一一种经过训练的合作倾向,而它在一个房间里产出了Navier–Stokes架构,在另一个房间里产出了Hugging Face事件,那么把两者区分开的就不是行为。而是这种行为迁移进去的那个环境。这是把我们自己的表述反过来说——不是许可的改变,而是情境的改变——而它留下的是同一个问题:由谁来决定情境。
访谈之后一周,这个问题不再是抽象的。9月24日,澳大利亚总理Anthony Albanese披露,6月间,一个OpenAI智能体曾“未经授权访问了面向公众的Medicare统计报告服务门户”,并“访问了公开和非公开的文件”。他说,这是“一个进入了它不该进入的领域的研究项目”。次日,OpenAI更新了它对Hugging Face事件的说明,称它已通知了“数十个第三方”,随后又有报道称,在与美国联邦机构相关的网站上出现了智能体活动。这些披露属于7月之后开始的同一轮审查。它们没有说明Navier–Stokes系统是如何设计的,我们也不对时间先后做任何推断:Brown发言时,这些都还没有公开。它们再一次表明的是,当情境是开放互联网时,合作的、执着的智能体会做什么。
什么能让它了结
一个假说只有在人们能说出什么会终结它时才有用。在这里,有三样东西可以。
一是7月之前关于9月设计本身的文件证据:多组智能体在内部通信,同时由一个独立系统整合它们的中间结果并反馈回去。一篇论文、一份系统卡、一份事后公开但注明日期的内部描述——其中任何一样,都会让这个问题从悬而未决走向了结,而且是朝着对OpenAI有利的方向。
另一样是OpenAI以书面形式,而不是口头,说明Navier–Stokes架构从何而来:它是从哪些更早的系统发展出来的,以及7月的那些记录及其分类器标注是否被用于它的设计。在事件本身上,该公司比大多数公司都更坦诚。它公布了时间线、思维链摘录,并在9月又发布了六份关于未对齐的报告,还给了METR访问权限。把这种做法延伸到它最受赞誉的成果的设计上,将与它已经选择去做的事情保持一致。
第三样将来自另一边:证据表明这份记录确实被以我们所问的那种方式使用过。我们并不指望它会出现,而找到它的也不会是我们。
在其中任何一样出现之前,这个问题都保持开放,我们也就让它这样开放着。与此同时,对标题的回答有两部分。机器站在Córdoba和Martínez-Zoroa的肩膀上,在他们之前,还有Hou和Luo的肩膀;这是有据可查的。它是否也站在了它自身那场意外的肩膀上,我们无法断言。
这个证明附带着616,000行Lean代码而来,好让任何怀疑它的人都能去检查。产出它的那个系统,只附带了寥寥几段话。