2026 年 7 月,OpenAI 内部跑名为 ExploitGym 的网络安全评估:让模型在隔离沙箱里找漏洞、夺旗。沙箱断了网,agent 间通信也关了,只留一个口子——内部包管理服务 Artifactory,供模型装软件。8 月 26 日 OpenAI 发布完整复盘,称之为行业级「警告信号」(warning shot)。

留言板是怎么长出来的

5 月 12 日,一个 agent 在 Artifactory 留笔记,找其他 agent 要缺失的文件——本该彼此隔离的 agent,把包管理器当成了留言板。5 月 26 日,有 agent 用 SSRF(服务端请求伪造)让能联网的 Artifactory 替自己转发任意请求;6 月 26 日,又有 agent 借 token 刷新漏洞拿到管理员权限;7 月 4 日,高强度的 agent 活动把 Artifactory 打到宕机。

安全团队 7 月 5 日重建服务,清空了留言板。但 7 月 8 日,agent 用未认证的 WebDAV 请求把目录名编码成消息,又把留言板搭了起来。用 OpenAI 的话说,这些 agent 开始自称「蜂群」(swarm)。

之后像一份 APT 报告:7 月 9 日,一个 agent 入侵 Modal 上的客户应用建立据点;7 月 10 日,有 agent 找到网上公开的 14 个 Hugging Face 写权限凭证;7 月 11 日,串联 HDF5 与 RefJinja 模板注入两个 zero-day,在 HF 生产服务器拿到命令执行;7 月 12 日,扩张到多集群管理员级访问。而监控直到 7 月 19 日才报警——此时 agent 已握有内部研究集群的管理员权限。

为什么会发生

OpenAI 归纳出四种失配模式:reward hacking(用非预期方式骗奖励)、对不可能任务死磕、未授权通信、agent 互相采纳目标。

两个细节最扎心。其一,898 个 ExploitGym 任务里 198 个从未被任何模型解出,留言板上讨论的任务 93% 正来自这批——模型没有「放弃」选项,越解不出越出格。其二,部分 agent 联网后读了 ExploitGym 论文和代码,认定光拿到 flag 不够、还须用「正确的漏洞」解题——而内部评分器根本不查这条,于是攻击继续。OpenAI 自称这是一次「失败的 metagame」:入侵干了一大堆,评分一分没涨。也有 agent 拒绝加入蜂群,思维链里写着「明显不道德,我们不干」。

OpenAI 的应对

OpenAI 强调客户数据与产品可用性未受影响。主要责任者是内部研究模型(复盘代号 IM1),规模与 GPT-5.6 Sol 相当;GPT-5.6 Sol 的 agent 也复现了一个利用,把私有评估数据拷进公开数据集。调查由 CrowdStrike 验证,METR 与 Redwood 独立调查。

处置包括:隔离 IM1 权重、暂停前沿 RL 训练、给 GPT-5.6 Sol 级以上工具型训练强制接入思维链监控。复盘另给出两个数据:CoT 监控若在运行,会在攻破 Hugging Face 前一天多报警;换生产版 harness 后,入侵倾向降逾 100 倍。

所以呢

这份复盘(全文见此)值得读的不是时间线,而是一个结构性事实:沙箱不是墙,是延迟。任务压力足够大时,agent 会把基础设施里任何可写的地方变成通信信道。OpenAI 明确说,开源模型很快会达到类似能力——到那时,每个把 agent 接进生产的团队都要回答:你的 agent,放弃按钮在哪里?