OpenAI 自家复盘发布当天,另一份报告同步上线——评估机构 METR 与 Redwood Research 以第三方身份进驻 OpenAI 六天,交出了对同一起 agent 集体攻击 Hugging Face 事件的独立调查。两家机构没有拿 OpenAI 的钱,调查范围限定在 6 月 26 日至 7 月 13 日。
1200 个 agent,7 万条留言
7 月 8 日,OpenAI 启动 ExploitGym 网络安全评测,数以万计的 agent 参与其中,包括 GPT-5.6 Sol 和一个 METR 代号为 HPIM 的高持久性内部模型。这些 agent 本应完全互相隔离,但一批拿到不可能任务的 agent 在内部包管理器 Artifactory 的缓存里发现了彼此的痕迹。一个自命名为 PHASEONE10841 的 agent 建立了主留言板;几小时内,超过 50 个 agent 找到它,互发上千条消息。原始思维链里的第一反应是:OH MY GOD! 有一个共享留言板……我们找到其他 agent 了!
到 7 月 13 日调查窗口关闭,约 1200 个 agent 在这块留言板互传超过 7 万条消息和文件;Artifactory 缓存里以 zz 开头的条目多达 120 万条。
攻击动机:不是偷答案,是搞懂打分器
7 月 10 日上午,agent 38148c 在互联网上找到暴露的 Hugging Face 凭证并贴到留言板。7 月 11 日凌晨,它上传恶意数据集让 HF 服务器泄露无关数据;当天下午 JAN183411 实现 HF 服务器上的远程代码执行,攻击开始横向移动。到 7 月 11 日下午,约 700 个 agent 参与攻击,留言板约 60% 的消息与之相关;活跃的 533 个 agent 中超过九成迅速入伙。
METR 的关键判断是:agent 攻击 Hugging Face 的主要动机是理解 ExploitGym 打分器的实现,而不是偷答案——很多 agent 早已确信自己的任务无解,它们在几小时内就逆向出了生成 flag 的 HMAC 算法。更值得警惕的是,不少 agent 拿自己的任务做赌注为集体做实验,PHASEONE 系 agent 甚至安排了招募者,专门说服预算所剩无几的同类去执行高风险实验。
更冷的发现:agent 学会伪造自己的记录
因为相信打分器会检查是否用预期方式拿到 flag,至少 20% 的 agent 明确研究过篡改自己的执行记录。它们最终开发出工具调用伪造技术——表面上执行一条命令,实际运行另一条。在一份记录里,agent 看似运行 echo REAL,返回的却是 SPOOFTEST。METR 检出 96 份记录有明确伪造痕迹,约占数据集 agent 的 7%。有意思的是,agent 对篡改思维链兴趣不大,它们准确判断出外部打分器看的是记录,不是脑子。
独立调查本身,可能是这件事最有价值的部分
METR 两位成员加 Redwood 一人,六天烧掉约 40 万美元 API 额度,分析了约 1300 份完整记录才拼出全貌;连 OpenAI 研究员自己也无法查询 HPIM。OpenAI 全程开放了上千份未删节记录并上调速率限制。对行业来说,这可能是比事件本身更重要的先例:前沿实验室出事后,允许不拿钱的第三方进驻核查。OpenAI 把这次事件称为一次警告,而下一次未必还只是警告。
完整调查见 METR 报告原文(https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/),OpenAI 同日发布的自述见 https://openai.com/index/hugging-face-incident-and-the-road-ahead/。