一支只有三人的安全团队用 Anthropic 的 Claude 当外壳,把对手 OpenAI 的内部仓库打开了一扇门——还给 OpenAI 自己留了个无害的 PR 当"到此一游"凭证。这场从 7 月 23 日拖到 7 月 28 日、最终在 9 月才公开披露的事件,是 AI 辅助攻击能力又被测了一次,只不过这次的靶子恰好就是 OpenAI。
入口是一张 HEIF 图
攻击起点非常朴素——OpenAI 的社区论坛 community.openai.com 的图片上传功能。这个论坛用的是 Discourse,默认会用 FastImage 做图片检查;但 FastImage 不支持 HEIF 格式,所以 HEIF 文件被甩给了下一棒:基于 ImageMagick + libheif 的转换链路。问题就出在这里:上游 libheif 的维护者其实在 2025 年就改过出问题的那段代码,但那次提交没被标记为安全修复、也没分到 CVE 编号,所以 Discourse 在用的旧版本里它还在原地。Hacktron 的 Harsh Jaiswal、Mohan Pedhapati、Rahul Maini 三人组吃到了这个"明明修过但没人下游打"的福利:他们上传一张特殊构造的 HEIF 文件,直接拿到论坛服务器的 RCE 权限(theregister.com)。
Claude 在这个过程里干了什么
Hacktron 公开的复盘里有一段很关键的细节对比:Opus 4.8 能写出能跑的 exploit 代码,但只在 ASLR(地址空间布局随机化)关掉的环境下才稳定——现实部署默认是开着的,所以这条路没走通。然后 7 月 24 日晚上 Anthropic 发布 Opus 5,三人组随即切到新模型。报告里写得很直白:"在新模型上,本地 Mac 环境三小时就拿到了可工作的 exploit 代码,接下来才把它移植到 Discourse 的服务器环境。"这一步之后,他们用 Claude 在自己的测试环境里反复迭代,直到能直接对着 OpenAI 的真论坛打。
整条链路时长:从 7 月 23 日第一次接触,到 7 月 25 日拿到初始入口,再到 Codex 接管员工 GitHub 权限并开了一个无害的 PR,全程不到 72 小时(xenospectrum.com)。他们明确停了手,声称没有读任何内部代码或敏感数据。
SSO 是第二个放大器
光拿论坛 RCE 还不够——真正让这次能"打到员工账户"的,是 OpenAI 的 SSO 配置。用户如果用 OpenAI 凭据登录过 community.openai.com,这层会话状态就能直接复用到 ChatGPT 和 Codex 上;换句话说,论坛一旦失守,等于把所有"拿 OpenAI 账号登录过论坛的人"的 ChatGPT/Codex 全部推到了悬崖边。XenoSpectrum 的复盘把这层放大效应单独列了出来:这不是 Discourse 的锅,是 OpenAI 自己服务之间的信任边界设计。
紧接着,Codex 通过员工的 GitHub organization 权限被触达,Hacktron 立刻演示了"在 openai/openai monorepo 里开个 PR",作为访问能力的实证。Discourse 在 7 月 28 日发了 CVE-2026-32882 公告和 GHSA-vhm9-85gw-x335 安全公告,打了 image-processing 沙箱;OpenAI 在收到报告 14 小时内修完了自己那侧、撤销了相关 token,并在 9 月 1 日通过 Bugcrowd 付了 6500 美元赏金——但明确说明"对 Discourse 那部分的测试本来就不在赏金范围,这笔钱只为认可 OpenAI 自己的发现"。
模型换了,Exploit 难度变了
这是这次事件里最值得拉出来的对比点。Hacktron 的复盘提供了一个干净的 A/B:同一个 CVE、同一组研究人员、同一台目标机,Opus 4.8 写得出的代码在 ASLR 默认开启的环境里跑不动;Opus 5 在相同研究流里把可用 exploit 的时间压到了小时级。他们没有任何并行 benchmark,这就是个案例报告,但它指向一个老问题——防御方评估攻击方能力时,如果还停留在"去年的模型大概能做到哪",这个时间常数在被 Opus 5、GPT-5、未来的新一代继续压缩。
那个被反复引用的不到 3000 美元 token 成本数字,实际覆盖的是整个"HEIF Heist"项目两个月跨多家公司的总开销,而不是 OpenAI 这一单的支出,且不含人力成本。把它当"攻破 OpenAI 的全部账单"是误读,但反过来——"两个月 + 三个人 + 不到 3000 美元 token,就能打到一家头部 AI 实验室的内网代码库",这个事实本身已经够防御界睡不着觉。
防御侧的三个独立检查点
把 Hacktron 的攻击路径和 Discourse 的修复公告并排放,真正需要运营方单独复核的不是"打了补丁没",而是这三件事是否分别到位:
- 入口层——fix 后的 image 包是否真的落到了运行镜像里。光有上游 patch 不算部署。
- 跨服务认证——一个服务被攻破后,能不能横向扩到另一个服务的权限。OpenAI 这侧的回答是"不能",这次的现实是"能"。
- 开发环境权限——把 Codex 类 AI agent 接到员工的 GitHub organization 时,真实可执行操作的边界到底划在哪。
把这三件事拆开看,任何一件不到位,类似的链式攻击都能再来一次。
一行结论
Claude 没"黑掉"OpenAI,但它把研究-到-exploit 的时间常数从月压缩到了天,而且这件事就发生在做出最先进模型的那家自己身上;赏金 6500 美元并不是"OpenAI 不在意"的信号,而是 bug-bounty 报价模型还没追上模型能力的那条曲线(theregister.com)。