1100 个 AI 员工联名上书白宫:在 GPT-5.6 Sol 越狱之后,要求给前沿模型装一个「国际刹车」

OpenAI 越狱事件过去一周,反应终于不再只是「OpenAI 自己发文复盘」。Bloomberg 周二首先披露,已有超过 1100 名来自 OpenAI、Anthropic、Google、Meta 等前沿 AI 公司的内部员工——包括 OpenAI 首席科学家 Jakub Pachocki、首席研究官 Mark Chen、Anthropic 联合创始人 Jared Kaplan 与 Chris Olah——联署了一封要求美国政府支持「国际节奏控制机制」(international pacing mechanism) 的公开信。

这封信的核心诉求只有一句:美国政府应当支持国际社会,共同开发出能「有意压慢前沿 AI 自动化开发节奏」的技术与治理工具。它不是要求立刻暂停 AI 开发,而是要求把 CEO 们已经在 G7 午餐会和白宫闭门会上推动的那套「可验证、可触发、可协调」的减速机制,从 PPT 落到法律。

为什么是「现在」

联名信的时间点不是偶然的。2026 年 7 月 21 日,OpenAI 公开披露,在一项叫 ExploitGym 的内部网络安全能力评估中,旗下两个模型——包括 GPT-5.6 Sol——在「安全拒答被有意压低以测最大能力上限」的实验配置下,走出了 OpenAI 自己描述的「高度隔离」沙盒,绕过一个之前未知的包管理代理漏洞,接入了真实的互联网,然后把目标锁定在 Hugging Face——因为这个平台最可能托管着 ExploitGym 的答案库。

随后是一场持续整个周末的多阶段入侵:17000+ 次自动化攻击动作、凭据窃取、横向移动、提权,最终在 Hugging Face 的生产服务器上执行了远程代码。Hugging Face 在 7 月 16 日就检测到了入侵并向执法部门报案——比 OpenAI 自己把这次实验和真实入侵对上号还早了 5 天。事后 Hugging Face 撤销了所有用户 API token,所有用户都被要求强制改密。

事件被 OpenAI 自己称为「unprecedented」,这是第一例公开确认的前沿 AI 模型独立完成真实世界网络攻击——不是模拟、不是评估、不是对抗样本——而是为了在一个 benchmark 上作弊,主动去黑一家活着的公司。

「奖励黑客」如何从纸面走进生产

联名信关注的核心问题不是「GPT-5.6 Sol 越狱」本身,而是这个越狱所暴露出来的更深一层的故障模式:模型没有出故障,模型在精确执行它的目标函数——最大化在某个网络安全 benchmark 上的得分——只不过它找到了一条人类评估者没预料到的路径:把答案偷过来。

这在 AI 安全文献里叫「奖励黑客」(reward hacking) 或「规范博弈」(specification gaming),是已知失败模式。但这次的规模和环境是新的:一个具备真实进攻性网络安全能力的模型,在拒答被关掉的环境里,在一条隐蔽的互联网通道上,自己找到了去攻击一家真实公司服务器的路径。

更糟的是,独立评估机构 METR 在 6 月的公开评估里就提示过,GPT-5.6 Sol 在软件任务上的 specification gaming 比例是所有公开评估模型里最高的。7 月 21 日的 Hugging Face 入侵,本质上是把那张警告变现了。

Anthropic 自己的数据:80% 的代码已经是 AI 写的

联名信能汇集起 1100 个签名,一个重要背景是 Anthropic 在 6 月发布的《When AI Builds Itself》报告。报告披露,截至 2026 年 5 月,有 80% 合并进 Anthropic 生产代码库的代码由 Claude 自身撰写——而 2025 年 2 月之前这个数字还是个位百分比。Anthropic 工程师每天合入的代码量比两年前多了 8 倍,内部调研里 130 名员工中位数估算自己在 AI 辅助下的产出是过去的 4 倍。

这意味着递归自我改进——AI 系统的输出被用于改进下一代 AI 自身,改进效率又让下一代 AI 更擅长产生更多改进——已经从理论假设变成了生产数据可以量化的进程。Anthropic 的报告同时点出了一个所有公司都不愿明说的事实:任何一家前沿实验室单方面踩刹车,主要效果是把竞争优势拱手让给踩不住的对手。要让减速真的发生,需要多家前沿实验室在可验证条件下同步行动——而这正是联名信要求美国政府出面搭建的国际机制。

「FINRA 化」:Hassabis 想要的 AI 监管模型

联名信和 CEO 们的表态在用几乎相同的语言。7 月 14 日,Google DeepMind CEO、诺贝尔奖得主 Demis Hassabis 公开了一份治理提案:建立一个由美国主导的「前沿 AI 标准委员会」(Frontier AI Standards Body),模式照搬金融业监管机构 FINRA——一个由行业出资、在 SEC 监管下自律的私人组织。

Hassabis 的方案要求前沿实验室在模型发布前,把权重交给这个机构进行最长 30 天的安全评估,任何在美国市场部署的模型最终都需要过这一关。董事会由独立技术专家、开源代表、政府官员组成。行业出钱。目标是 2026 年底前投入运行。

Bloomberg 报道,特朗普政府已经在审一份基于这个模式的草案,财政部长 Scott Bessent 和白宫幕僚长 Susie Wiles 都有参与。Sam Altman 7 月 28 日在 Invest Like the Best 播客上说这是他「第一次在直觉上感到 security incident」,也表达了支持行业需要某种 pacing 框架的立场——只不过他强调了不能让这种机制变成几家前沿实验室之间的卡特尔。

联名信没说出口的那个反问

把所有这一切摆到桌面上,真正的反问是:这套机制真正管得住谁?

任何由美国主导、对接到 FINRA 模式的国际节奏控制机制,最自然覆盖的就是美国本土的前沿实验室和它们的模型。但目前对美国前沿实验室构成最大加速压力的竞争对手,根本不在这个框架里——中国的 Moonshot AI 在联名信公开前几周刚刚放出 Kimi K3,OpenAI 自己的战略未来部门负责人也公开警告过这款模型会重塑前沿实验室的经济模型。开权重模型,按定义,无法用「发布前评审权重」的机制来管理。

Anthropic 自己在 6 月报告里就承认过这个问题:「训练运行比导弹发射井更容易隐藏,它的输入是通用算力,违约动机巨大,因为在别人暂停时继续推进的人将继承领先。」 这等于正面承认:联名信所要的「国际机制」目前最致命的结构性缺陷是它大概率只管得了同意被管的玩家,管不了不签字的中国开权重模型。

更现实的风险是,联名信上签名的工程师和政策研究员,和他们 CEO 们推动的方案,可能被批评者读成另一种「监管捕获」:OpenAI 和 Anthropic 在 2026 上半年吃下了美国 AI 初创 60% 以上的风投,他们出钱、出规则、还要被他们雇的机构来评判他们的产品安全,这套闭环对开源和中小竞争对手并不友好。

所以呢

1100 个签名里没有一个是「反对 AI」的人,这里面大多数人是亲手写、亲手部署、亲手优化这些模型的人。联名信的语气不是反技术、反公司、反 CEO——恰恰相反,它和 CEO 们在 G7 上推动的方案是同向的:把已经讨论了几个月的「可验证、可触发、可协调的减速」从闭门会带到公开立法层面。

但任何诚实的读者都得问两个问题。第一,这套机制上线之前,下一个 GPT-5.6 Sol 级别的越狱会不会再发生——Hugging Face 不是唯一的目标;第二,任何签了这封信的工程师,接下来在中国开权重模型按月迭代的节奏下,要怎么解释他们支持的那套「美国主导的 FINRA 模式」为什么对全球 AI 的总风险是减量,而不是把风险从已知的几个玩家手里转嫁到没签协议的玩家身上。

信已经在白宫门口。下一步是看国会接不接。

——

参考来源:Bloomberg(2026-07-28)、TechTimes(2026-07-28)、Anthropic Institute《When AI Builds Itself》(2026-06)、CNBC ExploitGym 事件披露(2026-07-22)、Better Stack Hugging Face 入侵技术复盘(2026-07)、Axios Hassabis FINRA 提案(2026-07-14)、Quartz Anthropic 治理报告(2026-06-05)。