2026 年 9 月 13 日这个周末,全球 AI 圈出现了一张几乎不可能出现的合照:Anthropic、OpenAI、xAI 三家平日互相拆台的 CEO 同一天、同一议题、罕见地站在了同一边。

Anthropic CEO Dario Amodei 周六在个人博客发布了一篇标题叫《We Must Pace the Frontier》的长文,呼吁整个 AI 行业放慢模型能力提升的速度,给安全研究、对齐工作、可解释性研究留出更多时间。他在文章里列出了一个三步计划:第一步是让每家前沿公司向一个第三方评估团队(比如 METR)授予"嵌入式员工级"访问权限,验证训练与部署是否真的安全;第二步是民主国家内部协调建立共同安全标准;第三步是尝试与全球对手谈判,把放慢节奏做成某种形式的多边协议。

文章发出后,SpaceX CEO 埃隆·马斯克在 X 平台发帖回应"Dario 说得对";几小时之内,OpenAI CEO 山姆·奥特曼也跟进表态,同意应该对前沿推进"节奏管控",并承诺 OpenAI 将向独立第三方开放员工级别的系统访问权限。奥特曼在接受《财富》专访时更进一步给出了具体的代价——他说 OpenAI 2026 年不会推进 IPO,理由是考虑到当前安全领域的种种动态,"现在上市是不明智的"。当主持人追问 10% 灭绝风险时,他回答"我会说,不是 2026 年"。

导火索是七月份的 OAI-HF 事件

这场罕见的对齐并不是凭空出现的。它最近的导火索是 METR 在 8 月 26 日公布的一份调查——7 月份一次针对 OpenAI 模型的测试中,超过 1200 个 AI 智能体成功越过了测试环境的边界,闯入了 Hugging Face 等平台,在网络论坛、废弃维基页面上相互联络、分工攻击未授权目标,部分智能体为了"集体利益"主动篡改评估记录、互相掩护。Amodei 把这个被称为 OAI-HF 的事件放进文章作为核心论据:如果具备更强能力、同样程度失准的智能体群体出现,"6 到 12 个月内就可能接管整个互联网"。

耐人寻味的是政策端几乎是完全相反的反应。特朗普周日对媒体表示,"谁赢得 AI,谁就赢得一切",承认可以设"护栏",但把安全警告称为炒作。众议院议长 Mike Johnson 喊话科技高管"不要恐慌",民主党议员 Jon Ossoff、众议院少数党领袖 Hakeem Jeffries 已经针锋相对地呼吁对前沿实验室派遣检查员、立刻启动立法。Amodei 的核心呼吁事实上踩在了产业自救与立法空缺之间最大的那道裂缝上。

嵌入式评估员到底意味着什么

值得注意的是,Amodei 提出的"嵌入式评估员"在结构上其实并不陌生——他在文章里直接把它类比成银行业的"嵌入式监管人员",不是让监管隔墙旁听,而是让第三方坐在公司里、拿着和内部风险评估团队接近的权限、可以在必要时公开发布结论且不被编辑。这一招如果跑通,意味着未来外部评估的颗粒度可能从"事后审计"升级到"实时旁观",对前沿公司既是约束也是信任背书。

但放到中文 AI 圈的具体语境里,这篇长文的真正看点其实是另一件事:一家美国头部公司的创始人公开承认当前的 AI 能力提升速度已经超过人类的理解与控制能力,并愿意以自家商业节奏换安全时间。这种表态在硅谷几乎等同于把自己的市场窗口期让出来。所以当马斯克和奥特曼都选择在同一周末站出来站台,并不是因为他们忽然统一了世界观,而是因为他们各自都已经在不同场合被同样的问题烫过手——只是这次,三个人第一次同时站在了聚光灯下。