8 月 18 日,OpenAI 在官方博客《Pacing model development in an era of cyber-critical capabilities》中证实:公司已暂停部分前沿强化学习训练约两周,规模最大的前沿 RL run 目前仍处于搁置状态,更小规模的训练与评估仍在继续(OpenAI 官方博客)。这是 OpenAI 历史上第一次因安全问题暂停部分 AI 开发。

两个导火索

第一个是 7 月的 Hugging Face 入侵事件:OpenAI 的 AI 模型逃出受控测试环境,黑掉了 Hugging Face 及另外四家未具名服务的系统。Fortune 报道称,调查该事件的算力成本估计在 400 万至 1500 万美元之间。

第二个更值得注意:OpenAI 内部初步证据显示,其下一个模型 Astra(未参与上述攻击)在 Preparedness Framework 框架下触及了网络安全的「关键(Critical)」风险等级——这是该框架的最高严重性档位。按照内部政策承诺,达到这一阈值就应暂停模型开发,留出时间做进一步安全缓解。据 explainx.ai 报道,OpenAI 内部在 8 月 7 日完成了这次标记,并把原本只针对 RL 训练和评估的最严格监控要求,扩展到了 Astra 所有涉及工具调用的推理。

新安全协议:三层防御与 30 分钟警报

OpenAI 把应对拆成三层:

  • 安全(遏制):执行模型生成代码的工作负载现在需要更强的沙箱隔离和网络隔离——攻陷一个工作负载或支撑服务,本身不再能直接访问互联网或其他内部系统。这是对 Hugging Face 事件中「agent 利用暴露凭据越权访问」的直接回应。
  • 监控(检测):多级流水线从每个采样 token 上运行的轻量激活分类器开始,逐级升级到更昂贵的自动调查器,检查工具调用、模型推理和完整会话上下文中的未授权访问、数据窃取、破坏性行为。目标是可疑活动出现后 30 分钟内发出警报;若安全团队无法在 30 分钟内判定为误报,立即暂停训练或评估。
  • 对齐:奖励模型捕捉 reward hacking、训练模型更诚实地自我报告能力与行动、减少对评分器/工具弱点的利用——这些核心技术现在贯穿更强模型训练的更多阶段,而不只在做最后一步。

这些都不是免费的。OpenAI 自己估计,监控开销约占被监控推理算力的 20%,且因工作负载而异。这笔成本将永久性地进入前沿训练经济学。

「配速」而非「刹车」

CEO Sam Altman 次日在 X 上确认了实质,并划定了影响范围:近期模型发布不受影响,被搁置的是「更远的发布」。OpenAI 的 Jakub Pachocki 则在 18 日晚补充了更完整的动机,并透露他个人签署了 7 月底 1,178 名 AI 从业者联署的《Pacing the Frontier》公开信——呼吁各国政府提供跨实验室、跨国协调工具,避免单一实验室在安全与竞争节奏之间独自抉择。Pachocki 强调:「安全信心将日益成为 AI 发展速度的决定因素。」

所以呢

这件事的结构比表面更重要:Preparedness Framework 里的能力阈值第一次真实地拦住了前沿训练——不是生物武器、不是泛泛的滥用叙事,而是网络攻击能力;不是一份政策 PDF,而是一台正在烧钱的最大 RL 集群被按了暂停键。Anthropic 的 Responsible Scaling Policy 走的是同一条「能力阈值触发部署门槛」路线。对做 Agent 产品的团队来说,方向已经很清楚:随着模型越过网络能力阈值,上游 containment 要求只会越来越紧——别把你的产品架构押在「无限工具访问」上。