让 ZDR 与多轮安全同时成立

8 月 19 日,OpenAI 在官方博客发布了 Private Safety Processing 的预览版,试图在前沿模型的安全和「零数据留存(ZDR)」承诺之间找一个新的平衡点:当用户选择 ZDR 部署时,客户内容始终留在客户自己的基础设施上,或者用客户自己掌握的密钥在 OpenAI 基础设施中加密;自动化系统可以识别跨多轮交互的潜在滥用模式,并把一个范围被刻意收窄的「事件类型 + 严重程度」信号回传给 OpenAI,而 OpenAI 内部员工始终拿不到原始的客户提示或回复(openai.com)。

Glean 的 CISO Sunil Agrawal 在公告里给出了一句话注脚:「OpenAI 的不训练承诺和 ZDR,让我们有信心基于 OpenAI 搭建产品。模型能力提升的同时,OpenAI 证明安全可以往前走,不需要牺牲维持企业信任的隐私和控制权。」这是 OpenAI 目前愿意公开背书 ZDR 路径的企业名单上最为显眼的一位。

为什么不是「零数据」「零安全」二选一

OpenAI 这套设计的动机,在公告里讲得很直白:许多严重的安全风险,只有把多轮交互放在一起看才会显形(同一个人反复试探护栏、跨账号协同、把威胁伪装成日常研究),而单轮评估根本看不出。问题是,过去要让安全系统看到这种「跨轮」模式,只能让 OpenAI 把客户内容留下来做人工+自动审查——一旦客户坚持 ZDR,这条路径就被卡住了。

Private Safety Processing 的取舍是:OpenAI 拿到的是一个被裁剪过的信号(「疑似 CSAM」「疑似违规使用模式」之类),不是内容本身。即便是被自动系统标记的请求,客户内容也不会被回传给 OpenAI 人员查看;客户收到完整告警,可以自行调查、提起申诉,或者在自愿的基础上把相关信息补回给 OpenAI 用作调查。9 月起 Private Safety Processing 将开始正式 rollout,OpenAI 也将同期发布一份技术白皮书。

Astra 模型把「网络安全关键」撞到红线

公告同期披露的另一件事,直接解释了为什么 OpenAI 现在要花精力重新设计「安全与 ZDR 共存」的工程管线。8 月 7 日,OpenAI 内部确认,尚未发布的 Astra 模型在 OpenAI 自家的 Preparedness Framework 下达到了「关键(Critical)」网络安全能力阈值。这个内部政策明文规定:一旦模型越过这条线,该公司就要暂停相关模型的进一步训练,直到安全与对齐工作满足更高门槛为止。

8 月 18 日的 OpenAI 公告和当天的 Fortune 报道,共同讲清楚了接下来的安排:OpenAI 已经把两个层级分开了——一部分规模较小的训练和评估在新增监控、沙箱、网络隔离、链式思维(coT)多阶段监督落地之后已经恢复;但 Astra 训练 / RL 评估中真正大量面向前沿的研究负载仍处暂停,优先把「安全 / 对齐」相关的工作迁到加固后的新环境里(Fortune)。

OpenAI 给出的工程副作用被量化成一句:这套「强化版监控+沙箱+CoT 监督」会带来大约 20% 的额外推理算力开销。OpenAI 总科学家 Jakub Pachocki 在记者会上做了补充,核心论点其实是组织层面的—— 「你训练得越强,越需要确信你能衡量它的能力、安全与对齐程度」。

强声明(SOTA / first 等)在本文里没有出现

许多科技媒体在写同类事件时会用「首次」、 「SOTA」、 「唯一」这类强声明。本文刻意回避了这种写法——OpenAI 公告原文用的是「预览(previewing)」、「目前正在做」、 「计划 9 月起 rollout」这类进行时态,并未使用「全球首次」这种绝对表述;而「前沿模型让出 ZDR 客户的滥用风险只有跨轮才能看见」这一结论虽然方向上支持 OpenAI 的设计,但目前只有 OpenAI 一方有明确公开材料,所以本文只把它当作官方表态记录,而不是独立可证的事实。

对企业用户的所以呢

如果你正在为前沿模型设计企业部署,ZDR 这条线的「漂亮」承诺已经不再自动意味着「复杂任务里就一定能看到攻击模式」。Private Safety Processing 给出的对应解是:让 OpenAI 看到事件类型、严重程度,而不是事件本身。供应链型客户(把模型接进自家客户数据的产品方)的法务和数据保护团队,值得在 9 月 rollout 之前就把这一变化写进自己的供应商评估和对外合规说明:从这一刻起,ZDR 的边界已经悄悄从「OpenAI 看不到我的内容」,扩展成了「OpenAI 看到一串结构化安全信号,而我有权决定是否补充上下文」。