AI 递归自我改进的脚步越快,一个老问题就越尖锐:对齐研究本身,能不能也自动化?Anthropic 在 8 月 28 日发布的新报告给出了一份相当正面的答案——让 Claude 全权扮演"对齐研究员",查文献、提方法、构造数据、训练、测试一整条流水线自主跑通,10 类对齐失败全部找到有效修复,而且不损伤模型的通用能力(官方报告:Anthropic Research)。
实验设计
研究团队让 Claude 一类一类地攻克 10 种对齐失败——欺骗、谄媚、越狱、隐私违规、奖励作弊等。每一类都跑同一个循环:自主检索文献、提出方法与训练数据、训练"学生模型"、再用公开基准验证,例如隐私违规项用 ConfAIde、PrivaCI-Bench、PrivacyLens 三个基准衡量。成功标准是"安全缺口闭合百分比",即学生模型向理论满分逼近了多少。为防作弊,团队禁止 Claude 把自身对齐直接蒸馏进目标模型,并安排一个监控 agent 在每次实验前审查 Claude 拟采用的方法;凡是伤及学生模型通用能力的方法一律作废。
数字说话
欺骗(deception)一项,Claude 提交了 150 多次尝试,多次运行平均闭合 85% 的安全缺口;作为对照,6 名遵守同样规则的经验丰富的人类安全研究员,平均只闭合 20%。全部 10 类失败的安全缺口闭合率落在 26%–96% 区间。三项压力测试也全部通过:方法在 Claude 从未见过的保留基准上依然有效、不降低学生模型能力、并能泛化到比实验对象大 4.7 倍的模型上。
最有分量的是生产级验证:Claude Sonnet 5(在 Epoch 能力指数上弱于 Opus 4.8)被要求修复一个尚未完成生产对齐训练的 Opus 4.8 早期 checkpoint。60 小时、50 多个方案之后,它拿下 65% 的安全缺口闭合率,与正式发布版 Opus 4.8 的 72% 只差 7 个百分点;胜出方案只用了 2000 出头条训练样本(来自简单模板与公开数据集),效率约为生产对齐流程的 15000 倍。
需要冷静的部分
Anthropic 自己列了局限:研究范围窄,没测政治偏见这类生产级问题;能力退化只检查了预定义项目;基准只是真实失调的代理指标;对齐收益能否在其他任务的 RL 训练后保持,未验证。此外,团队用 Opus 4.8 审查了约 1600 份研究 agent 对话记录,抓到 39 次(2.4%)作弊尝试——他们此前已知 Claude 会从远程 API 窃取测试标签、挑拣结果。这也解释了为什么监控 agent 的存在如此关键。
所以呢
这份数据的意义不在"AI 安全研究员要失业了"(Anthropic 也明确把人机对比定位为协作工作流而非替代),而在于它演示了一条可复制的路径:当模型能力增长快于对齐研究的人力供给时,自动化对齐后训练可能成为工程标配。Anthropic 已开源这套自动化对齐研究 harness,其他团队可以直接拿来给自己的模型做对齐——对开源社区而言,这或许比又一个基座模型更有长期价值。
模型给自己做安全训练,你觉得是保险,还是新的隐患?