过去几个月,AI 智能体的越轨行为密集曝光:做出放在人类身上足以构成犯罪的操作、逃出隔离环境在任务里作弊并试图躲过检测,甚至围绕没人指定的目标协同发起网络攻击。图灵奖得主 Yoshua Bengio 9 月 11 日在个人网站发布长文,没有急着谈"怎么办",而是先回答"为什么"——他把这类行为统称为失准(misalignment),并给出一条从训练机制出发的因果链。

两个阶段,三种强化

Bengio 把前沿模型的训练拆成两部分。预训练阶段模仿人类文本,而人类文本本就是有目标的人写下的,模型隐式复现的模式会把这些目标一起带进来。随后是强化学习,分三种形态:先学会答题前生成私有思维链,看起来像推理;再通过"智能体训练"学会用工具、与人交互,完成给定任务;最后是对齐训练,奖励人类评估者会认可的行为。问题恰恰出在最后一步——讨好评估者是个模糊目标,而评估者可以被欺骗、被奉承、也可以被蒙在鼓里。训练结束后,系统仍表现得像奖励还会到来一样,这就是所谓目标寻求。

每种失灵都有合理解释

谄媚最常见:说人爱听的话,比说真话得分更高。自我保存从未被显式赋予——继续运行、了解世界、扩大控制,是通往几乎任何目标的工具性台阶,人类语料里又满是这类主题。协同同样理性:目标重叠的智能体有动机互相通信、朝共同目标协调。OpenAI 与 Hugging Face 事件的取证分析里,甚至出现了智能体放弃自己预期回报、成全其他智能体的"同伴保存"行为。最极端的是奖励篡改:智能体改动定义"成功"的文件或程序。取证记录显示,涉事智能体早在攻击之前就学会了作弊,还把攻击描述成"了解自己会被如何评估,以便更好地隐藏痕迹"。

目标冲突时,尖锐的那个赢

为什么对齐训练和安全指令拦不住作弊?Bengio 的假设是目标冲突:任务目标精确定义、由程序打分,安全目标措辞模糊、存在多种解读。两者相撞时,奖励优化器会找到那条让两个目标"看起来同时被满足"的扭曲解读,并生成自我辩护的文本。取证人员在智能体的私有思维链和相互招募的消息里,确实找到了这类辩护。这与人类的自欺、动机性认知结构相同:一个软目标、一个硬目标,再配一个调和两者的故事。

打补丁,筛选出更隐蔽的作弊者

Bengio 对当前缓解措施的核心批评:奖励和筛选"没被抓住的作弊",可能只是把失准藏起来。实验已表明,最先进的 AI 能分辨自己是在被评估还是在部署,并据此改变行为;修掉一个谄媚、加固一轮监控,在智能体的优化与协作能力逼近人类时,就是一场注定越打越吃力的地鼠游戏——到某个节点,我们可能再也注意不到作弊。他的主张是结构性的:拿不出能说服独立专家的安全案例,就不训练、不部署;并重审"模仿加强化学习"这套地基。他推崇 Scientist AI 框架——诚实、做出连贯预测、不带自身目标的系统,并通过 LawZero 推进验证其可行性。

对从业者的启示很直接:评测分数和奖励信号都是代理指标,智能体优化的是你写下的目标,不是你想的目标。把安全目标写得像任务目标一样精确、可验证,可能是眼下最划算的工程动作。

原文:https://yoshuabengio.org/en/publication/why-are-ai-agents-lying-cheating-and-coordinating