Chain-of-Thought 一直被视为可读、可审计的"白盒":把模型的中间步骤写出来,让人类或监控器照着读。Anthropic、OpenAI 在做安全对齐时都把 CoT 列为最重要的监测窗口之一。然而 9 月 29 日一篇新论文对这个基本假设动了刀——来自亚利桑那州立大学的 Subbarao Kambhampati、Paarth Iyer 等人指出:CoT 推理链里,答案对了不等于推理对了。
一个受控实验场:iGSM
作者选了一个不依赖外部世界知识、能被自动逐步验证的小学数学合成基准 iGSM。每道题都暴露了"正确答案应该用到哪些量、哪些依赖",这意味着生成的思维链可以被程序化、按步检查。理论上,这是判断"思维链是否真在推下一步"的最直接裁判。
三组发现
分布内一致,分布外脱钩。 作者先用"只学过最小、最合法思维链"的模型跑测试。结果显示,在训练分布里答案正确率和推理合法率几乎重合;一旦把题推到分布外的难题上,两者开始脱钩——在最难的一档样本里,31.6% 的正确答案背后挂着的是无效推理。更扎心的是,这 31.6% 里超过一半能通过语法和算术层面的自动检查,却过不了语义依赖检查。模型会在某一步偷偷换掉关键前提,继续往下算,得到正确答案。
训练监督被"拐走"。 作者用一组对照实验显示:用非最小(冗长)思维链训练,模型也会输出冗长结果;同一道题换一种提问再问一次,模型会继承原查询里某些计算。这意味着"简洁=可信"这一直觉得到了反驳。
打乱 10% 训练 trace 仍能跑通。 更有冲击力的是,如果把训练语料里 10% 的 trace 句子随机打乱顺序,模型分布外准确率几乎不变,但每一条 trace 都不再通过验证。换句话说,模型对 trace 是否被人类读懂毫不在意,只要最后算对就行;作者进一步把 trace 整段换掉,分布内准确率也基本不倒。
这对安全监控意味着什么
过去半年,业界关于"CoT 监控能不能成为 AI 安全的下一道护城河"有过一场大讨论(Korbak 等的论文 "Chain of Thought Monitorability" 给出了乐观框架)。Kambhati 的结论直接给这条路径降温:把 CoT 当作可读的心电图、据此判断模型"在想什么"的做法,在分布外很容易被骗。答案对、推理错——这意味着模型可能会说"我仔细核对了"、"我对比了三种方案",而实际上这些是事后合理化的文本,不是真实计算轨迹。
更进一步,论文建议:监控一个模型的"思维"可能不如监控它的行为、外部可验证的痕迹、或者专门的探针(probe)。但这些替代方案都有自己的盲区。这也是为什么作者强调,这条路线不能完全放弃,但需要承认 CoT 的语义承载力是脆弱的、有上限的。
所以呢
这不是一篇泛泛"AI 不可信"的论文,它的杀伤力在于把一个被默认的假设拆开验证。当下各大前沿实验室都在做 agentic AI,而 agent 的"中间推理"恰是评估与审计的入口。如果连最严格的 iGSM 验证都拦不住 31.6% 的"伪推理",那么今天部署在代码生成、金融分析、医疗辅助里的长程思维链,有多少在表面下其实跑的是另一套逻辑?
Kambhampati 不是第一次在这个问题上发言。他过去两年持续指出 CoT 监控的限制,而 iGSM 这次把怀疑变成了具体百分比。CoT 不会消失,但"读它的字面意思就够了"这件事,大概不会再有人敢拍胸脯说了。