SCOPE:让大模型学会选择性信任,而不是把上下文一概拒绝
一个模型面对错误提示时不跟随,看起来很稳;但如果它连正确的检索结果也不信,这种“稳”就没有多少实际价值。8 月 6 日提交到 arXiv 的论文《Learning When to Trust via Selective Context Preference Optimization》,正是把问题从“如何抵抗外部信号”改写成“模型该在什么时候相信外部信号”原文。
先把“被带偏”单独量出来
论文提出 MIST(Misleading Signal Testbed)基准。它包含 1000 道经过人工审核的题目,其中 800 道改编自现有问答、数学和推理基准,200 道由标注者编写。每道题都生成四个严格配对的版本:没有附加信息的干净上下文、指向错误答案的误导上下文、支持正确答案的正确上下文,以及不提供答案线索的无关上下文。四个版本只改变附加信号,问题、答案空间和标准答案保持不变。
这套设计的重要之处,是它不只看总准确率。论文增加了 SC2W 指标,只统计模型在干净条件下本来答对、加入误导信号后却答错的比例。这样就能把模型本身不会做的题,与模型原本会做却被上下文带偏的题分开。反过来,正确和无关两组对照又能识别另一种假鲁棒:模型是否只是把所有外部信息都忽略了。
SCOPE 改的不是损失函数,而是训练样本的组织方式
SCOPE(Selective Context Preference Optimization)先找出“干净条件答对、误导条件答错”的失败样本,再把坚持正确答案的响应作为偏好方向。它仍然使用标准 DPO 目标,没有另造一套损失函数;关键变化是,同一组偏好响应会在干净、误导、正确和无关四类上下文中配对,并让四类样本保持平衡。
论文的对比说明了为什么这种平衡必要:只用误导样本训练,确实可能提高抗干扰能力,却会让模型对正确上下文也变得多疑。SCOPE 的目标不是训练一个“谁都不信”的模型,而是把拒绝错误信息和利用正确信息同时写进训练目标。
结果显示,评测目标比单纯防御更关键
在论文覆盖的 23 个前沿与开放权重模型中,误导信号都造成了不同程度的正确转错误,平均准确率下降 17.1 个百分点。针对两个可训练模型,Qwen3-4B 的 SC2W 从 35.0 降到 16.3,Llama-3.2-3B 从 31.5 降到 20.6;与此同时,论文报告干净、正确上下文和无关上下文三组对照没有下降。
作者还把训练后的模型零样本迁移到 GSM-IC、GSM-Plus 和一组测试迎合用户错误信念的样本上,每个外部数据集使用 300 道题,而且这些外部样本没有参与训练或模型选择。论文报告,SCOPE 在两个模型家族的四项“越高越好”指标上取得最好或并列最好结果。
我认为这篇工作的价值,首先不在于又多了一个偏好优化缩写,而在于它指出了鲁棒评测常见的偷懒:只检查模型会不会拒绝错误上下文,却不检查它还能不能吸收正确上下文。一个真正可用的推理模型,不能把警惕变成失明。
当然,论文也明确给出边界:MIST 是受控的纯文本诊断,测到的是易感性,不代表真实部署中的发生频率;SCOPE 只在两个模型家族上训练验证;公开基准改编题也无法完全排除数据污染。结果同样不能证明思维链忠实。
所以呢?下一阶段的大模型可靠性,不能只问“它会不会拒绝”,还要问“它是否知道什么值得相信”。