长程任务里,智能体每天都要做同一个动作:岔口选路。测哪个假设、沿用哪份实现、走哪条修复路径——这些中途决策决定整次运行的成败。微软团队把这种「在结果揭晓前挑对方向」的能力叫作品味(taste),并在论文《The Tasteful Agent》(arXiv:2609.25804)里发布了专门测量它的基准 Taste-Bench,目前已登上 Hugging Face 每日论文榜第一,61 个赞。

品味测的是什么

Taste-Bench 的题目形态很克制:给模型任务描述、岔口之前的完整轨迹、两个候选下一步,让它选哪个更好。关键在于「隐藏的另一半轨迹」会证明哪条路对——选错的那个方向在当时往往看起来也合理,代价要花掉后面大半预算才显现。论文评了 14 个前沿模型,最好的 GPT-5.6 Sol 正确率只有 59.7%,而随机猜测是 25%。旗舰模型在真岔口上的判断力,离靠谱还差得远。

更扎心的是两个反直觉发现。其一,决定性证据在轨迹里出现得越晚,模型越抓瞎:准确率从 62.3% 一路掉到 21.0%。其二,更大的推理预算救不回来——给模型更多思考 token,选路准确率没有改善。品味似乎不是「想得更久」能换来的东西。

502 道题是怎么来的

这个基准最漂亮的地方是不需要人工标注。作者从 SWE-bench、SWE-bench Pro 和 METR 的 MALT 公开轨迹(RE-Bench 与 HCAST)里挖岔口:同一任务的多次独立尝试在同一个点分叉、结局不同,这是平行岔口;单条轨迹里智能体走错方向、撞墙后折返恢复,这是弯路岔口。轨迹的后半段天然为前半段的决策提供事后标签。

过滤也够狠:所有裁判模型仅凭选项措辞就能答对的题,当作平凡题剔除;任何一个裁判读完全记录后不同意标签的题,当作不可判定剔除。4,657 个挖出的岔口最后只活下来 502 个:工程域 390 题,研究域 112 题。评测协议还防位置偏好:每道题按原始选项顺序和完全反转的顺序各问一次,两次都答对才算对,恒选同一个位置的模型直接得零分。作者在社区帖里给出标签与人工审查的一致率:98.8%。

品味可以练出来

榜单本身信息量不小:GPT-5.6 Sol(59.7)与 GPT-5.5(59.5)并列头部,Claude Opus 5 是 55.5,GLM-5.2 拿到 53.9,DeepSeek V4 Flash 43.3,垫底的 Grok 4.20 Reasoning 只有 15.7——它的 1,004 次请求里有 459 次输出无法解析,按协议全算错。

但论文真正的钩子是:品味可训练。作者把「看过结局的教师」的判断蒸馏给学生模型,Qwen3.6-27B 在未见过的任务上从 30.0% 提到 47.9%;再进一步,让这个学生给智能体当顾问,SWE-bench Pro 的端到端成功率从 14.6% 翻到 33.7%。判断力可以从 hindsight 里蒸馏出来,再反哺给运行中的智能体。

所以呢

过去两年大家卷的是智能体能不能跑完全程,基准也都盯着端到端成功率。Taste-Bench 把镜头对准了中途的每一次转向,而数据说明这恰恰是当前最薄的一块短板——最强模型正确率六成都不到,且砸推理预算没用。对做智能体工程的人来说,「在岔口上停下来,问问一个蒸馏过 hindsight 的顾问」可能比换更大的模型更划算。基准代码 MIT、数据 CC BY 4.0,数据集做了门控以防训练污染,完整跑一次约 1,004 次请求、800 万输入 token。值得跑一遍自家模型,看看它的品味值几分。