Skill-Use 基准揭示 Agent 短板:会做任务,不等于会用 Skill

Agent 生态正在把大量经验封装成 Skill:一个短描述负责提示适用场景,完整文档再规定操作步骤、可用工具和禁止事项。看起来,只要把正确的 Skill 放进工具箱,模型就能照章办事。但 8 月 5 日提交到 arXiv 的论文 Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses? 给出了更谨慎的答案:模型完成任务的能力,与它主动发现并正确使用 Skill 的能力,并不是一回事。

研究把“会用 Skill”拆成三关

论文关注的是渐进披露机制。Agent 一开始只能看到 Skill 的名称、简短描述和文件路径,必须先判断它是否相关,再打开全文并执行流程。研究者因此把能力拆成三个维度:

  • Trigger:是否主动读取了相关 Skill;
  • Compliance:读取后是否遵守规定的步骤;
  • Boundary:是否避开文档明确禁止的操作。

三项最终合成 SU 分数,而且只有触发 Skill 后,后续执行才会得到分数。这种设计刻意避开了只看最终答案的评测方式:任务碰巧做对,并不能证明 Agent 真的理解并遵循了操作规程。

79 个 Skill、177 个任务:领先配置仍不稳定

Skill-Use 收集了 79 个真实 Skill,配套 177 个可执行任务,覆盖九个领域。每个任务都放在隔离的 Docker 沙箱中,包含真实文件和完整工具权限;评测记录整条操作轨迹,再用逐项 rubric 检查动作与最终文件。研究团队还用遮蔽 Skill 的方式排除通用要求,并通过多 Agent 对抗审查检查任务范围和评分可验证性。

在八个模型与两套 Agent harness 上,论文报告的领先配置 SU 只有 0.613。失败不是单一问题:有的模型能识别 Skill,却执行时偏离流程;有的模型具备执行能力,却根本没有触发 Skill。更关键的是,更换 harness 后,绝对分数和模型排序都会变化。论文据此强调,Skill 使用能力由“模型 + harness”共同决定,不能只归因于底座模型。

预加载全文能救触发,但救不了执行

研究把原生渐进披露与“开局直接塞入完整 Skill”做了配对比较。预加载普遍提高 SU,主要原因是 Trigger 上升;但在两种模式都成功触发的样本里,执行质量差距很小。也就是说,全文提前出现,解决的是“模型没想到要打开文档”,不是“模型看完就一定照做”。

Skill 库规模实验也指向同一个入口问题。研究把库扩展到 1、10、20、30 个 Skill,加入干扰项后,主要增加的是“一个也不调用”,而不是选错 Skill。从单个扩到十个时下降最明显,之后变化趋缓。库越大,描述是否清晰、触发条件是否可辨识,就越像真正的系统设计问题。

半吊子照流程,可能比不用还差

论文还把触发 Skill 的运行与关闭 Skill 库的同任务基线配对。结果显示,SU 接近 0.5 时,Skill 对任务完成的影响才由负转正。低于这一水平,Agent 可能采用了指定工具或格式,却没有把流程执行完整,最后既没满足 Skill,也失去了模型自由解决问题时的完整性。

这给 Agent 工程一个直接提醒:安装更多 Skill 不是免费升级。真正需要优化的是触发描述、过程可观测性、禁区约束,以及 harness 如何展示和调用 Skill。模型排行榜也不能脱离 harness 单独解读。论文全文与实验边界可在 arXiv 原文 核对。

Skill 的价值不在“写进了多少知识”,而在 Agent 能否在正确时机读到它,并把最后一步也做完。