自主科研 agent 的能力上限,通常被归结为两件事:模型底座够不够强,harness(规划、执行、记忆、验证的外围工程)写得好不好。BAAI 团队 9 月 2 日挂在 arXiv 上的论文 Repo-To-Skill 提出了第三块拼图:操作知识(operational knowledge)——「知道一个方法」和「把一个方法跑通」之间那段 know-how。这些知识并不缺,它们躺在仓库和论文里,只是写给人读,而且大到没法在任务执行中现场加载。论文的解法,是把它们蒸馏成紧凑、经过验证、可复用的技能。

DisCo:一个会自己造技能的科研 agent

论文提出的 DisCo 是 skill-powered 的研究 agent,既造技能也用技能。蒸馏分两种互补形态:task-agnostic 把领域里最常用的仓库整体浓缩成可复用技能;task-oriented 针对具体任务现场生成所需技能。前者跑遍开源生态的产出,就是 AREX-Skill 库:5000+ 个经过验证的可执行技能,来自 1000 个常用 ML 仓库,组织成 20 个领域、178 个能力族。这个库 8 月 3 日首发时只覆盖 170+ 仓库,8 月 27 日刚扩到 1000 仓库与 5000+ 技能;仓库以 Apache 2.0 开源,但每个技能另有独立许可,使用前需单独检查。

固定变量后的四项基准

论文的关键实验把 GPT-5.5 底座、研究 harness 和下游执行预算全部固定,只切换 agent 有没有技能。GitHub README 给出的对比表(标注为 Codex 与 Codex + AREX-Skill):

  • MLE-bench(75 个 Kaggle 竞赛,任意奖牌率):31.11% → 72.89%,相对提升 134.3%
  • PaperBench(20 篇论文复现):29.45 → 39.59,+34.4%
  • FrontierCS(188 个 Agent Track 任务):70.63 → 77.14,+9.2%
  • PassNet(200 个编译 pass 优化样本,AS 分):1.343 → 1.531,+14.0%

论文对增益的解释:技能提供可复用的流程、检查点和恢复路径,让 agent 少走昂贵的无引导试错,把更多预算花在实验和验证上;且任务越难,优势越明显。

技能长什么样

每个技能以 SKILL.md 为核心,配 references/ 与 scripts/,写清适用时机、跑什么、怎么验证、失败如何恢复。运行时路由器先把请求收窄到领域/能力族/仓库/工作流,agent 只加载命中的分支——渐进式披露,避免 5000 个技能撑爆上下文。DisCo CLI 以 npm 包发布(v0.2.1,需 Node.js 22.19+),技能可直接导入 Codex、Claude Code、Pi 等编码 agent。

我的看法

134.3% 是相对提升,基数是 31.11%,读数字时要冷静——但在 MLE-bench 这个成熟基准上,奖牌率从 31% 跨到 73% 依然是实打实的变化。更值得注意的是路径:不改底座、不改工作流,只往固定配置里补「蒸馏过的操作知识」,知识本身成了新的性能杠杆。在算力焦虑的当下,这是一条便宜得多的路线。技能库的蒸馏流水线(圈定能力、证据落地、构建技能图、验证精修)若能复制到其他领域,GitHub 上二十多年积累的仓库就成了 agent 可开采的「肌肉记忆」矿藏。需要提醒的是,四项对比数字均为团队自报,期待独立复现。论文:https://arxiv.org/abs/2609.02749