编程 agent 的「技能」从哪来?过去有两条主流路:让 agent 在真实环境里摸爬滚打,把交互轨迹沉淀成技能;或者从文档里抽取操作说明。前者要付出昂贵的交互成本,后者缺乏可执行证据、真假难辨。9 月 4 日挂上 arXiv 的一篇论文(arXiv:2609.05571)给出了第三条路:直接从源代码合成技能。这项来自蚂蚁国际(Ant International)的工作,已登上 Hugging Face Daily Papers 9 月 21 日榜单的第一位,拿到 86 个赞,由论文一作亲自提交。
方法:看不见源码的「盲态重建」
Code2Skill 流水线分七步:先给解析出的源代码单元(函数、方法、命令入口、文件级组件)打分,挑出有复用价值的程序性知识;再抽取成三类带类型的技能记录——原子操作、组合流程、常见模式。核心验证环节是「盲态重建」:模型只拿到技能描述和接口,看不到源码本体、仓库名和文件路径,要凭描述把代码重新写出来;随后由独立的等价判定环节对比源码与重建代码,裁决阶段还会区分「技能本身站不住」和「重建失败」两种情况,避免误杀合格技能。全部通过才计入技能库,并带上工作流、边界、来源与证据四类元数据。
数字:百万条记录与 72 组配对评测
论文报告的规模相当可观:19769 个热门且活跃维护的 GitHub 仓库,最终产出 1006822 条合格记录。效果上,检索接入这些技能后,模型在 9 种模型设置、8 个基准共 72 组配对评测中平均提升 11.7%,57 组胜出;与轨迹合成的技能库在 7 个共享基准上对比全部占优,说明仓库挖掘的技能在 agent 还没攒够交互经验时就能用。更值得注意的一组数字:从 AI 生成代码里合成的技能,通过率 93.50%,人工写出的代码是 93.00%,几乎持平——意味着随着 AI 写的代码越来越多,这条管线可以跟着一起膨胀,不会遇到素材枯竭。
冷水:判定不是证明,代码也还没开源
GitHub 仓库的 README 写得很直白:判定环节「是 LLM 一致性检查,不是程序等价性证明」。也就是说,百万条记录的「合格」标准仍然是模型说了算,不是数学意义上的验证。另一个现实是仓库状态:目前是 pre-release,只有 3 个 commit,没有附许可证,README 明确写着「还不是一次公开的开源发布」。真正开放的是配套数据集 DeveloperSkills-Code2Skill,已放在 Hugging Face 上,论文一作也在评论区给出了链接。想复现整条流水线的人,眼下只能等。
意义:技能获取从攒经验变成挖资产
这项工作把「技能获取」从经验积累重构为资产挖掘:GitHub 上沉淀的海量代码,本身就是人类程序性知识最大的现成载体,现在有了一条可验证(尽管验证者仍是 LLM)的批量提取路径。对蚂蚁国际来说,这是 Ling 系列 Agent 模型之后在 agentic 基础设施上的又一次下注。至于 LLM 判定的可靠性天花板在哪里,恐怕要等第三方在真实 agent 工作流里复现之后才有答案——这也是所有「合成数据 + 模型自证」路线共同悬着的问题。
参考:arXiv:2609.05571(arxiv.org/abs/2609.05571)、GitHub ant-intl/Code2Skill、数据集 huggingface.co/datasets/ant-intl/DeveloperSkills-Code2Skill