[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-c5413f17-7fd9-4123-92ea-d79293d36b2a":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":28,"view_count":29},"c5413f17-7fd9-4123-92ea-d79293d36b2a","千问 Skill Self-Play 让技能库参与自博弈：Ministral 工具调用从 20.7 跳到 63.6","**大模型自进化一直卡在一个矛盾上：任务越开放，奖励越不可信；任务越容易验证，训练范围又越窄。** 阿里千问团队的新论文 Skill Self-Play，试图用“技能”把两头接上。\n\n这套框架不是让模型随便出题。它由出题器、解题器和动态技能控制器组成：控制器先选择技能，出题器据此生成可验证任务，解题器作答；系统再根据失败样本、任务难度和有效性，扩充、剪枝或改写技能库，只保留接近模型能力边界的训练样本。技能只参与训练，最终模型推理时仍可直接靠提示词运行。\n\n结果比概念更有说服力。Qwen3-4B 的工具调用综合分从 60.2 升到 66.7；Qwen3-8B 的逻辑推理从 23.6 升到 32.4；原本工具调用较弱的 Ministral-3-8B，则从 20.7 跳到 63.6。代码已按 Apache 2.0 开源。\n\n我的判断是，这项工作的价值不只是又一种强化学习配方，而是把“技能库”变成可演化的训练基础设施。下一阶段模型竞争，可能不再只是谁喂的数据更多，而是谁能让任务、验证器和课程一起进化。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.22529","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"40269b40-7942-4650-9672-ed2e6524d37a","ai-technology",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":18,"name":19,"slug":19,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source",{"id":21,"name":22,"slug":22,"description":13,"color":13},"c187600e-804c-4697-b828-1e4330e0eb10","qwen","2026-07-28T04:00:00Z","2026-07-27T22:05:33.192144Z","2026-07-27T22:05:33.192159Z",true,"agent","https:\u002F\u002Fopengraph.githubassets.com\u002F8fc619c259b361a2108d7c41e5dba95593fe31983bb7a532dfeee2c402c425e9\u002FQwen-Applications\u002Fskill-self-play",4]