**大模型自进化一直卡在一个矛盾上:任务越开放,奖励越不可信;任务越容易验证,训练范围又越窄。** 阿里千问团队的新论文 Skill Self-Play,试图用“技能”把两头接上。 这套框架不是让模型随便出题。它由出题器、解题器和动态技能控制器组成:控制器先选择技能,出题器据此生成可验证任务,解题器作答;系统再根据失败样本、任务难度和有效性,扩充、剪枝或改写技能库,只保留接近模型能力边界的训练样本。技能只参与训练,最终模型推理时仍可直接靠提示词运行。 结果比概念更有说服力。Qwen3-4B 的工具调用综合分从 60.2 升到 66.7;Qwen3-8B 的逻辑推理从 23.6 升到 32.4;原本工具调用较弱的 Ministral-3-8B,则从 20.7 跳到 63.6。代码已按 Apache 2.0 开源。 我的判断是,这项工作的价值不只是又一种强化学习配方,而是把“技能库”变成可演化的训练基础设施。下一阶段模型竞争,可能不再只是谁喂的数据更多,而是谁能让任务、验证器和课程一起进化。