小模型圈这两周的主线是「2B 打 4B」,OpenBMB 现在把另一半故事也放了出来:MiniCPM5-2B 后训练烧掉的 RL 燃料——UltraData-RL-2609 数据集已完整开源。模型权重 9 月 7 日落地,数据集同日跟上,「权重 + 数据」整套放出,这种做法在端侧模型厂商里并不多见。
这份语料是 UltraData L0-L4 分层数据框架中的 L3 精炼层,专门服务 RL 阶段:85,995 条任务,全部是可验证奖励(verifiable reward)型——每条都带机器能判对错的 ground truth,不依赖 LLM 裁判的自由心证。
四个方向,每条都要可判
分布相当均衡:数学 32,412 条(37.7%)、代码 23,665 条(27.5%)、长上下文 18,046 条(21.0%)、STEM 知识 11,872 条(13.8%)。验证方式按域分化:数学与知识题比对标准答案;代码任务在测试用例上实际执行,stdin/stdout 逐例比对;长上下文则保证上下文一定支持答案。选择题、判断题、证明题、多小题与依赖图片的条目,在构建管线里被直接剔除——机器判不了的东西不进 RL。
六道工序,专治标签不可信
管线重心在第 4、5 阶段。第 4 阶段查奖励可靠性:LLM 裁判审查问答一致性,数学/知识答案由多个独立模型重解、按共识定标签,凑不出共识的直接丢弃,不猜。第 5 阶段做难度校准:在 RL 初始 checkpoint 上反复 rollout 估计每题通过率,已完全掌握的(通过率 1)删掉,可学习区间保留,通过率为 0 但标签确认有效的硬题也保留,交给在线动态采样;该阶段只改难度与采样权重,永不改参考标签。上游来源全部是公开数据集的加工重组:数学取 DAPO、DeepScaleR、DeepMath 的并集,知识取 OpenScienceReasoning-2,长上下文基于 HotpotQA、Qasper、MuSiQue 加长并补充自造数据,代码取 OpenCodeReasoning 系列加 HardTests。
效果实录与三处边界
数据集卡记录:JustRL II 实验设置下,AIME 2025 在约 300 个 RL step 内从 61 升到 81;消费该语料完成 post-training 的最终 checkpoint 在 AIME 2025 拿到 86.5(模型卡评测表),表内平均分 53.9,高于对比集中列出的 4B 级模型(最高 51.1)。配套 RL+OPD 阶段平均拉升推理与通用能力 10.96 分、agentic 能力 6.96 分。
边界同样写得明白:代码域只给测试用例不给沙箱,奖励要使用者自己算;难度过滤与在线采样权重没有存为发布字段;去污染只覆盖构建时已知的评测集,引入新 benchmark 前要重查。许可证还有个反直觉条款:Apache 2.0 之下明确禁止未经书面许可的原样转存、镜像与商业再打包——「开源」与「随意搬运」被切开对待。
对做小模型 RL 的团队,这份 188 GB 的语料是少有的可整条复用的工程参考:端侧 2B 的逆袭不只靠架构,更靠「每条奖励都可信」的数据纪律。下一个问题是,同样的管线搬到 agentic 数据上,还能不能维持这个验证密度。