强化学习把大模型的推理能力抬了一整个台阶,但最有效的玩法 RLVR(Reinforcement Learning with Verifiable Rewards)有个隐形成本:每条训练 prompt 都要一个经过验证的正确答案。当模型要学的东西超过人类能可靠评判的范围,这种标注越来越贵、越来越稀缺。

自己给自己打分的死胡同

业界的替代方案是 self-rewarding RL——让模型给自己的输出打分。TTRL 用多数投票的自我一致性当信号,Intuitor 用自我确信度,RENT 用预测熵。这些方法有个共同的结构性缺陷:奖励信号永远出不了模型自己。自我强化会放大已有偏差、压缩回答多样性,最后走向输出同质化甚至训练崩溃。

Co-RL 的思路是把这个死结剪断:奖励永远来自同伴,永远不来自自己。

三步机制:采样、互评、独立更新

具体做法分三步。第一步,每个 agent 对同一条无标签 prompt 采样多个回答,约减成一个多数投票结果。第二步,某个回答的答案与同伴的投票一致就得 1 分奖励——一个 agent 永远不会给自己的监督目标贡献信号。第三步,GRPO 独立更新每个策略,agent 之间不共享参数、不交换梯度。

超过两个 agent 时,投票沿着有向环传递。三个模型 Qwen2.5-3B、Llama-3.2-3B-Instruct、Qwen3-1.7B 在同一个环里一起训练,分别提升 7.8%、6.0%、8.2%,全部追平或超过各自的有标签参考线。

多样性才是好老师

Co-RL 最有意思的发现是关于"谁配当老师"的:两个相似的模型犯同样的错,就会互相强化同样的错误答案。论文在 12 组基座模型对上测了训练前的错误重叠度(Cohen's κ):跨家族配对的 κ 全部 ≤ 0.42,同家族配对全部 ≥ 0.51,中间地带是空的。跨家族把平均重叠度从 0.53 压到 0.38,下游收益也按同样排序。

多样性通过三个通道注入:异构模型家族(架构、分词器、预训练数据都不同)、异构尺寸、改写训练样本(一个 agent 用原始 MATH 题目,另一个用 DeepSeek-V3 改写的同答案版本)。"Different family+" 配置在 7 个文本基准上拿到 49.3% 平均分,超过 GT-Reward 有标签参考线的 47.4%。

无标签追平有监督的完整跑分

以 Qwen2.5-3B 为骨干的完整成绩单:GSM8K 73.4→81.0,MATH500 56.6→66.6,AMC 28.9→36.1,HumanEval 39.0→65.8(Different family+ 配置)。多模态侧 4 个基准平均提升 2.3-7.2%。

两个额外的 ablation 值得注意。其一,把两个 TTRL 训练的模型做集成,分数反而低于自己最好的单模型(64.9%),而 Co-RL 集成达到 66.9%——问题不在集成,在训练。其二,在 CoMAS 自己的协议下,Co-RL 用一半的 agent 数、不要裁判模型,拿到 62.97% 对 58.94%。

训练动态也干净:四个规模上,self-rewarding 基线出现奖励崩溃、输出长度激增或中途发散,Co-RL 全程稳定。

所以呢

对训练侧的读者,这条路线的价值很直接:当可验证奖励的标注成本压住你的扩产节奏,同侪互评是一条已经跑通的无标签替代路径,而且 Apache-2.0 代码已开源(arXiv 2608.17253,GitHub)。更值得记住的是那个 κ 空隙:跨家族配对 ≤ 0.42 与同家族 ≥ 0.51 之间没有任何过渡——"找和你犯错不一样的同伴"不是玄学,是可提前测量的量。当行业还在争论合成数据会不会让模型越训越同质,Co-RL 给了一个可操作的答案:把彼此的分歧本身变成监督信号。