10 月 5 日,隐身很久的 Reflection AI 交出首个开放权重模型 Beam:501B 总参数的稀疏 MoE,每 token 只激活 23B,主打编码、推理与智能体任务,权重本月内以 Apache 2.0 放出,目前还在最后红队评测。跑分之外,这家英伟达支持的初创公司在官方博客里写了一份相当少见的「RL 基建说明书」——把强化学习跑到 1 亿条 rollout 的规模,背后是一整套训练工厂。

先看规模:1 亿 rollout 意味着什么

官方口径:RL 阶段动用 10,500 张 NVIDIA GB300 连续训练 4 周,生成超过 1 亿条 rollout,单条最长 256K token 上下文,训练与评分共消耗约 13 亿个沙箱,环境池接近 100 万个,全程平均维持 11 万条并发 rollout。Reflection 自称这是开放实验室公开记录里规模最大的 RL 训练之一——注意这是官方说法,目前没有第三方复现。

预训练同样不小:6,144 张 GB300 NVL72 不到 4 周吃完 23.8 万亿 token,官方称训练有效时间占比(goodput)后期达到 92.3%,全程只做了 9 次半自动回滚。

异步 RL 的真难题:一天前的数据还能不能学

Beam 用全异步策略梯度训练。规模一大,策略过期(staleness)就是头号不稳定来源:一条长 rollout 里,不同 token 可能出自不同版本的权重,越早的 token 相对当前策略越旧,训练与推理引擎的数值差异还会放大这个问题。Reflection 的做法是给每个 token 标记生成它的权重版本,让算法显式处理过期样本——官方展示的极端情况是,学习落后当前策略 107 个版本(约一天)的数据,数值依然稳定。

配套细节全是工程活:新权重推到整个推理集群,中位只要约 12 秒——先跨机架走 RoCE、机架内走 NVLink 的层级分发,比每个副本各自拉权重少了 75% 的跨机架流量,全网更新快 2.2 倍;训练期间 71 次推理侧故障全部不中断训练任务,中位 8 分钟恢复,损失只占推理 GPU 分钟数的 0.02%;推理与训练的 GPU 配比在 3.9:1 到 5.4:1 之间动态调节,训练器在同一训练谱系里换过 5 种 mesh 配置而不丢状态。沙箱侧峰值 17 万并发,平台累计处理超 10 亿次创建请求,横跨 20 多个集群、两个云、四个区域,90% 的新沙箱 10 秒内就绪;动态 packing 让训练 batch 平均保持 99.99% 填满,平均 rollout 长度涨了近 70%,单卡训练吞吐却只下降 1.5% 以内。

成绩单与真实位置

按官方跑分,Beam 在 AIME 2026 拿 97.8,GPQA Diamond 90.5,Terminal Bench 2.1 拿 80.1,SWE Bench Pro v2-Hard 77.2。但放进开源竞技场看更直白:DeepSWE v1.1 上 Beam 44.4,基本追平 GLM 5.2 的 44.0,落后 Qwen 3.8-Max(51.0)、GLM 5.3(61.0)、Kimi K3(68.0)与 DeepSeek V4.1 Flash(74.2)——中文报道普遍把这一点读作「仍落后中国头部开源模型」。

Beam 主打的是效率:官方称对标 GLM 5.2 档位的推理成绩,推理算力只需其 1/3 到 1/4;对比 2T+ 参数级的 Qwen 3.8-Max,每 token 推理开销显著更低。它不做最强,做每块钱买到的智能。

所以呢

权重开源后人人可下载,但让 RL 稳定吃下 1 亿 rollout 的那套平台——token 版本化、12 秒权重分发、17 万并发沙箱——是组织出来的工程能力,不是 checkpoint 文件。模型会开源,工厂不会。对同样在卷 MoE 和智能体的团队来说,Beam 这份账单的启示比跑分更硬:下一代能力的分水岭,可能就在谁先把 RL 工厂建起来。