拆开 GLM-5.3 的「后训练工厂」:基座一字未动,靠环境合成与 1e-7 对齐撑起全部提升
8 月 14 日,Z.ai 发布 GLM-5.3。这条新闻最反常规的地方不是跑分,而是官方博客的开场白——「Scaling post-training is all we did for GLM-5.3」(对 GLM-5.3,我们做的只有扩展后训练)。基座与 GLM-5.2 完全相同:同样的 743B MoE,一个参数都没改,所有能力提升都来自后训练阶段。
冻结基座,是一笔工程账
重新预训练一个数百亿级模型需要数万 GPU、数月时间和巨额算力投入;而冻结基座意味着下游推理基础设施、算子优化可以零成本迁移,社区在上一代模型上的微调工作也完全兼容。当预训练参数规模的边际回报收窄,竞争重心就从「谁的参数多」转向「谁在后训练阶段训练得更好」。
支撑这条路线的是一个三件套技术栈(官方博客附了三个链接):
- IndexShare(论文 arXiv:2603.12201):高效长上下文处理;
- SAO(论文 arXiv:2607.07508):面向长程任务的 RL 算法;
- slime(开源仓库 THUDM/slime):大规模异步训练框架,训练侧用 Megatron、rollout 侧用 SGLang。
真正的瓶颈:不是模型,是环境
官方博客里最有信息量的一句话是:随着 agent 能力提升,扩展后训练的难度大量从模型转移到环境。一个有用的任务环境必须可执行、可验证、贴近真实专业工作——而且需要很多个,不是几个手工搭建的样本。
Z.ai 的解法是一条端到端的环境合成流水线:
- Research Agent 从真实工作中收集任务模式,转化为带多步依赖和隐藏状态的可运行长程环境;
- Judge Agent 逐一试做这些任务,验证它们真的可解;
- 合成验证器——注意,验证器在合成时接触不到参考答案;
- 用求解轨迹去发现并关闭奖励捷径(reward shortcut);
- 通过 oracle、no-op、unsolved-state 三重检查后,产出可直接用于训练的二元奖励。
这套流水线目前仍需要可观的人在环参与,官方也承认「让环境生成和验证更自主」是下一步。
slime:训练系统里的硬功夫
所有训练跑在 slime 上。它的设计把训练、rollout 和数据缓冲统一在一条数据流里——数学、代码、沙箱、验证器和长程 agentic 环境以数据生成的方式插入,而不是对训练循环的修改。这就是 GLM-5.2 到 5.3 能持续加环境、不用重建训练栈的原因。
本次迭代在算法侧加了 top-p mask、top-k 和全词表 OPD,以及提升训练-rollout 一致性的配置。最硬的数字是:训练与 rollout 两侧的平均 logprob 差异控制在 1e-7 量级,比之前的配置降低超过 99.99%。系统侧,本地存储成为额外缓存层,多教师 OPD 支持动态切换加预取——不用为每个教师常驻一个推理服务;再加上 router 与 slime 的联合调度和负载均衡,官方称长程编码 RL 的端到端训练吞吐提升超过 2.3 倍。
效果:跑分之外,看 token 账单
结果层面:Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 到 66.9,CyberGym 从 77.2% 到 84.5%(官方称超过 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%)。更值得看的是自建 Z.ai Code Bench 上的 token 效率:High 档 GLM-5.3 用约 50K 输出 token 达到 31.4% 准确率,超过 Claude Opus 4.8 用 120K token 达到的 29.5%——一半不到的成本,更好的结果。
真实世界同样有验证:与中国多个安全团队合作,经专家评审、筛选、去重后,模型在 269 个项目中识别出 2,436 个漏洞(107 个 Critical、990 个 High),最老的漏洞可追溯到 1981 年,平均已在代码库中存活 26.6 年,全部记录在公开台账 cvd.z.ai。权重将在发布两周后、完成安全评估与加固后公开。
所以呢
GLM-5.3 给行业的信号很直接:当基座参数规模收敛,「谁的环境工厂造得好、谁的 RL 系统跑得稳」成为新的分水岭。环境合成流水线 + 1e-7 级训练一致性 + 2.3 倍吞吐——这些不如跑分性感,却决定了下一次能力跃迁的成本和速度。下一次看到某家模型「突然变强」,值得先问一句:它的环境是怎么造出来的?
素材来源:Z.ai 官方博客、HappyRock 深拆(2026-08-16)