GLM-5.3:只靠后训练把 743B 基座打成新 SOTA,网络安全的"涌现"打了 Z.ai 一个措手不及

一句话摘要:Z.ai 用同一份 743B 基座、只升级后训练栈,把 GLM-5.2 推进到 GLM-5.3——长程编码与网络安全两个维度同时跨入 SOTA 区;但这次最大的新闻,是 Z.ai 自己都没预料到的"涌现"。


背景:从 5.2 到 5.3,基座一字未动

2026 年 8 月 14 日,Z.ai(智谱的海外品牌)正式推出 GLM-5.3。最大的反常识点是:基座模型与 GLM-5.2 完全相同——同样 743B 参数,同样架构,同样权重。Z.ai 在官方博客里直接说,"Every gain comes from post-training"。

支撑这次升级的,是 GLM-5.2 时代搭起来的三块基础设施:

  • IndexShare:处理长上下文的高效注意力机制
  • SAO(Stale-Aware Optimization):用于长程任务的强化学习算法
  • slime:Z.ai 开源的大规模异步 RL 训练框架(训练端跑 Megatron,推理端跑 SGLang)

过去一个月,团队就在这块底座上做加法:更多任务环境、更多环境类型、更长训练时长。从结果看,这种"环境规模换能力"的路线非常有效。

编码维度:长程任务涨幅最大

GLM-5.3 在编码类基准上的跃升呈现一个清晰特征:任务越长,涨得越凶

几个关键数字:

  • Terminal-Bench 3.0:4.6 → 28.3(超过 6 倍)
  • DeepSWE v1.1:46.2 → 66.9
  • Agents' Last Exam(CLI 版):23.8 → 28.5
  • FrontierSWE:67.5 → 78.1
  • GDPval-AA v2(覆盖 44 个职业):1508 → 1769

在自家 Z.ai Code Bench 上,GLM-5.3 相对 GLM-5.2 提升 50%。Max effort 下,以约 75K 输出 token 拿到 34.5% 完成率,而 GLM-5.2 要 96K token 才打到 23.4%。High effort 下,以约 50K token 拿到 31.4%,超过了 Claude Opus 4.8 用 120K token 拿到的 29.5%——用更少 token,跑赢闭源旗舰

当然,Claude Fable 5 在 Max effort 下依然领先(39.5%),而 GPT-5.6 Sol 在 Terminal-Bench 3.0 上仍以 34.6% 略压 GLM-5.3 的 28.3%。

网络安全:"涌现"打了 Z.ai 自己一个措手不及

这才是 GLM-5.3 真正让行业意外的部分。

Z.ai 在博客里直白承认:原本只是想"让模型找漏洞更准"。他们往训练 mix 里加了漏洞发现数据和对应环境,期望看到的是"更会找漏洞"。结果是,能力不止于此

"What surprised us was how quickly the capability continued to develop as training scaled." ——Z.ai 官方博客

具体的越级表现:

  • CyberGym(白盒源码漏洞发现):77.2% → 84.5%,超过 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%),位列榜首
  • ExploitBench(需要更深层推理的真实漏洞利用):24.4% → 54.4%,翻倍以上
  • ExploitGym(在时间预算内完成的利用任务数):2 小时内 29 → 105,6 小时内 39 → 130
  • Mythos 5 在 ExploitBench 上仍以 78.0% 领先,在 ExploitGym 上 2h/6h 分别完成 181/247 任务

Z.ai 给出的判断是:任务离"真实利用链"越远,涨幅越大;越深、利用链越完整,涨幅越夸张。换句话说,模型不只是"找到了 bug",而是开始形成跨阶段的完整利用计划

更值得玩味的是这种增长分布:能力增长得最快的地方,恰好是 GLM-5.3 与闭源前沿差距最大的地方。CyberGym 上 GLM-5.3 已经超车,但 ExploitBench 上还差 Mythos 5 约 24 个百分点,ExploitGym 上 Mythos 5 的完成数仍是其近两倍。

真实世界验证:269 个项目、2436 个漏洞、最早可追溯到 1981 年

为了检验这些能力是否过拟合在 benchmark 上,Z.ai 自 GLM-5.2 起就与中国若干安全团队合作,让模型在真实代码库上找漏洞

经过专家复核、筛选、去重后的统计:

  • 269 个开源项目
  • 2436 个漏洞发现
  • 其中 1097 个为中/高危
  • 覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用、网络协议
  • 最早的一个漏洞可追溯到 1981 年,平均每个漏洞潜伏 26.6 年才被发现

Z.ai 为此专门搭了 Security Disclosure Ledger 公开披露台账,实时跟踪披露进度。截至发稿,53 个已公开、2383 个仍处于披露前阶段。

slime 框架:把 2.3× 训练吞吐喂进去的"水电煤"

上述所有结果都跑在 Z.ai 开源的 slime 框架上。核心设计是训练、rollout、数据 buffer 跑在同一条 dataflow 上,让 RL 环境的接入变成"数据生成"而不是"重写训练 loop"。

这次同步升级的两个维度:

  1. 算法侧:加了 top-p mask、top-k 与 full-vocabulary OPD、以及改进训练-推理一致性的 R3-style 配置。训练-推理一致性评估里,平均 logprob 差异被压到了 1e-7 量级(相对之前降低 99.99% 以上)
  2. 系统侧:本地存储成为额外缓存层、多教师 OPD 不再需要长跑推理服务、长程任务的端到端训练吞吐提升 超过 2.3×

换句话说,GLM-5.3 的能力不是基座换来的,是"环境 + 算法 + 系统"三件事同步加码换来的。

怎么用 + 一个"坑"

  • 已在 Z.ai API 与 GLM Coding Plan 全面开放
  • 支持 Claude Code、OpenCode 等主流 coding agent harness
  • 权重两周后公开,需先完成安全评估与硬化
  • API 改动:GLM-5.3 不再支持 ,统一为 + 。迁移代码若没改这个,请求会直接失败
  • GLM Coding Plan 改成按点数计费,14:00–18:00(UTC+8)工作日为高峰时段,非高峰 token 消耗打 5 折

个人评论

GLM-5.3 给行业留下的最大问题不是"GLM 5.3 有多强",而是:

  1. 后训练规模化是否还有边际收益? 同一个基座 743B 上,Gym 类基准 2 个月涨这么多——这意味着我们之前对"基座能力决定上限"的判断可能是错的,RL 环境规模和质量的曲线还很陡
  2. 涌现式网络安全的"安全悖论":模型越来越会找漏洞,这正是 Anthropic Mythos 5 严格限制发布的原因。Z.ai 选择"先在线开放,2 周后再发权重",并搭了公开披露台账——这条路线如果跑通,可能是开放模型在 cyber 维度上第一次把"披露流程"作为一等公民
  3. Cyber 能力的代差分布:Z.ai 在博客里自己点出的现象——"能力增长最快的地方,就是差距最大的地方"——意味着开源 vs 闭源在 cyber 上的差距不会自然收敛,只会按任务的"实战深度"重新分布

短期看,这对做应用安全、做 CI 修复、做代码审计的团队是个明确信号:长程 Agent 已经在 benchmark 上接近闭源前沿,产品化窗口期可能是接下来这 2-3 个月。

长期看,这次发布最大的受益者可能不是任何一家模型厂商,而是所有用了 GLM-5.2 的产品——后训练的可堆叠性,意味着我们已经可以从一份"足够好的基座"上,反复用 RL 环境把它推到新位置,而不必每次都烧一遍预训练。

参考资料: