8 月 14 日,智谱在 GLM-5.3 的发布文里写下一句承诺:"权重将在两周后发布,待安全评估与加固完成。"两周之期刚到,zai-org/GLM-5.3 就出现在了 Hugging Face 上——753B 参数、BF16 与 F8_E4M3 精度可选,模型 collection 显示一天前刚更新。承诺没有跳票(权重地址:https://huggingface.co/zai-org/GLM-5.3 )。

一场没有换底座的升级

GLM-5.3 最有意思的技术选择是:它与 GLM-5.2 用的是同一个 base model,所有提升全部来自 post-training。官方原话是"Scaling post-training is all we did"。

在预训练边际收益被反复讨论的当下,这是一个相当激进的实验:底座不动,靠环境扩展加 RL 把同一个模型再推一档。结果体现在编码与智能体基准上——Terminal Bench 3.0 从 4.6 跳到 28.3,DeepSWE v1.1 从 46.2 到 66.9,Agents' Last Exam 从 23.8 到 28.5;官方口径称其为"最强的开源权重编码模型",自家 Z.ai Code Bench 上相对 GLM-5.2 提升约 50%。以上均为厂商自报数字,未独立复现。

支撑这场后训练的是环境工程:任务不再是"编码练习题",而是数天量级的真实工程工作——模型拿到与工程师相同的工作环境,可以访问计算集群、存储系统、内部文档、代码库和实验结果,要求端到端诊断瓶颈、跑实验、交付可验证的加速。为此智谱建了端到端合成训练环境的 pipeline,judge agent 先尝试每个任务验证它确实可解,再产出足够可靠、可直接训练的二值奖励。开源的 slime 框架承载了整套 RL 扩展。

意外长出来的安全能力

发布文里最耐读的部分是"涌现的网络安全能力"。智谱本来只是往训练里加入了漏洞发现数据与环境,没料到能力随规模持续窜升:GLM-5.3 不再只识别孤立缺陷,而是能跨利用阶段推理、组织完整的利用链。

数字上(厂商自报):CyberGym 84.5,官方称其为该基准最佳结果,超过 GPT-5.6 Sol 的 83.6;ExploitBench 54.4,是 GLM-5.2(24.4)的两倍多。但在更贴近完整利用链的 ExploitGym 上,GLM-5.3 完成 105/130 个任务(2h/6h 预算),与闭源前沿模型仍有明显差距——官方自己承认"能力增长最快的区域,恰恰是落后最远的区域"。

真实世界的验证更硬核:与多家国内安全团队合作,模型在 269 个项目里识别出 2,436 个漏洞,其中 1,097 个中高危;最老的一个 1981 年就引入了,平均潜伏 26.6 年。目前 53 个已公开披露,其余在 embargo 流程中,全部记录在公开的 Z.ai Security Disclosure Ledger(cvd.z.ai)上。

权重落地之后

对开发者,这次上架意味着三件事。其一,模型卡列出了 SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth 的本地部署支持,还有 Ascend NPU 平台路线——国产算力栈被当作一等公民对待。其二,Hugging Face 页面显示已有 2 个基于它的量化版本跟进,部署门槛会快速下探。其三,注意它与 GLM-5.3-Flash 的分工:Flash 是 320B 总参/18B 激活、MIT 许可的原生多模态模型,本体 753B 则是纯文本旗舰,推理预算差一个量级,按需选型别拿错。

一点观察:当"换底座"的增益越来越贵,"同底座 + 后训练扩展"给出了另一条性价比曲线。GLM-5.3 用编码基准上 50% 的提升证明了这条路能走通,而权重公开让所有人都能亲手验证它到底走了多远——这或许才是开源承诺真正的价值。