8 月 26 日,智谱把代号 Ox Alpha 的隐身模型正式定名:GLM-5.3-Flash。同一周内,这套模型已经在 OpenCode、OpenRouter 上顶着匿名皮肤跑出了全周热门,流量全数跑在国产 AI 芯片上。这件事的看点不在于又一个开源模型,而在于它把「320B 总参 / 18B 激活的 MoE Flash 模型」与「全栈跑在国产芯片」这两条线,第一次同时验证了可行性。
一份价格表带来的冲击
官方把定价压到了 $0.15/M 输入、$0.50/M 输出、$0.03/M 缓存输入。Artificial Analysis Intelligence Index v4.1.1 上,GLM-5.3-Flash 以 57 分拿到约 $0.045/任务(折扣后)的成绩——智谱的原话是「把过去只有 10 倍价格才能买到的智能,放到了 Flash 价位」。对 Agent Harness、批量任务、低成本 Coding 流水线来说,这是当下 OpenRouter / 自托管生态里少见的「真便宜」区间。
具体跑分方面,GLM-5.3-Flash 在 DeepSWE v1.1 上 63.4(GLM-5.2 是 46.2),在 AutomationBench v1.0.6 上 48.8(GLM-5.2 是 26.2),在 Z.ai Code Bench v1.0 max 档上拿到 29.0,与 Opus 4.8 的 29.5 接近。GDPval-AA v2 上 1773,高于 Opus 4.8 的 1582、GPT-5.6 Terra 的 1571、Gemini 3.7 Flash 的 1527。这是它真正卡进企业 Agent 工作流的位置。
但需要降级措辞:Terminal Bench 2.1 上 84.3,Opus 4.8 是 85.0、GPT-5.6 Terra 是 87.4;AutomationBench 上 Gemini 3.7 Flash 还是第一(52.3)。所以更准确的读法是——Flash 在 GDPVal / DeepSWE 这一档反超 Opus,在 Terminal-Bench / 通用 Coding 上仍落后闭源前沿一档,不是「全面第一」。
架构:把 Sparse 和 Linear 注意力缝在一起
Flash 的另一条主线是架构。GLM-5.3-Flash 在 GLM-5 系列里第一次引入混合注意力——线性注意力抓局部依赖、轻量索引器挑全局相关 context——同时配合 Manifold-Constrained Hyper-Connections (mHC) 改善 scaling 效率。配合 IndexPool 压缩索引器 4 把 key 向量合并成 1 把,1M context 的索引器延迟和内存压力被显著削减。
官方给出的 per-token 数据:相对 GLM-5.3(non-Flash),attention compute 降至 1/3.0、KV cache 缩到 1/4.4;在 GLM-5.3-Flash、GLM-5.3、DeepSeek-V4-Flash、Kimi-K3 这四档里,Flash 的 attention compute 最低。KV cache 仍略大于 Kimi-K3 和 DeepSeek-V4-Flash,还有进一步压缩空间。
总参数 320B、激活 18B、45 层,相对 GLM-4.5 系列(355B / 32B / 92 层)激活参数几乎减半、层数也减半。预训练用了 30T token 的多模态语料,基座在 LiveCodeBench-Base 上拿到 37.6(GLM-5-Base 是 34.4、DeepSeek-V4-Flash-Base 是 29.9)。这条路径告诉所有做 MoE 的玩家:稀疏 + 线性混合注意力 + 索引压缩,可以在总参数差不多的情况下,把激活参数砍到接近 Flash 价位,而不明显损失智能。
在国产芯片上跑出 OpenRouter 级别流量
Ox Alpha 那一周,官方明确说「所有流量都跑在中国 AI 芯片上」。Z.ai 的技术博客把栈摊开:节点内张量并行用于 Linear Attention 和 LM head,叠加 ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合 cache 量化、Layer Split;集群层用 Encode–Prefill–Decode(EPD)解耦,把多模态编码、prompt prefill、token 级 decode 拆成独立可扩 worker pool。
官方数字是:相对初始 baseline,端到端 serving 性能提升 3 倍,per-token 成本与主流 NVIDIA GPU 持平。这是一个比「性能提升」更值得看的声明——它证明 MoE Flash 模型在数万颗国产加速器集群上,可以支撑 OpenRouter 级别的流量分发,而不依赖 H100 / B200。
值得说明的是,这里的「国产芯片」和「NVIDIA GPU 持平」是 Z.ai 官方表述,来自博客原文,且 per-token 成本对比是同一硬件上「3× 优化后 vs 初始 baseline」+ 「与主流 NVIDIA GPU 持平」的口径,不是跨厂商全量基准。在第三方复现出来之前,这是 Z.ai 的工程声明,而非独立验证。
多模态首次作为 GLM-5 系列的一等公民
Flash 是 GLM-5 系列第一个原生多模态模型。文本、图像、视频同卡输入,Vision 不再是 bolt-on。在 Vision 评测里,OfficeQA Pro 拿到 62.4、CharXiv Reasoning w/ Tools 拿到 89.4、MVbench 77.8、MMVU 80.5;CharXiv 上 89.4 略低于 Opus 4.8 的 89.9,与 GPT-5.6 Terra 的 88.0、Gemini 3.7 Flash 的 88.7 相当。
更关键的是,Vision 被设计进 Coding 闭环。模型渲染自己的输出,发现布局错位,然后 refine——这种「self-visual judgement + test-time improvement」轨迹是用强化学习 + 环境反馈训出来的。OfficeQA Pro 那种「文档 + 表格 + 报表 + 会议截图」联合推理的任务,以及 ZCode 的 Browser Use / Computer Use,都依赖这条原生路径。
个人评论:Flash 价位的国产化推理链开始闭环
GLM-5.3-Flash 真正值得记住的,不是「又一个开源 MoE」,而是三件事同时成立——Flash 价位的 $0.15/$0.50 API、320B-A18B 的 MoE 架构、原生多模态和 Coding 闭环——并且整套 stack 在国产芯片上跑出了可比 NVIDIA 的单 token 成本。这条路径如果被任何一家中国 LLM 实验室跑通,意味着「前沿模型 + 国产算力 + Flash 价位」可以同时成立,而不只是三选二。
但也要清楚边界——$0.15/$0.50 的价格、3× serving 提升、与 NVIDIA 持平的 cost-per-token,都是 Z.ai 官方表述,没有独立 benchmark 复现;在 GPT-5.6 Terra、Gemini 3.7 Flash、Opus 4.8 都已经把 Terminal Bench 和 BabyVision 拉到 70+ 的当口,Flash 想拿「第一」还需要更难的真实项目压测。开发者短期实操的结论也很简单——Ox Alpha 的免费午餐结束,OpenRouter 路由请切到 z-ai/glm-5.3-flash 或自托管,自己跑自己的 A/B;长期来看,稀疏 + 线性混合注意力 + 国产芯片 serving 这套组合,很可能是接下来半年 MoE Flash 模型的标配模板。
参考资料:Z.ai GLM-5.3-Flash 官方发布页、explainx.ai GLM-5.3-Flash 详解、Hugging Face 权重。