一次说清:这台机器的注意力架构和 benchmark 真相到底长什么样
8 月 26 日,智谱(Z.ai)把上周顶着「Ox Alpha」匿名皮肤跑了一周的 GLM-5.3-Flash 开源上架。同一时间 SiliconANGLE、MarkTechPost 都做了同步报道。SiliconANGLE 的重点是「开源权重」,MarkTechPost 的重点是「Flash 价位和混合注意力栈」,今天这篇想做一件更难一点的事:把这台机器的注意力架构拆开,看 Z.ai 给的 benchmark 数字到底意味着什么,以及「接近 Opus 4.8」这种话在独立评分体系下还站不站得住。
架构:GLM 系列第一次用 KDA + NoPE 稀疏 MLA 混搭
GLM-5.3-Flash 不是一个 320B/18B 的常规 MoE,它把注意力机制拆成两段做了第一次「混搭」,这套方案在 MarkTechPost 的拆解里有非常清晰的描述。45 层语言模型,KDA 线性注意力层负责局部依赖,NoPE 稀疏 MLA 层负责检索全局相关 context。每个 token 路由通过 8 个专家,总专家数 288。原生 FP8 权重外加一个 MTP draft 层。
这套架构真正解决的问题是 1M 上下文下的检索瓶颈。智谱为此专门做了一个叫 IndexPool 的机制——把 indexer 的 key 向量分组做加权池化,把检索成本压下去。最终官方数字是「相对 GLM-5.3,attention 计算量减少约 3 倍,KV cache 缩小 4.4 倍」。第三个改动是 mHC(Manifold-Constrained Hyper-Connections)——约束梯度流过的拓扑,MarkTechPost 引用的官方说法是「相对 GLM-4.5,在相近总参数规模下,激活参数和层数都大约减半」。
直白讲:同样 1M context,显存占用从「几乎装不下」变成「一台 8 卡 Hopper 节点能跑」——这正是 vLLM recipe 上写「约 306 GiB FP8 权重,Hopper 及以上」的现实依据(vLLM recipe)。
Benchmark:官方数字漂亮,「接近 Opus 4.8」要看哪个分数
先把 Z.ai 自己给的核心数字摆出来,全部来自 8 月 14 日发布的官方博客(z.ai/blog/glm-5.3)。
- Terminal-Bench 3.0:GLM-5.3 = 28.3,Opus 4.8 = 21.1,Fable 5 = 33.7,GPT-5.6 Sol = 34.6
- DeepSWE v1.1:GLM-5.3 = 66.9,Opus 4.8 = 58.0,Fable 5 = 69.7,GPT-5.6 Sol = 72.7
- Z.ai Code Bench max effort:GLM-5.3 = 34.5%(约 75K 输出 token),Opus 4.8 落后,Fable 5 = 39.5% 仍第一
- CyberGym:GLM-5.3 = 84.5%,Fable 5 = 83.8%,GPT-5.6 Sol = 83.6%
- ExploitBench:GLM-5.3 = 54.4%,Fable 5 = 78.0%,GPT-5.6 Sol = 76.5%
Flash 这一档(Z.ai Code Bench v1.0 max):29.0 对 Opus 4.8 的 29.5,只差 0.5 分。听起来真挺接近。
但如果换成 Artificial Analysis 这个独立评分体系(artificialanalysis.ai/models/glm-5-3-flash),GLM-5.3-Flash 在 Intelligence Index v4.1.1 上拿到 57 分,Z.ai API 上跑出 48.7 输出 token/秒 和 1.52 秒 TTFT。57 分意味着它是「智能/价格比很强,但绝对智能水平还是 Flash 档」—— 这跟 Opus 4.8 不在一个段位。
真正的弱项:视觉
Flash 在 SiliconANGLE 报道中被标榜为「native 多模态」,支持图像和视频输入,但 MarkTechPost 单独点出了它的视觉短板的:在 BabyVision 和 MVbench 上落后 Gemini 3.7 Flash。换句话说,这个新模型的「1M context + 多模态」在文本和代码侧是真的好用,视觉部分还没有到能跟 Gemini 3.7 Flash 抢地盘的阶段。
价格与可触达性
- API:$0.15/M input、$0.03/M cached input、$0.50/M output(标准档),Z.ai 称在折扣档下能做到 $0.045/task
- GLM Coding Plan 三档(Lite $18 / Pro $80 / Max $168)全部铺开,配额是 GLM-5.3 的 3 倍
- 本地推理:SGLang、vLLM、TokenSpeed、KTransformers 全部支持
所以呢
这件事的真正信号,不是「又一个开源模型」。它的真正信号是:国产 Flash 档模型第一次把 1M 上下文 + 原生多模态 + MIT 开源 + 混合注意力栈,同时压在 $0.15 的 API 价位上。在「同等智能成本」的赛道上,智谱给出了另一条答案——不靠更小模型降本,而靠架构创新让 320B MoE 跑得起 Flash 价位。
至于「接近 Opus 4.8」—— 在 Z.ai 自己设计的 Code Bench 上是接近,在 Artificial Analysis 这种独立综合评分上还有明显距离。看哪个分数,决定你看到的是「旗舰级」还是「Flash 级」。