六天时间,一个匿名模型从"全网猜谜"走到"官宣开源",智谱这波操作值得整个行业复盘一遍。
8 月 20 日,一个叫 Ox Alpha 的模型悄悄出现在 OpenRouter 上:提供方只写着 "Stealth",免费、近无限量使用,1M token 上下文,定位编码与 Agent 生产负载。OpenCode 透露其背后算力容量高达每天 100 万亿 token。两天之内,开发者社区开始集体"破案"。
社区是怎么提前破案的
8 月 22 日,研究者用构造的非法请求触发服务端报错,拿到一条 Java 堆栈,暴露的内部类名直接对应智谱的 API 路由;错误码方言、30/30 次 tokenizer 探针也全部指向 GLM-5.3。最有说服力的对照是:同样权重的 GLM 模型放在 DeepInfra 上,报错格式完全不同——说明这份签名属于 API 运营方,而不只是模型本身。期间 Stripe CEO Patrick Collison 公开评价它"非常令人印象深刻"。
名字本身也成了线索:中国网友把 "Ox" 联想到今夏爆火的低成本动画电影梗,反向推测它有中国血统;而此前 OpenRouter 上的 Hunter Alpha、Healer Alpha 两款隐身模型,最终都被证实是小米 MiMo——"隐身发布"已经是一条被验证过的路径。
8 月 26 日,谜底揭晓
智谱上午先向 Bloomberg 确认 Ox Alpha 出自 GLM 系列,并预告权重当晚开放;当晚 7:42 正式命名 GLM-5.3-Flash。Bloomberg 报道称它已登顶 OpenRouter 用量榜,用量超过 DeepSeek 两倍,是该平台迄今最大的一次单模型发布。
规格方面:320B 总参数 / 18B 激活的 MoE 架构,原生多模态(文本、图像、视频),1M 上下文,权重以 MIT 协议上架 Hugging Face。API 定价 $0.15/$0.50 每百万 token(输入/输出),缓存输入 $0.03。
Benchmark 上,相对 GLM-5.2 提升最猛的是 Agent 能力:DeepSWE 63.4(前代 46.2)、AutomationBench 48.8(前代 26.2),GDPVal-AA v2 上超过 Claude Opus 4.8。但它并非全面登顶——GPT-5.6 Terra 在 DeepSWE(69.6)和 Terminal Bench(87.4)上仍然领先。
隐身发布为什么聪明
智谱在发布材料里说得很直白:先匿名挂在 OpenCode/OpenRouter 上收集真实反馈,等它成为"本周最受欢迎模型"之后,再以 GLM 品牌正式下场。用生产级流量免费压测前沿模型,再带着需求证明开源,风险和营销成本都远低于一场传统发布会。还有一个值得盯的细节:官方称整个预览期流量都跑在中国 AI 芯片上,推理栈做了 3 倍端到端优化——这是单方声明,但若站得住,意味着这个量级的 MoE 服务并不必然依赖 H100 集群。
所以呢:隐身免费午餐结束了,但 MIT 权重加 flash 级定价的开源 Agent 模型时代才刚开始。选型时记住一件事——自己跑 eval,发布方的成绩表永远挑对自己最有利的切面。