9 月 22 日杭州云栖大会,阿里 MaaS 业务线宣布了一个叫「Prime 模式(优速模式)」的服务档位,并在价目表上放出一个新模型 ID:qwen3.8-max-prime。次日,GLM 5.3 Prime 登上 OpenRouter 模型列表。一周之内,两家中国头部开源阵营的旗舰模型都多了一个「Prime」后缀的兄弟 SKU——但它们都不是新模型。
Prime 是什么:同一权重,换一条快车道
阿里文档把 Prime 模式描述为面向「输出速度敏感场景」的通道——AI 编程助手、多步 Agent 推理、实时对话——收益写得直白:TPS 提升到标准 API 的 1.5-2 倍。没有新参数可设,把 model 字段换成 Prime ID,就走上了快车道。文档同样明确说了什么没变:「模型支持的能力和使用限制与原模型相同」——没有更大的上下文、没有更强的推理模式、没有额外的工具面。
OrcaRouter 的核查给出了干净的对价:国际价目卡上 qwen3.8-max-prime 输入 $3.301/百万 token、输出 $9.902,标准档是 $1.65/$4.951——输入输出两条线都是精确的 2.0 倍,不是四舍五入的巧合。中国区价目卡同样维持 2 倍:¥24/¥72 对 ¥12/¥36。GLM 5.3 Prime 更干脆:$2.80/$8.80,恰好是 GLM-5.3 本体 $1.40/$4.40 的两倍,连缓存读都从 $0.26 翻到 $0.56。
值得注意的是,GLM 5.3 Prime 是个平台侧产品:Z.ai 自己的文档、模型总览和价目页都查不到 Prime 这个 SKU,权重方的自加速档是另一条线上的 GLM-5.3-FlashX(9 月 18 日上线,$0.37/$1.25)。OrcaRouter 的分析说得直接:智谱 8 月发了一个模型,9 月市场把它包装成四种价格在卖——Prime 是其中最贵、也是纸面痕迹最薄的一种。
卖的不是智能,是延迟
这波 Prime 档的实质,是把推理产能做成了可独立定价的商品。当模型能力在 benchmark 上趋同,「更快送达」本身变成了差异化卖点。定价逻辑也自洽:对人类在屏幕前等 token 的场景——自动补全、聊天回合、有人盯着的代码编辑循环——按速度区间上限算,付 2 倍价钱买一半时间,每秒延迟的账是平的;按区间下限算,是用约 33% 的溢价买速度。厂商赌的是你的负载恰恰落在对延迟最敏感的那一段。
阿里还藏了一个容易被略过的细节:Prime 文档写明,当用量达到限流阈值时,只要平台还有富余资源就不会被限流——这是「软顶+硬底」的结构,对一条串行发几十次调用的 Agent 链路,尾延迟的确定性比标称 TPS 更值钱。
但 1.5-2 倍是厂商自述
诚实的缺口在这里:两家 Prime 档的吞吐数字都是厂商在自家条件下给出的,目前找不到独立的 Prime 模式测量——Artificial Analysis 的表格里没有 Prime 行。而基础档的独立测量并不算亮眼:GLM-5.3 约 61 token/秒的输出速度低于同类约 67 的平均线;Qwen3.8 Max(0902 构建)在 AA 榜上的 Intelligence Index 为 45、每任务成本 $5.41。另一个隐藏成本是推理档位默认拉满:一个以最大努力推理的快车道,遇到难题时瓶颈是模型决定生成多少 token,而不是生成速率——先把 effort 调下来,可能比付 2 倍加速费更有效。
缓存读翻倍同样值得警惕。Agent 负载的账单大头恰恰是缓存读——系统提示词、工具定义、不断增长的对话记录每轮都要重读一遍。快车道连这条线也翻倍,指望「缓存打得勤所以实际更省」并不成立。
所以呢
挑模型的决策框架变了:过去比的是 benchmark 分数,现在还得看 rate card 和秒表。Prime 档的出现说明推理产能本身已经开始档位化——同一份权重,标准价、加速价、自托管价,GPU 时间正在变成一种按延迟分级定价的期货。下次看到「新模型发布」,先查查它是不是只是旧权重换了条车道。