9 月 21 日,小米把 MiMo-V2.6 系列的强化学习权重传上 Hugging Face,第二天 UltraSpeed 服务层上线,从无日期、无定价、无 API 到全部就位只用了约 48 小时。这一周里真正值得注意的不是又一家厂商发了万亿参数模型,而是它把「推理速度」单独拿出来标了价:同样的权重,十倍的价格,换来大约十倍的输出速度。
同一权重,两种卖法
UltraSpeed 不是小模型、不是蒸馏版,也不是重新训练的版本。小米官方描述它就是旗舰 MiMo-V2.6-Pro 的快速版,基于同一个 1T checkpoint 构建,质量与原版一致。第三方目录与 OpenRouter 的页面也是同样的口径:同 checkpoint、同 1M token 上下文窗口、同文本/图像/视频/音频原生多模态输入。发生变化的是服务侧——batching、投机解码、硬件配额、并发限制,这些介于权重和你的 HTTP 请求之间的工程。一个服务优化变体的存在,说明小米相信有一批买家愿意为 token 延迟付比 token 本身更多的钱;它不说明模型变强了,也不说明权重变了。
十倍速度的两种说法
小米官方材料声称 UltraSpeed 达到标准 Pro 服务的「最高 20 倍」输出速度;而 OpenRouter 与多家第三方目录在同一天的描述是「约 10 倍」。两个数字同时在流通,没有人公布过能调和它们的测量。诚实的读法是:「最高 20 倍」是厂商在未指明条件下的上限,大概率是有利 batch size 下的最好情况;「约 10 倍」是目录愿意断言的典型值。在有人公布特定并发水平下的逐请求延迟分布之前,真实倍数应视为一个较宽区间。方向没有争议:这个层级确实明显更快,而且定价也确实按「快」来收钱。
算一笔交互循环的账
价格比与速度比几乎对齐:输入 $4.35/百万 token、输出 $8.70/百万 token,对比标准 Pro 的 $0.44/$0.87,输入约 9.9 倍、输出整整 10 倍。这笔账怎么算,完全取决于延迟附着在什么上。批处理任务——离线文档处理、评测、数据集生成——延迟几乎一文不值,标准 Pro 通道是显然的选择。但交互式 Agent 循环里每一轮都卡着下一轮,延迟会复利:30 步的 Agent 运行中,10 倍速的模型端到端不是 10 倍速,但它是「用户等得下去」和「用户放弃」的区别。OpenRouter 的实测数据可以佐证需求真实性:UltraSpeed P50 吞吐 107 tok/s,调用方前五名是 Kilo Code、Hermes Agent、omp、Cursor、pi——清一色编码 Agent 与 Agent 框架,单 Kilo Code 一家就送来 20.2B token。
权重照旧 MIT,服务另算账
小米对 MiMo-V2.6 RL 权重挂的是 MIT 许可证,技术报告与部署说明随包发布,还开源了 RL 训练环境与代码。这比一次 API 发布披露得更多。但 MIT 标签只覆盖已发布的权重:UltraSpeed 是托管服务,受服务条款而非权重许可约束。在自己硬件上跑这份 checkpoint 的权利,和转售别人对它的加速托管的权利,是两种不同的权利,只有前者带着 MIT 标签。对想压成本的人,答案一直没变:权重可以下载,标准 Pro 通道 $0.44/$0.87,是调用 1T 级模型最便宜的方式之一。
值得盯的是三件事:独立并发延迟测量会告诉我们真实倍数靠近 10 还是 20;UltraSpeed 的第一次价格调整会告诉我们这是永久溢价还是首发定价——以 10 倍起价的层级很少停在 10 倍。对读者来说,问题其实很简单:如果你的产品就是墙钟时间,买它;如果你期待的是更好的模型,别买。速度层卖的是时间,不是智能。