过去两年,几乎所有生产级 LLM 都在用同一种方式生成文本:自回归,一个 token 接一个 token。这条路径把成本和延迟直接绑在推理深度上——模型想得越多,回答越慢、越贵。Inception 走的是另一条路:扩散式语言模型(dLLM),先生成整段草稿,再并行精炼 token。9 月 8 日,这家公司发布了 Mercury 2.5,官方称之为其迄今最强的生产级扩散模型。

核心规格:智能 +40%,1107 tokens/秒

数字相当密集:智能水平较 Mercury 2 提升 40%,官方定位与 GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 等「成本优化型」前沿模型同档;在广泛可得的 NVIDIA GPU 上跑到 1107 tokens/秒;上下文窗口扩到 260K tokens(新闻稿确认上一代为 128K);定价每百万 tokens 输入 0.20 美元、输出 0.75 美元,首发期直接打到 0.04/0.15 美元。能力侧补齐了可调推理、并行工具调用与 schema 对齐的 JSON 输出。官方还自称「据我们所知,这是迄今训练过的最大扩散语言模型」——厂商自述,不是第三方结论。

生产场景先于跑分说话

Inception 的训练方法论值得一提:他们明说这次的 eval 是用客户反馈和生产失败案例打磨的,不是只盯 benchmark。两个落地数字值得记:AI 电话公司 OpenCall 称切换后 P99 响应从「数分钟」降到 1 秒、P50 从 0.4 秒降到 0.2 秒以内;编码工具厂商 Augment Code 把上下文压缩迁到 Mercury 后延迟降 82%(约 150 秒缩到 27 秒)、成本降 90% 且质量不变。同期开启预览的还有 Mercury Voice(首 token 延迟低于 170ms)与 Mercury Router(用 dLLM 做模型路由)。

冷静的部分:还没有独立 benchmark

意大利媒体 tech-insider.org 的评测指南提醒:发布数天后 Mercury 2.5 仍无一份独立发布的 benchmark,1107 tokens/秒是官方自测数字;正确姿势是拿自己的负载实测。X 上的讨论也在做算术:按 Artificial Analysis 9 月 8 日速度榜(榜首约 221 t/s)粗算,1107 tokens/秒约为五倍——「若成立」三个字正是关键。

所以呢:如果你的 Agent 里塞满高频短调用——查询改写、重排、压缩、路由——dLLM 已经从论文走进了选型表的正式一列;但在自己压测出数字之前,「最快」两个字请先放在引号里。