开源推理引擎 vLLM 发布了 v0.28.0 版本(2026 年 8 月 26 日),这个包含 584 项提交、270 位贡献者(其中 76 位是新面孔)的版本,最大的主题只有一个:让 Kimi-K3 跑得更便宜。作为部署最广泛的开源 LLM 服务引擎之一,vLLM 每个版本的取舍,基本就是推理侧真实需求的一份实时快照。
Kimi-K3 全栈优化:省钱是主线
发布说明里,Kimi-K3 的性能推进占了最大篇幅,而且是跨层的组合拳:
- Decode Context Parallel(DCP):解码阶段的上下文并行,把长上下文解码负载摊到多卡;
- 融合 FlashKDA decode/prefill 内核、SiTU 激活支持 MegaMoE、GEMM-RS 序列并行;
- 合并 all-gather 通信:内核级加速 1.5~3 倍;
- 自适应投机 token 预算:DSpark 场景下首字延迟(TTFT)改善约 60%;
- 可选共享专家分片:每张 GPU 省下约 17 GiB 显存;
- Kimi-K3 还能在 ROCm 上通过 V2 model runner 运行。
这组数字都出自官方 release notes,是工程口径而非营销口径:每卡省 17 GiB,意味着同一批卡能塞进更多副本或更长上下文;TTFT 改善则直接映射到终端用户的等待体感。
DeepSeek V4 与其他亮点
DeepSeek V4 侧,稀疏 MLA 端到端跑通(覆盖普通解码、MTP、DSpark 投机解码),AMD Quark NVFP4 量化、gfx11/gfx950 的 ROCm 支持一并落地。基础设施层面:KV 缓存新增磁盘卸载档位,E/P/D 分离式部署进入 Model Runner V2,批处理默认 token 上限从 8192 提到 16384。新接入的模型包括 Muse Glimmer、Ling 3.0 Flash(含 FP8 与混合 MXFP4 专家变体)、Dots3 NOTE、Interns2mobius。破坏性变更要注意:bitsandbytes 迁出为独立插件,Transformers 依赖升到 5.15.0。
为什么值得留意
vLLM 是大多数自托管团队的现实默认选项,它的优化优先级就是社区真实部署需求的排序。Kimi K3 和 DeepSeek V4 这两个来自中国团队的开源模型占据一个版本的头两条,说明它们已经跨过"发布"阶段、进入大规模实际服务——开源模型的竞争,正在从发布会转移到每 token 成本。(完整改动见 GitHub release notes)
所以,如果你在自托管开源模型,这个版本值得直接升;如果还在观望中国开源模型的落地密度,vLLM 的提交记录比任何发布会都诚实。