如果你管过线上大模型服务,大概率遇到过这种尴尬:流量高峰要紧急扩容,新拉起的推理实例却卡在加载权重和捕获 CUDA 图上,一分多钟才 ready。SGLang 8 月 22 日发布的 v0.5.18 把这个问题当成了头号目标——合并 212 位贡献者的 710 个 PR,把冷启动时间砍掉近三分之二。

冷启动:84.8 秒压到 35.6 秒

核心改动叫 overlapped checkpoint staging:权重分页从存储加载,不再和 CUDA graph capture 串行等待,而是重叠执行。Qwen3-32B 在 H100 上,启动比串行加预取快 8.6-11.7%,对比默认路径快 2.38 倍——84.8 秒压到 35.6 秒,开启只需一个参数:--startup-weight-load-mode overlap。对弹性扩缩容和 Spot 实例场景,这是实打实的成本项。

解码路径上的微雕

TP LMHead 的 allgather 加 scatter 两步,在纯 DP 注意力下合并成一次 all-to-all:DeepSeek-V4-Pro 在 B200 上解码,LMHead 耗时从 320 微秒降到 169 微秒,TPOT 从 36.97 毫秒改善到 35.67 毫秒。单步看只有一毫秒出头,乘上每秒上万次解码步,累积收益可观。另外非融合 allreduce 现在复用 FlashInfer MNNVL workspace,DeepSeek-V4-Flash TP4 在 Blackwell 小 batch 场景最高再涨 6.9%。

AMD 阵营的意外惊喜

MI355X 用户这轮礼物很厚:Kimi K3 换上分组头 MLA verify 内核,吞吐 1.37-1.77 倍;GLM-5.2 在 gfx950 上吞吐 +14%、TPOT 降 12.5%,短上下文走稠密回退让 TTFT 再降 22%-43%。更有意思的是 NVFP4 转 MXFP4 在线重量化:加载时直接把英伟达格式权重转成 AMD 能跑的 MXFP4,不持有全精度副本,在 GLM-5.1、Kimi-K2.6、Qwen3.5-397B 等五个模型上精度保留 97.5%-100.2%。英伟达 checkpoint 开箱跑 AMD,以前要自己折腾半天。

扩散模型与升级注意

SGLang-Diffusion 把 breakable CUDA graph 铺到更多模型:LTX-2 在 H200 端到端从 10.75 秒降到 6.90 秒,SANA 1024px 降 26%。新支持 Muse Glimmer、SANA-Video、LTX-2.5 等 7 个模型。升级有两个坑:CUDA 栈升到 torch 2.13.0;编译内核缓存统一收进 SGLANG_CACHE_DIR,升级后首启会重编译一次,预热镜像的团队记得提前迁移目录。

所以呢

模型层每周都有新旗舰,但推理框架决定这些模型落地时的真实成本。v0.5.18 的信号很清晰:冷启动、通信原语、跨硬件移植,正在成为 vLLM 与 SGLang 竞争的主战场。下次服务扩容慢了半拍,不妨看看是不是框架该升了。

参考:SGLang v0.5.18 Release Notes(https://github.com/sgl-project/sglang/releases/tag/v0.5.18)