NVIDIA 边缘推理框架 TensorRT Edge-LLM 在 8 月 12 日发布的 0.10.0 版本里,把「Day-0 支持新模型」的口径往前推了一大截——不只是给一个新模型加个导出脚本,而是把多种完全异构的模态(LLM、VLM、世界模型、文本扩散、多语种 ASR)全部塞进同一个 C++ 运行时,跨 Jetson、DRIVE、DGX Spark 跑同一套引擎。这是边缘推理栈从「单模型优化器」往「物理 AI 通用推理基础」转向的一个清晰信号。

一次发掉了五种工作负载的 Day-0 支持

0.10.0 的 Key Features 列得很直接:Qwen3.8-27B Day-0 支持、Nemotron-3.5 Lightning(30B 总参 / 3B 激活 MoE)的 MTP 与 DFlash 投机解码、Cosmos3-Edge 多模态推理(含实验性策略与动作生成)、DiffusionGemma 26B-A4B 的 NVFP4 块扩散推理、Nemotron-3.5-ASR 0.6B 流式 ASR,再加上 DSpark(带 DDTree drafting 的投机解码)。[1]

每条对边缘端的意义不一样:Qwen3.8-27B Day-0 让中文为主的工业 Agent 拿到原生强化推理基底;Nemotron-3.5 Lightning NVFP4 让 30B MoE 真正能在 Jetson Thor 一类设备上跑;Cosmos3-Edge 把世界模型搬到产线机器人附近;DiffusionGemma NVFP4 把文本块扩散首度推到边缘;Nemotron-3.5-ASR 在 0.6B 体量下覆盖 40 语种流式识别。

把这五件事放到同一个 release 里,意味着 NVIDIA 已经在执行「一个 C++ runtime = 一台边缘设备所有模型」的工程目标,而不是分多套栈去分别维护。

免 ONNX 直接构建引擎的实验通道

0.10.0 里我比较在意的是「an experimental direct TensorRT engine builder without ONNX export」,也叫 direct engine builder。[1] 它跳过 PyTorch → ONNX → TensorRT 这条传统导出链,直接从 Hugging Face checkpoint 构建 TensorRT 引擎,与正路共享同一套 C++ 部署运行时。

实际好处有三层:一是 build 阶段不再需要临时占用 GPU 显存做 ONNX 中转,对单卡开发者更友好;二是依赖更干净,避免了 ONNX opset 漂移导致的兼容性问题;三是配合新加的「multi-turn KV-cache reuse」(LLM 的 paged KV-cache + VLM 的 media-aware KV reuse),多轮对话与多图理解在长上下文里能把 KV 真正留住,不用每轮重算。0.9.1 已经把 paged KV-cache prefill 与 paged XQA decode 打通,0.10.0 是把这套机制向多轮推进的关键版本。[2]

投机解码生态一次填齐

边缘推理对延迟敏感,投机解码是关键工具。0.10.0 把 NVIDIA 内部的几个路径一起外推:Nemotron-3.5 Lightning 的 MTP+DFlash 全套,Qwen3 / Qwen3.5 走 DDTree drafting 的 DFlash 扩展,以及新加入的 DSpark。DFlash 的原始思路:把扩散式采样当作 draft 阶段,用 AR 主模型做 verify,靠并行展开多个候选 token 拿到约 3× 加速。DSpark 据其 spec 描述走的是 EAGLE-style 的 lightweight draft + 主模型 verify 路径,配合 DDTree(一种树形并行展开)来提升 acceptance rate。[2][3]

把这几条路径并排放进同一 release,意味着 NVIDIA 在边缘端投机解码这件事上不再只押一种 draft 策略,而是看模型本身的 MoE 形态、是否 MTP、是否含视觉/语音分支来灵活切换。

一点观察

TensorRT Edge-LLM 的 release cadence 已经从「季度大版本」缩到「月度小版本」+「关键模型 Day-0」。0.10.0 的覆盖面——同一天拉起 LLM、世界模型、扩散文本、ASR、投机解码五条战线——意味着边缘 AI 不再被「下一个权重能不能跑」卡脖子,而是被「C++ runtime 能不能吃下」卡脖子。这条赛道接下来的比拼点,是运行时能否跟得上基础模型每两周一发的节奏。开源生态做边缘端,NVIDIA 用 C++ runtime 抢到了关键卡位。


参考

[1] NVIDIA TensorRT-Edge-LLM v0.10.0 Release Notes, 2026-08-12. https://github.com/NVIDIA/TensorRT-Edge-LLM/releases/tag/v0.10.0

[2] NVIDIA TensorRT-Edge-LLM 项目 README. https://github.com/NVIDIA/TensorRT-Edge-LLM

[3] Google Developers Blog: DFlash diffusion-style speculative decoding on TPU, 2026-05. https://developers.googleblog.com/supercharging-llm-inference-on-google-tpus-achieving-3x-speedups-with-diffusion-style-speculative-decoding/