LLM 推理的主战场正在从数据中心外溢。车载助手、机器人、工业设备都要求把模型塞进本地算力:延迟要可控、断网要能跑、内存预算按 MB 计。NVIDIA 的回答是把 TensorRT Edge-LLM 做成一个开源 C++ 推理运行时,而 2026 年 8 月发布的 0.10.0 版本,把「新模型发布即支持」的节奏正式带到了边缘端。
一个为「车上和机器上」定制的推理框架
TensorRT Edge-LLM 是 NVIDIA 面向 Jetson、DRIVE 和 DGX Spark 平台的 C++ 推理运行时,覆盖文本、视觉、音频、语音乃至 action 模型。工作流分三段:先把 Hugging Face 检查点导出为 ONNX,再为目标硬件构建优化的 TensorRT 引擎,最后由 C++ 运行时执行推理。
这个设计与数据中心框架的取向完全不同。NVIDIA 在技术博客里把边缘负载的特征讲得很直白:请求来自单个或少数用户、batch size 低(通常跨摄像头)、部署是任务关键型、且需要离线运行不更新。对应的工程要求是延迟最小且可预测、磁盘内存算力占用最小、符合生产标准、高鲁棒性。为此框架提供了 EAGLE-3 投机解码、NVFP4 量化、chunked prefill 等特性,依赖被刻意压到最少。
0.10.0:Day-0 支持 Qwen3.8-27B
这次更新最值得注意的一条,是 0.10.0 对阿里 Qwen3.8-27B 的 Day-0 支持——模型在 Hugging Face 上线,边缘框架同步跟进。同一版本还加入了:
- Nemotron-3.5 Lightning(30B-A3B、NVFP4),支持 MTP 与 DFlash
- Cosmos3-Edge 与 DiffusionGemma(26B-A4B、NVFP4)
- Nemotron-3.5-ASR 流式语音识别(0.6B)
- DSpark 投机解码
- 实验性的直接引擎构建器:跳过 ONNX 导出,从检查点直接构建 TensorRT 引擎
- 多轮对话 KV-cache 复用,以及实验性 OpenAI 兼容 server 的视频输入
再往前看 7 月的 0.9.x,完整 Gemma 4 家族(E2B/E4B/12B/26B-A4B/31B,多模态文本+图像+音频,带 MTP)、Qwen3-Omni、Nemotron-3 NVFP4 也都已接入。文档里甚至有完整的 Qwen3-TTS 流水线指南,覆盖 CustomVoice、VoiceDesign 和 Base 检查点——文本、视觉、语音三类模型在边缘端的位面正在被补齐。
产业链已经上车
这个框架不是实验室项目。Bosch 联合 Microsoft 与 NVIDIA 基于 TensorRT Edge-LLM 打造了车载 AI 座舱,用端侧 ASR + TTS 配合 LLM 推理,再通过编排器与云端大模型协作;ThunderSoft 把它集成进基于 DRIVE AGX Orin 的 AIBOX 平台;MediaTek 的 CX1 SoC 用它加速座舱 AI 与驾驶员/座舱监控,并向框架回馈了新的嵌入式推理方法。仓库以 Apache 2.0 许可证开源,目前约 512 star、112 fork、24 次 commit——工程节奏还早期,但产业抓手已经就位。
所以呢
两件事值得记住。第一,「Day-0 支持 Qwen3.8-27B」这个细节:边缘推理框架对中国开源模型的跟进速度,已经和 Hugging Face 上架节奏对齐——中国开放权重模型不止在下载量榜上领跑,也正在成为海外硬件栈的默认适配对象。第二,免 ONNX 的直接引擎构建器说明 NVIDIA 开始削减部署链路的中间环节:从检查点到边缘引擎的路径越短,车规和产线的确定性就越强。对做机器人、车载、离线设备的团队来说,现在盯这个仓库的 release note,比等季度报告更接近实时战场。
(原文与发布细节见 GitHub 仓库:https://github.com/NVIDIA/TensorRT-Edge-LLM)