很多人买 GPU 关心 SM 数量、显存带宽、CUDA 核心,却很少有人注意到一件事——每一颗 NVIDIA GPU 里其实都藏着 10 到 40 个 RISC-V 微控制器。它们不参与图形渲染也不参与 AI 算力计算,而是负责视频编解码、电源管理、安全引擎、内核驱动卸载等看不见的工作。
Falcon 退役,RISC-V 上位
NVIDIA 在 2005 年的 G98 GPU 上首次引入自研微控制器 Falcon(FAst Logic CONtroller)。Falcon 是 32 位核心、无数据缓存,已无法满足 AI 时代对芯片复杂度的要求;NVIDIA 在评估 Arm、MIPS 后,于 2015 年确定把 RISC-V 作为 Falcon 的下一代替代架构。
到 2024 年,NVIDIA 当年 GPU 产品里包含的 RISC-V 核心总量估计约 10 亿颗。从 Turing(2018)到 Ampere(2020)、Ada/Hopper(2022)、Blackwell(2024),每一代都在加深对 RISC-V 的依赖。
三类内核、一套子系统
NVIDIA 至少有三个 RISC-V 微控制器内核:NV-RISCV32(RV32I-MU,顺序单发射,主频 1.8 GHz)、NV-RISCV64(RV64I-MSU,乱序双发射,主频 2 GHz,支持 SMP)、NV-RVV(在 NV-RISCV32 基础上叠加 1024 位向量扩展)。
围绕这三个核心,NVIDIA 搭起一个叫 Peregrine 的统一子系统,把 RISC-V 内核、缓存、TCM、中断控制器、DMA、RSA/PKA、AES 引擎按需组合,给 GPU 控制平面提供一套可参数化配置的积木。NVIDIA 还加了 20 多项自定义扩展,覆盖 64 位物理地址、2KB 页面、ICD 安全调试、ROM 内存保护等。
GSP 和 DLA:两块真正干 AI 活的应用
GPU 系统处理器(GSP) 位于主机 CPU 和 GPU 之间,通过 PCIe 通信,直接控制 GPU 硬件单元和显存。GSP 用多个 RV64 内核加一致性互连和统一 TCM/缓存,做三件事:内核驱动卸载、减少 GPU 对 CPU 的暴露面、封装 GPU 底层细节。它支持多分区模式——一个 GPU 切成多份 vGPU 分给不同租户的 Guest VM。这种架构直接服务了云端 LLM 推理的多租户场景,也支撑了机密计算。
深度学习加速器(DLA) 是 NVIDIA 自研的固定功能推理加速 IP,也跑在 RISC-V 上——NV-RISCV32 跑标量、NV-RVV 跑向量,编译器能把多个算子融合到一个 RVV 内核里。Orin 等边缘 AI 芯片里 DLA 直接跑 TensorRT 模型的离 CPU/GPU 卸载路径,跟大模型部署关系紧密。
写在最后
RISC-V Summit 2024 上披露的这些细节,揭示了一件被 AI 算力叙事盖过去的事:现代 GPU 早就是一颗 SoC,里面不仅有 CUDA 核心,还有一套基于开源 ISA 的控制平面和加速子系统。
下次有人说 RISC-V 在数据中心还只是个实验品,把 NV-RISCV32/64/RVV、GSP、DLA、Peregrine 这一串名词丢过去就行。