Vera CPU 把 AI 工厂的天花板顶穿了:DeepInfra 实测 2.2 倍 Agent 编排提速,英伟达重新定义「Agent 时代的 CPU」

7 月 21 日,英伟达发布 Vera Rubin 平台在 CoreWeave、Google Cloud、Microsoft Azure 和 Mistral 等合作伙伴处的实测成绩,把行业关注点从 GPU 单卡性能拉回到一个被忽视的角色——CPU。 DeepInfra 的生产基准显示,Vera CPU 在同等 QoS 下可支撑 **1.6 倍并发 AI Agent**,编排速度比对比 CPU **快 2.2 倍**。这家 AI 云平台每周处理近 5 万亿 Token,其中 **约 30% 来自 Agentic 工作负载**——数字本身就解释了为什么 CPU 突然成了 AI 工厂的瓶颈:Agent 不是单次推理,而是「模型调用 + 工具调度 + 上下文切换 + 任务编排」的循环,每一步都在 CPU 上跑。 Vera CPU 的关键设计都瞄准这个新负载:自研 Olympus 核心带来 **2 倍单线程性能、3 倍核间带宽、40% 内存延迟降低**。这跟传统数据中心 CPU「核多频低」的路线完全相反——Agent 编排不需要堆核,需要的是单核能把一次推理前后的协调工作压到最短。 平台层面,Vera Rubin NVL72 在 CoreWeave 的 DeepSeek-R1 实测中实现 **每兆瓦 10 倍 Token 吞吐**,相比 Grace Blackwell NVL72 是数量级跃迁。这个提升来自七颗芯片的 co-design:Rubin GPU + Vera CPU + NVLink 6 + ConnectX-9 + BlueField-4 + Spectrum-6 + Groq 3 LPX,不是「拼一台服务器」,是把整机柜当成一颗加速器。NVLink 6 提供 260 TB/s all-to-all 带宽,专门解决 MoE 架构的专家路由瓶颈;Spectrum-X 把 RDMA 带宽拉到比通用以太网高 1.6 倍。 工程细节也透露了规模化野心:compute tray **无缆、无风扇、无软管**,装配时间从小时级压缩到 **1 分钟**;液冷进液温度做到 45°C,干冷器直冷免掉冷水机组。这不是炫技,是把「机柜级 AI 工厂」真正变成可批量复制的产品。微软与 Mistral 的数十亿美元合作也将基于数千颗 Vera Rubin GPU 落地,主打欧洲主权 AI。 所以呢?当所有人盯着 GPU 算力时,Agent 工作负载第一次把 CPU 推到了 AI 工厂性能曲线的 C 位。Vera CPU 的真正信号不是「比对手快多少」,而是英伟达用一颗自研 CPU 告诉市场:未来 AI 基础设施的瓶颈不在「谁卡算得快」,在「谁能把每次工具调用、上下文组装、多步推理的协调开销压到最低」。OpenAI、Anthropic 在 Agent 框架上的军备竞赛,最终会反推到硅这一层。