OpenAI 的「自研推理芯片」传闻从去年讲到现在,但 8 月 25 日 Hot Chip 2026 上,Richard Ho 团队第一次把数字摆到台面上。这是 OpenAI 第一次认真回答两个问题:第一,自研硅究竟比 Nvidia Blackwell 快多少;第二,九个月就跑通 tape-out 的工程奇迹,会不会卡在「AI 自己写 kernel」这一步上。

三张图表里的真实增量

OpenAI 没有选自己最擅长的内部模型,而是拿三个公开模型在 SemiAnalysis 的 InferenceX 基准上跑测试,这样任何人都能复现:

  • GPT-OSS 120B:峰值吞吐 85,448 vs 44,960 mixed tokens/s per kW(对比 GB200),即 1.9 倍;端到端延迟从 1.80 秒降到 1.03 秒。
  • DeepSeek R1 670B(MXFP4):19,641 vs 11,781 mixed/kW,1.7 倍;延迟 1.65s vs 5.99s。
  • Kimi K2.5 1T(MXFP4):18,195 vs 11,862 mixed/kW,1.5 倍;延迟 1.56s vs 5.31s。

更直观的是单用户感受。在 DeepSeek R1 上,Jalapeño 每秒给单个用户吐 700 tokens,对比系统只有 169;Kimi K2.5 上是 694 vs 182;GPT-OSS 上 1,459 vs 535。换句话说:用户感知到的「卡不卡」,差距最高拉到 4 倍以上

来源:OpenAI 官方披露页TechCrunch 报道

700 瓦背后的取舍

这颗 ASIC 标称 700W TDP,实测持续功率「at or below 550W」,而对比系统 GB200 / GB300 分别是 1,200W / 1,400W。功耗低一半,单芯片 TDP 砍到 Blackwell 的二分之一,但单用户吞吐却高出 2–4 倍——这意味着 OpenAI 用系统级协同换性能:数据搬运少、网络域大、KV cache 显式放置。

Richard Ho 自己划了底线:这些数字都是「单轮 8k context,InferenceX」跑出来的,没有 AgentX、没有多轮、没有 prefix-cache-heavy 场景。也就是说,今天 Jalapeño 证明的是「低成本 LLM 推理」很能打,而真正赚钱的 agent workload 还没验证。这也是为什么 Hot Chip 2026 上,SemiAnalysis 内部自己的复盘是「Jalapeño vs Blackwell 的对比不公平也不完整」—— Nvidia 的下一代 Rubin 已经用同样 HBM4 内存出货,功耗 900–1,150W,反而成了「Jalapeño 真正要打的对手」。

AI 帮 AI 写 kernel:更值得追踪的故事

硬件本身是表层。真正让从业者坐直身子的是另一段披露:

「Using Codex with GPT-Astra, the team brought three open-weight models that were not part of Jalapeño's original production plan to high performance within two months. For selected GPT-OSS attention and mixture-of-experts blocks, AI-generated implementations ran 1.5 to 1.8 times faster than the existing human-expert-written implementations。」

翻译一下:Jalapeño 从硅回来到上线能跑生产模型,只用了 不到九个月;而其中一部分 GPT-OSS attention 和 MoE blocks 的 kernel,是 Codex 加 GPT-Astra 自动写出来的,在选定的 block 上跑得比人类专家手写的还快 1.5–1.8 倍。OpenAI 给出的不是一句 PR 话术,而是一个可以量化的证据链——AI 不仅能写代码,还能写出比资深 GPU kernel 工程师更快的 kernel。

如果这条曲线继续放大,「十年 CUDA 生态积累的护城河」就要被重新计价。OpenAI 自研芯片单点收益有限,但「模型→硬件」的双向耦合一旦成立,任何新模型架构都能在九个月内跑出硅级加速,这是 Nvidia 给不了的迭代速度。CUDA 的护城河本质是「人写 kernel」的规模优势,不是「代码本身」;一旦写 kernel 这件事被模型接管,生态累积的复用价值就会快速折旧。

那 Nvidia 这下慌不慌?

OpenAI 自己也没把话说死:「我们会继续大量部署 NVIDIA 和其他合作伙伴的加速器」。Jalapeño 不是用来替代 Nvidia,而是给 OpenAI 自己 API 的 cost-per-token 多一层下压空间——按他们估算,如果推理成本真的降 50%,那高频 agent 工作流就不再卡死在「贵到用不起」这条线上。

半年前 SemiAnalysis 自己评价过:「Jalapeño 跟 Blackwell 的对比是不公平也有些不完整」。如果把对照对象换成已出货的 Nvidia Vera Rubin(同样的 HBM4 内存、900–1,150W 功耗),Jalapeño 在 TCO 上跟 Rubin 大致打平,而不是碾压。CUDA 生态仍然值钱,只是「唯一选项」的窗口正在关闭——TPU、Trainium、Jalapeño 之后,头部 AI 实验室不再「只能买 Nvidia」,议价权开始转移。

给开发者意味着什么

现在调 OpenAI 的 API,代码一行都不用改。Jalapeño 是内部基础设施,不是给你插一块的硬件卡。真正的红利要等到 2027 年,API 价格或 rate-limit 上看得到的那次调整。在那之前,值得追踪的信号只有三个:

  1. Gen 2、Gen 3 的演进曲线(OpenAI 已经公开承认在做了);
  2. AgentX 长上下文、多轮、prefix-cache 场景下,Jalapeño 是否还能稳坐 Pareto 前沿;
  3. 「Codex 写 kernel 比人快 1.5 倍」是否从选定的 blocks 扩散到整张芯片的代码库。

如果三件事同时发生,2027 年的 LLM 推理市场就不是「Nvidia vs 自研硅」这么简单的二元对立,而是变成「模型-硬件紧耦合的全栈玩家」对「通用芯片 + 老牌编译器护城河」的代际较量。

参考来源: