当一家做大型机做了六十多年的公司,愿意把 Arm 这种「非自家」的指令集以全硬件方式塞进核心——而且不是做两颗独立核心拼一块——这件事本身就值得停下来看一眼。IBM 在 Hot Chips 2026 上展示的新一代 IBM Z 与 LinuxONE 处理器,把这件事做实了。

一颗核心跑两套 ISA,不是拼贴

所谓「双指令集」(dual-ISA),指的就是每个核心既能原生执行 z/Architecture(IBM 大型机的老指令集),也能原生执行 AArch64——也就是大家熟悉的 Arm v9.3。注意关键词是「原生」:IBM 没有走翻译/转译的捷径,而是把 AArch64 完整地实现在硬件上,小端 Arm 配大端 z/Architecture,并支持 SVE/SVE2,实际实现的 AArch64 指令多达 2,792 条——按 IBM 自己在 Hot Chips 上的玩笑话,这数字比 z/Architecture 的指令还多,所以别再叫 RISC「精简」了。

实现细节里有两个值得一提的取舍:一是直接消费 Arm 公开的 XML 架构描述来自动驱动解码器,分支预测的派发与发射逻辑则复用了 Z 核心的寄存器重命名,只是把 GR16-31 这段区间重新映射;二是把 AArch64 当作「一等公民」,而不是降级兼容层。结果是 Arm 软件无需修改、几乎可以「开箱即用」,而且 IBM 称其通过 Arm SystemReady 合规认证——这意味着可以直接跑标准 Arm 平台软件栈。

这台处理器采用 2nm 工艺,单芯片 11 颗 IBM Z 高性能核心、主频 5.7GHz 以上、SMT=2,搭配每核 36MB 私有 L2、合并后形成 432MB 虚拟 L3 与 3.5GB 虚拟 L4 缓存,外加专用片上 DPU 做 I/O 加速。可用性目标是 99.999999%(七个 9)。

第二代 AI 推理芯片:堆叠「企业级」冗余

很多人关注的是 AI 部分。这次 Hot Chips 上 IBM 还同步公布了第二代 AI 推理加速器,定位「企业级 GenAI」,参数列出来相当硬核:16 颗 AI 核心 + 1 颗冗余核心(可以容忍任意一颗核心失效),原生支持 FP4 与 MXFP4 数据类型,IBM 称 TOPS 最高可达上一代的 4 倍;96GB HBM3e 显存,峰值带宽约 4TB/s——大约是上一代的 20 倍;片间互联走 PCIe Gen6,以点对点低延迟方式与 IBM Z 主机对接。

「冗余 AI 核心」这件事本身是个明显的信号:IBM 没把这颗加速器定位成训练卡或通用 GPU 的对手,而是把它当做一个面向银行交易、支付清算、保险理赔这种「不能停」的企业 AI 推理负载来设计的。和 z/Architecture 一样,它的安全栈也覆盖了机密计算与量子安全加密,做到数据与模型在静止、传输、使用三态都被保护。

软件侧,IBM 把这些加速单元在 Linux on Arm 下暴露为标准 platform device,延迟与 z 原生指令基本相当;同时 z/OS 还能继续把它们当原生指令用。这意味着同一台大型机上,IBM 老客户能继续跑 COBOL 与 s390x,而新写的 AI 应用可以直接基于 Arm 生态做,KVM/OpenShift Virtualization 把两套工作负载塞进同一个逻辑分区——据称切换只在纳秒级。

为什么这件事值得 AI 从业者关心

把这件事和 OpenAI Jalapeño、英伟达 Vera 这类「通用推理芯片」摆在一起看会更有意思。OpenAI 走的是「针对自家模型体量优化 perf/W」的路线,英伟达 Vera 押的是「数据中心级通用 CPU + GPU」组合拳;IBM 这条路则完全不同:把 AI 推理做成大型机的「原厂配件」,并且把「企业级可靠性 + 保密计算 + 量子安全」当成最关键的差异化卖点。

这背后其实是在赌一件事:对于真正大额的金融、医疗、政府交易,大家最终愿意付钱的不是「跑得快多少倍」,而是「能不能不出事、能不能扛住监管审计、能不能和遗留系统在同一台机器上共存」。如果 IBM 这条路走通,OpenAI 与英伟达擅长的「互联网级」AI 推理,与 IBM 擅长的「关键任务级」AI 推理,会形成两套完全不同的工程范式。

另一种解读更冷静:全球约 70% 的交易量仍跑在 IBM Z 上,这套双 ISA + AI 推理的组合,本质上是 IBM 给自家 60 年遗产续命的方案——把 Arm 软件生态引入大型机,把大型机的可靠性护城河延伸到 AI 推理,两边各取所需。至于「x86+GPU」「Arm 服务器+独立加速卡」之外的第三条路径能不能立住,要等首批客户实测数据出来再说。

所以呢

如果你正在做 AI 推理基础设施选型,IBM 这套方案短期内不会影响你的选型——它面向的不是云端大规模在线推理,而是高合规、强冗余、必须和遗留系统共存的私有部署场景。但它提供了一个清晰的信号:在大模型推理被「电力」「可靠性」「合规」三道墙限制的当下,把 AI 算力绑在「关键任务硬件」上,可能是一条和「堆更多 GPU」并行的工程路线。

参考资料: