AMD MI455X 拿下 Hugging Face Transformers 99.5% 通过率:432GB HBM4 把 KV cache 拉到三倍并发

AMD 在 Advancing AI 2026 上发布的 Instinct MI455X 单卡搭载 432GB HBM4 与 23.3TB/s 内存带宽,容量是上一代 MI300(192GB)的 2.25 倍。Hugging Face 拿到早期样机后,在 Transformers 库 24 个核心架构(覆盖 encoder、decoder、视觉、音频、多模态、现代 LLM)的测试中拿到 99.5% 通过率,与 MI300 的 99.4%、NVIDIA A10 的 99.1% 处于同一区间。容量层面,用 64GB 的 Qwen3-32B BF16 模型做并发压测,MI455X 凭借约 3 倍于 MI300 的 KV cache 容量,可支撑的并发请求数也多了约 3 倍。这意味着大模型推理正在告别"切分优先"的设计思路,长上下文与高并发场景可以更激进地堆在单机里。工程侧,Hugging Face 与 AMD 联合稳定了 Flash Attention 路径、补齐了 torchcodec 多模态音视频支持,并修复了一组输出对比偏差。下一步,MI455X 将进入 Transformers 的 CI 流水线,AITER 优化内核会被陆续搬到 Hugging Face Kernel Hub。对自托管玩家来说,这不只是"AMD 追上 NVIDIA"的叙事,更像是单台机器能跑得动的模型规模又往上抬了一个台阶——以前必须靠张量并行拆开的 64B+ 模型,现在可以放到单机上做高并发推理,运营成本结构会随之改变。