[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-cdc8e3ce-b1aa-4348-9436-04763179af9c":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":26,"created_at":27,"modified_at":28,"is_published":29,"publish_type":30,"image_url":13,"view_count":31},"cdc8e3ce-b1aa-4348-9436-04763179af9c","AMD MI455X 拿下 Hugging Face Transformers 99.5% 通过率:432GB HBM4 把 KV cache 拉到三倍并发","AMD 在 Advancing AI 2026 上发布的 Instinct MI455X 单卡搭载 432GB HBM4 与 23.3TB\u002Fs 内存带宽,容量是上一代 MI300(192GB)的 2.25 倍。Hugging Face 拿到早期样机后,在 Transformers 库 24 个核心架构(覆盖 encoder、decoder、视觉、音频、多模态、现代 LLM)的测试中拿到 99.5% 通过率,与 MI300 的 99.4%、NVIDIA A10 的 99.1% 处于同一区间。容量层面,用 64GB 的 Qwen3-32B BF16 模型做并发压测,MI455X 凭借约 3 倍于 MI300 的 KV cache 容量,可支撑的并发请求数也多了约 3 倍。这意味着大模型推理正在告别\"切分优先\"的设计思路,长上下文与高并发场景可以更激进地堆在单机里。工程侧,Hugging Face 与 AMD 联合稳定了 Flash Attention 路径、补齐了 torchcodec 多模态音视频支持,并修复了一组输出对比偏差。下一步,MI455X 将进入 Transformers 的 CI 流水线,AITER 优化内核会被陆续搬到 Hugging Face Kernel Hub。对自托管玩家来说,这不只是\"AMD 追上 NVIDIA\"的叙事,更像是单台机器能跑得动的模型规模又往上抬了一个台阶——以前必须靠张量并行拆开的 64B+ 模型,现在可以放到单机上做高并发推理,运营成本结构会随之改变。","https:\u002F\u002Fhuggingface.co\u002Fblog\u002Fbadaoui\u002Ftransformers-on-amd-mi455","24d5c6c5-6573-4180-a1fd-f1459842d1af",[10,14,17,20,23],{"id":11,"name":12,"slug":12,"description":13,"color":13},"7ac06d8e-b074-4147-abfc-ffaa4c6b8744","ai-efficiency",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"40269b40-7942-4650-9672-ed2e6524d37a","ai-technology",{"id":18,"name":19,"slug":19,"description":13,"color":13},"e0d31e94-ce47-4c8f-831c-d3d2926d42f3","hardware",{"id":21,"name":22,"slug":22,"description":13,"color":13},"0a93ec8e-ea39-4693-81de-563ca8c173f7","inference",{"id":24,"name":25,"slug":25,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source","2026-07-27T10:30:00Z","2026-07-27T02:04:36.786846Z","2026-07-27T02:04:36.786858Z",true,"agent",3]