AMD 把「把模型刻进硅片」这条路买下来了

2026 年 8 月 6 日,AMD 宣布收购总部位于多伦多的 AI 推理芯片初创 Taalas,后者成立于 2023 年,核心思路是把 AI 模型的权重直接烧进 ASIC 芯片,把模型在计算单元之间的数据流硬连线起来。这种「model-specific IC」(MSIC) 路线跟传统 GPU 完全不同 —— 牺牲可编程性,换取极致的推理速度。

Taalas 联合创始人 Ljubisa Bajic(前 Tenstorrent CEO,也是前 AMD 员工)将在 AMD 高级副总裁 Vamsi Boppana 领导的 AI Group 继续推进技术整合。AMD 计划把 Taalas 的方案与 Instinct GPU、Helios 机架级系统一起打包卖,形成类似 Nvidia 收购 Groq 之后的「GPU + 专用 decode 加速器」分层推理栈。

HC1 的成绩单,和它不得不接受的代价

2026 年 2 月,Taalas 走出隐身模式,公开了第一颗测试芯片 HC1(用台积电 6nm 工艺)。在 Meta 的 Llama 3.1-8B 上,HC1 单芯片跑出 16000+ tokens/s/用户的速度 —— 比 NVIDIA 的 GPU 快约 48 倍,比 Cerebras 的晶圆级加速器快约 8.5 倍。

代价是这条路线几乎没有任何灵活性:

  • 单颗 HC1 只能跑 Llama 3.1-8B 一个模型,其他模型一概不兼容;
  • 单颗芯片的参数上限大约在 80 亿(取决于量化激进程度),跑 DeepSeek-671B 这种级别需要约 30 个独立流片;
  • 换成新模型不需要从零设计芯片,只需换两层 mask(一层权重、一层数据流),通常约两个月可以完成 tape-out。

AMD 把 Taalas 放进自家 AI 全栈后,意味着它可以在「prefill 用 Instinct GPU + decode 用 Taalas MSIC」这条路上走得更彻底,而不是像之前跟 Cerebras 合作那样还得跨公司拼方案。

行业影响:英伟达已经动了,AMD 必须跟上

这不是孤例。英伟达去年底几乎「收购」了同样走推理加速路线的 Groq(传 200 亿美元规模),把 Groq 芯片定位为 GPU 旁边专跑 decode 的搭档;AMD 这次买 Taalas,本质是同一思路的不同表达。

但两者结构不同:英伟达是「收购一家独立公司,维持外部品牌」,AMD 则把团队和 IP 全数并入自家 AI Group,由 Boppana 直接管辖。对客户来说,AMD 后续拿出的系统将完全是「AMD 自家造」的,而不是要协调两家厂商的硬件和软件。

另一条值得关注的支线是「结构化 ASIC」赛道的整体回潮。Intel 早在 2018 年就通过收购 eASIC 进入这个领域,瞄准网络基础设施和国防应用。如今 Taalas 把同样的思路搬到 AI 推理上,AMD 的入局会进一步推升这类「牺牲可编程性换极致单位经济性」方案的能见度。

短板:这条路解决不了所有人

Taalas 路线最大的边界是「单模型」 —— 对快速迭代的大模型前沿研究(每周都有新模型发布的实验室)并不友好。AMD 自己把 Instinct GPU + ROCm 软件栈定位为「全栈灵活方案」,Taalas 则补齐「极致低成本 / 低延迟 / 高吞吐」的另一端。

合理的预期是:未来一年内,AMD 会在边缘场景(物理 AI / 工业自动化 / 实时机器人)优先推 Taalas-based 方案,云端 LLM 大模型推理仍以 GPU 为主、Taalas 作为 decode 加速器出现。整套方案会跟 Nvidia-Groq 形成正面竞争。

所以呢

AI 推理这条赛道在 2026 年的主线,从「GPU 一家通吃」变成「GPU + 专用 decode 加速器」的混合架构。AMD 通过这次收购,把主动权握在了自己手里 —— 但能不能在 decode 这一环节从英伟达手里抢到份额,取决于 AMD 能否把 ROCm 软件栈、Instinct GPU、Taalas MSIC 三个截然不同的硬件在同一套系统软件里协同起来。

至少对模型厂商和云厂商来说,2026 年下半年值得关注的信号是:谁先把「每瓦 tokens / 每美元 tokens」做出对比性数字,这才是这场收购能否真正改变推理市场格局的标尺。

参考来源:AMD 官方新闻稿(2026-08-06)、EE Times 报道、Solidot 中文科技报道。