AMD 收下 Taalas:把模型权重刻进芯片,推理的内存墙还剩多少?
8 月 6 日,AMD 宣布收购多伦多 AI 芯片初创公司 Taalas。这是 AMD 近九个月内的第三笔 AI 收购——此前 MK1(去年 11 月)与 Mext(今年 6 月)已把它推进推理赛道,FastFlowLM 团队则在 7 月并入。如今 Taalas 的加入,给 AMD 的「推理全栈」补上了一块很特殊的拼图:把模型权重直接刻进晶体管。
Taalas 的核心思路:让权重不再「住」在 HBM 里
现代推理最大的隐性瓶颈并不是算力,而是 HBM(高带宽内存)与处理器之间反复搬运权重的带宽。每生成一个 token,模型都要把整组权重从 HBM 拉进 GPU 一遍——这是今天几乎所有「按 token 卖」的部署方式里最贵的部分。
Taalas 的做法是直接把这一过程取消。它的 HC1 测试芯片用台积电 6nm 工艺制造,把 Meta 的 Llama 3.1 8B 模型权重烧进芯片里的 mask-ROM 区域,等同于把模型硬连线成电路的一部分;剩余区域仍保留 SRAM,用来存微调适配器和 KV cache。Forbes 与 SiliconANGLE 的报道引用了同一组基准:HC1 跑 Llama 3.1 8B 能达到每秒 16,960 个 token,相对英伟达 GPU 推理速度约 48 倍,相对 Cerebras 加速器约 8.5 倍(来源:Solidot 转引 The Register / Forbes 编辑分析 / SiliconANGLE 8 月 6 日报道,https://siliconangle.com/2026/08/06/amd-acquires-taalas-hardwire-ai-models-silicon/)。
这种「模型专属集成电路」(model-specific integrated circuits,MSIC)的代价也很直接:芯片一旦流片就只能跑这一个模型。要换模型,必须重新设计芯片——但 Taalas 用了一个捷径,只需更换约两层金属掩膜,重做一遍流片在台积电大约需要两个月。CEO Ljubisa Bajic(同时也是前 Tenstorrent 创始人)解释:「这种硬连线正是我们速度的来源。」
HC2 与 200 亿参数目标
Taalas 已经规划了第二代 HC2 芯片,目标是把支持的模型规模提升到约 200 亿参数。这一规模在今天的开源模型世界里仍处于「主流部署」区间——Mistral、Qwen、Llama 3.x 都涵盖在这一档位。HC2 一旦量产,意味着 Taalas 的工艺不再局限于「Llama 3.1 8B 这种 8B 级别的演示模型」,而开始切入推理 API 真正能卖得动的尺寸。
AMD 高级副总裁、AI 部门负责人 Vamsi Boppana 在公告中把这次收购框定为「全栈 AI 平台」策略的一部分。技术上的整合路径已经明确:Taalas 的 MSIC 与 AMD 自家的 Instinct GPU 在 Helios 机架内并列部署,prompt 处理仍由 GPU 跑,token 生成交给 Taalas 的专用芯片,整体通过 ROCm 软件栈编程。换句话说,AMD 想在「超大模型走 GPU、超热部署模型走 MSIC」这条双轨上铺货。
「刻进芯片」的真正赌注
这笔收购最值得看的不是 48× 这种对比数字,而是 AMD 对「HBM 内存瓶颈是不是永久的」这个问题的回答。
今天的市场给 HBM 标了一个非常稀缺的价格——SK hynix 市值已过万亿、宣布 381 亿美元新工厂,传统 DRAM 在 2026 年一季度涨了约 90%,HBM 市场被预期达到 546 亿美元。整个内存牛市的隐含假设是:AI 推理对内存带宽的需求会持续膨胀,因此内存会长期紧缺。
Taalas 的方案直接挑战这个假设:权重不存 HBM,HBM 的需求就少一块。Forbes 的分析把这一点说得更直白——「内存瓶颈是设计选择,不是物理定律」,并且这条观点正在被多方一起推进:Nvidia 在软件侧做模型量化与压缩,Samsung 在 FMS 大会上展示了 zHBM 立体堆叠,SK hynix 与 Sandisk 联合发布了高带宽闪存标准(HBF),把便宜的 NAND 顶进原本 HBM 才能干的活。
AMD 在这个节点收 Taalas,相当于把「内存稀缺不是永久的」这一论点做成了一件可下单的硬件。Taalas 此前累计融资 2.19 亿美元(2023 年由 Ljubisa Bajic 和妻子 Lejla Bajic 创办,投资方包括 Fidelity、Quiet Capital 与半导体投资人 Pierre Lamond),收购交易的具体金额未披露,预计今年第四季度完成交割(来源:Forbes 8 月 9 日报道 https://www.forbes.com/sites/jonmarkman/2026/08/09/amd-buys-taalas-the-startup-that-carves-ai-models-into-silicon/)。
「所以呢」
对大多数读者来说,这笔收购的最直接含义是:未来 12-24 个月里,AI 推理的价格曲线,可能会比大家基于「HBM 紧缺」做的预测更陡。
MSIC 不会取代 GPU——单模型固化、缺乏灵活性的硬约束意味着它只适用于「部署后冻结、热使用、稳定周期长」的模型,恰好对应推理 API 里调用量最大的那一批。当一家头部服务商发现「某个版本的模型在交付后 6-12 个月里调用占比 70%」时,把这部分权重烧进 MSIC 就能把推理毛利率从 GPU 部署基础上再往上抬。
所以接下来值得盯三件事:第一,HC2 是否如期在 2026 年内拿出 200 亿参数版本的实测数据;第二,AMD 会不会把 MSIC 整合进 ROCm 的标准推理接口,让开发者像切 CUDA 一样切 MSIC;第三,第一批跑 MSIC 的模型是哪一类——如果锁定在 Llama 这种开源生态,而不是 GPT-5.6、Mythos 5 那样的闭源前沿,MSIC 的「去 HBM 化」故事才真正开始扩散。
HBM 一直被当成「AI 时代的石油」,AMD 这笔收购的潜台词是:石油不一定要从沙特买,也可以从工程里省下来。