AMD 收购 Taalas:把"为单一模型造芯"的路子,搬进 Instinct 体系

当所有人都在谈 GPU 内存墙的时候,AMD 选了另一条路:把模型权重直接刻进晶体管,牺牲通用性换极致推理速度。2026 年 8 月 6 日,AMD 宣布达成收购多伦多 AI 芯片公司 Taalas 的最终协议,把这家做"模型专用硅片"的初创公司,直接搬进自家 Instinct 加速器体系(来源:AMD 官方 IR 公告)。

交易本身

AMD 在官方公告里只说"已达成最终协议"、财务条款未披露。这笔交易仍需走完惯常的交割条件和监管审批。CNBC 同期报道指出,Taalas 自 2023 年成立以来,累计拿到了 2.19 亿美元风投融资。CEO Ljubisa Bajic 在公司网站上说过一句很硬核的话:"developed a platform for transforming any AI model into custom silicon."——从拿到一个未见过的模型到流片,只要两个月(来源:CNBC 报道)。

AMD 人工智能事业部高级副总裁 Vamsi Boppana 把这笔交易说得很直白:"Taalas' technology and world-class engineering team strengthen our AI portfolio by delivering differentiated inference performance and efficiency."Taalas 联合创始人兼 CEO Ljubisa Bajic 补充道:"Joining AMD will give us the scale, engineering resources and global reach to accelerate our innovation."(来源:AMD 官方 IR 公告)

Taalas 在做什么

Taalas 押注的是一个被大厂反复忽略的细分市场:模型专用推理加速器。把特定模型的权重永久烧进芯片里,运行时不再从 HBM 读参数,直接片上 SRAM 推理,牺牲"换模型"的灵活性,换"单模型极致吞吐"。

CNBC 报道,Taalas 当前的芯片跑的正是 Meta 的 Llama 3.1 小版本;制造工艺用的是相对老一些的 TSMC 节点;片上 SRAM 把内存读数这条路基本砍掉。在 CNBC 引用 AMD 的口径里,这种思路对特定模型的输出速度,比传统 GPU "快上数千倍"。

AMD 公告同时把 Taalas 的归属说得很清楚:它会进 AMD Helios 机架方案Instinct GPUEPYC CPUROCm 软件的完整 AI 体系里。换句话说,Taalas 不是一个独立部门,而是 AMD AI 推理栈的一层"特定模型加速层"。

行业坐标:三笔交易拼出一张图

把时间轴拉开,AMD 这两年的 AI 收购节奏非常密:

  • 2024 年:以 6.65 亿美元收购 Silo AI(模型层),以 49 亿美元收购 ZT Systems(机架基础,这正是后来 Helios 的雏形);
  • 2025 年:陆续收购 MK1 等小型推理软件公司;
  • 2026 年 7 月:AMD 宣布与 Cerebras 合作,把 Cerebras 训练侧加速器集成进 AMD 系统;
  • 2026 年 8 月 6 日:买下 Taalas,把"推理侧特定模型加速"补齐(来源:CNBC)。

横向看竞争对手:大约 7 个月前,Nvidia 刚刚以 200 亿美元拿下 Groq 资产(来源:CNBC),创下 Nvidia 史上最大并购。两家 GPU 巨头的反应几乎同步,意味着 AI 加速器市场已经默认 GPU 不再是唯一答案

AMD CEO 苏姿丰 7 月在产品发布会说过一句很关键的话:"I'm a big believer that there's no one-size-fits-all as it comes to chips."她同时强调 GPU 仍会占 AI 芯片市场的大头——Taalas 的加入,补的不是主战场,而是"低延迟、首 token 速度敏感"那一块高价值场景。

"硬烧进硅"的成本

这条路不是没代价。一旦权重刻进硅,新模型上线就要重做芯片。Taalas 自家讲"只需更换两层金属",听起来既便宜又快。但从台积电流片到机架部署,中间还有封装、良率、ROCm 软件适配、系统集成——这些都不是 Bajic 在公司主页上写两句就能跨过去的坎。

更现实的问题在于适配窗口。Llama 3.1 这种 8B 小模型生命周期长、推理量大、对延迟敏感,值得烧进硅;但每三个月换一版的前沿大模型,这种专用芯片就是被自己套牢的产品。这也是为什么 Taalas 当前选的是"小模型 + 稳态推理"这个切入口。

所以呢

AMD 没赌"通用 GPU 一统天下"这个旧神话,而是用组合回答推理市场:GPU 负责通用训练+推理,Cerebras 负责训练侧加速,Taalas 负责特定模型推理侧加速。下一阶段真正值得看的,不是 Taalas 团队能不能流片,而是 AMD 能不能把"为单一模型造芯片"这条窄路,在 Helios 这种通用机架里跑成可商用、可复制的方案。

如果跑通,Llama 3.1 这种开源小模型会第一次拥有"专用芯片级"的延迟;如果跑不通,AMD 这次就是给 Nvidia 200 亿美元买 Groq 资产的故事,又加了一集同样的续集

来源参考: