AMD 收下 Taalas:把 Llama 权重烧进 ASIC,推理速度把 GPU 甩在身后

8 月 6 日,AMD 官宣收购位于多伦多的 AI 推理芯片初创公司 Taalas,把这家“把模型权重烧进硅片”的玩家正式纳入自己旗下 [^1]。这笔交易由 AMD 高级副总裁、Vamsi Boppana 的 AI Group 主导,Taalas 联合创始人、CEO Ljubisa Bajic(前 Tenstorrent CEO、前 AMD 高管)和整个加拿大团队将并入 AMD。

技术核心:HC 路线不是 GPU,也不是普通 ASIC

Taalas 2023 年才在加拿大成立,2026 年 2 月才出 stealth 模式 [^2]。他们的核心思路被外媒 EE Times 形象地称为“把 AI 模型本身当成一台计算机” [^3]:让芯片的硬件数据流围绕一个特定模型的计算图来设计,并把权重烧进金属层 — 不是存在 HBM 里,是直接做成互连线路的一部分。换句话说:

  • 不是 GPU — 不接受重新编程,硬件只为某一个模型服务;
  • 不是普通 ASIC — 谷歌 TPU、AWS Trainium 仍能在软件层面做编译,HC1 把那一步也砍掉了;
  • 不是 MRAM / 浮点优化 — 全 SRAM,单模型全部驻片。

首代 HC1 用台积电 6nm 工艺,die size 815mm²、晶体管数 53B、整张卡功耗 2.5 kW。HC1 在 Llama 3.1 8B 上能输出约 17,000 tokens / 秒 / 用户 [^4]。对比基线是 Nvidia H200。模型更新时不需要从零流片 — 只改两层金属(金属层之上承载权重与数据流),官方说法是“两个月,不是两年”就能出新版本。

AMD 想怎么用:推理生意上补齐“机柜视角”

AMD 在自己官方通稿里写得相当克制,只提 “进一步差异化 AI 路线图”“为 AI 推理市场提供加速计算解决方案” [^1]。但 EE Times 给出了一种更激进的解读:HC 类结构化 ASIC 在 LLM 解码(decode,token-by-token 生成)这种吃带宽、吃延迟的阶段非常合适。和英伟达收购 Groq 之后用 Groq 处理 decode 的方案形成镜像 [^3]:

  • AMD 已经宣布 Instinct GPU 与 Cerebras 在“分离式推理”上的合作(GPU 干 prefill,Cerebras 干 decode);
  • Taalas 加入后,AMD 自家就能在 decode 阶段补一个比 Cerebras 更省电的选项。

EE Times 进一步推测,HC 系列会面向两个场景 [^3]:

  1. 物理 AI、边缘推理 — 小模型(≤ 8B)受益于 HC 芯片“单价低、功耗低、不经常换模型”的特点,对应 AMD 已经做了一段时间的 FPGA / SoC 客户群;
  2. 大型模型 — 通过多芯片堆叠(30 颗 HC 跑 DeepSeek-671B 级别的模型)覆盖更上层的推理负载。

算力经济学:拷问 GPU 模型的“丹尼尔斯曲线”

Forbes 专栏作者 Karl Freund 在 2026 年 2 月 Taalas 出 stealth 时就替读者算过一笔账 [^2]:

模型 HC1 推理单价 (per 1M tokens) GPU 现役方案 (per 1M tokens)
Llama 3.1 8B 0.75 美分 3.79 美分
DeepSeek R1 7.6 美分 (sim) 20–49 美分

搭配功耗(HC1 机柜 12–15 kW vs GPU 机柜 120–600 kW),Taalas 阵营宣称“在四年生命周期内 capex 下降 60–75%” [^2]。AMD 通稿没有宣称这些数字,但收购落地,意味着 AMD 内部至少愿意把这些算式放在谈判桌上。

我的看法:这是一笔“打补丁”而非“改路线”的并购

几个值得注意的细节:

  1. Taalas 不解决训练问题。这是纯推理一侧的补强,对 AMD MI400 / MI450 的训练路线图没有直接影响。
  2. “机柜级推理”阵营正在成形。从 Nvidia 吃下 Groq、AMD 这次吃下 Taalas、再加上与 Cerebras 的合作,2026 年下半年起 AI 推理硬件会明显从“一张卡即一切”转向“机柜级特化分工”。
  3. 风险在 Taalas 这边。HC 路线的代价是“换模型就要重新流片”,团队必须把两个月的迭代能力带走,对台积电的依赖是 TSO。AMD 强大的工程资源能扩产能,但模型节奏(每年 1–2 次迭代) vs 硬件节奏(流片 12–18 个月)的错位仍是结构性挑战。
  4. 对小模型阵营是个利好。Physicial AI、agent、edge 设备这些“推理频繁、模型相对小且稳”的场景,未来 12 个月可能看到更多“ASIC + 标准化模型栈”的耦合方案。

对从业者来说,关注点很简单:AMD 与 Taalas 团队的整合节奏,以及第一批 HC-as-decode 的 Instinct 配套机柜什么时候进入主流云厂。Forbes 文章里那句 “May you live in interesting times” [^2],今年 AI 推理侧的从业者可能引用得比往年更频繁。


[^1]: AMD IR Press Release, “AMD Acquires Taalas to Advance Compute Solutions for Rapidly Growing AI Inference Market”, 2026-08-06. https://ir.amd.com/news-events/press-releases/detail/1296/amd-acquires-taalas-to-advance-compute-solutions-for-rapidly-growing-ai-inference-market
[^2]: Karl Freund, “Taalas Launches Hardcore Chip With ‘Insane’ AI Inference Performance”, Forbes, 2026-02-19. https://www.forbes.com/sites/karlfreund/2026/02/19/taalas-launches-hardcore-chip-with-insane-ai-inference-performance/
[^3]: Sally Ward-Foxton, “AI Chip Startup Taalas Acquired by AMD”, EE Times, 2026-08-06. https://www.eetimes.com/ai-chip-startup-taalas-acquired-by-amd/
[^4]: Taalas official Products page, “HC1 Technology Demonstrator”. https://taalas.com/products/