AMD 收下 Taalas:把 Llama 权重烧进 ASIC,推理速度把 GPU 甩在身后
8 月 6 日,AMD 官宣收购位于多伦多的 AI 推理芯片初创公司 Taalas,把这家“把模型权重烧进硅片”的玩家正式纳入自己旗下 [^1]。这笔交易由 AMD 高级副总裁、Vamsi Boppana 的 AI Group 主导,Taalas 联合创始人、CEO Ljubisa Bajic(前 Tenstorrent CEO、前 AMD 高管)和整个加拿大团队将并入 AMD。
技术核心:HC 路线不是 GPU,也不是普通 ASIC
Taalas 2023 年才在加拿大成立,2026 年 2 月才出 stealth 模式 [^2]。他们的核心思路被外媒 EE Times 形象地称为“把 AI 模型本身当成一台计算机” [^3]:让芯片的硬件数据流围绕一个特定模型的计算图来设计,并把权重烧进金属层 — 不是存在 HBM 里,是直接做成互连线路的一部分。换句话说:
- 不是 GPU — 不接受重新编程,硬件只为某一个模型服务;
- 不是普通 ASIC — 谷歌 TPU、AWS Trainium 仍能在软件层面做编译,HC1 把那一步也砍掉了;
- 不是 MRAM / 浮点优化 — 全 SRAM,单模型全部驻片。
首代 HC1 用台积电 6nm 工艺,die size 815mm²、晶体管数 53B、整张卡功耗 2.5 kW。HC1 在 Llama 3.1 8B 上能输出约 17,000 tokens / 秒 / 用户 [^4]。对比基线是 Nvidia H200。模型更新时不需要从零流片 — 只改两层金属(金属层之上承载权重与数据流),官方说法是“两个月,不是两年”就能出新版本。
AMD 想怎么用:推理生意上补齐“机柜视角”
AMD 在自己官方通稿里写得相当克制,只提 “进一步差异化 AI 路线图”“为 AI 推理市场提供加速计算解决方案” [^1]。但 EE Times 给出了一种更激进的解读:HC 类结构化 ASIC 在 LLM 解码(decode,token-by-token 生成)这种吃带宽、吃延迟的阶段非常合适。和英伟达收购 Groq 之后用 Groq 处理 decode 的方案形成镜像 [^3]:
- AMD 已经宣布 Instinct GPU 与 Cerebras 在“分离式推理”上的合作(GPU 干 prefill,Cerebras 干 decode);
- Taalas 加入后,AMD 自家就能在 decode 阶段补一个比 Cerebras 更省电的选项。
EE Times 进一步推测,HC 系列会面向两个场景 [^3]:
- 物理 AI、边缘推理 — 小模型(≤ 8B)受益于 HC 芯片“单价低、功耗低、不经常换模型”的特点,对应 AMD 已经做了一段时间的 FPGA / SoC 客户群;
- 大型模型 — 通过多芯片堆叠(30 颗 HC 跑 DeepSeek-671B 级别的模型)覆盖更上层的推理负载。
算力经济学:拷问 GPU 模型的“丹尼尔斯曲线”
Forbes 专栏作者 Karl Freund 在 2026 年 2 月 Taalas 出 stealth 时就替读者算过一笔账 [^2]:
| 模型 | HC1 推理单价 (per 1M tokens) | GPU 现役方案 (per 1M tokens) |
|---|---|---|
| Llama 3.1 8B | 0.75 美分 | 3.79 美分 |
| DeepSeek R1 | 7.6 美分 (sim) | 20–49 美分 |
搭配功耗(HC1 机柜 12–15 kW vs GPU 机柜 120–600 kW),Taalas 阵营宣称“在四年生命周期内 capex 下降 60–75%” [^2]。AMD 通稿没有宣称这些数字,但收购落地,意味着 AMD 内部至少愿意把这些算式放在谈判桌上。
我的看法:这是一笔“打补丁”而非“改路线”的并购
几个值得注意的细节:
- Taalas 不解决训练问题。这是纯推理一侧的补强,对 AMD MI400 / MI450 的训练路线图没有直接影响。
- “机柜级推理”阵营正在成形。从 Nvidia 吃下 Groq、AMD 这次吃下 Taalas、再加上与 Cerebras 的合作,2026 年下半年起 AI 推理硬件会明显从“一张卡即一切”转向“机柜级特化分工”。
- 风险在 Taalas 这边。HC 路线的代价是“换模型就要重新流片”,团队必须把两个月的迭代能力带走,对台积电的依赖是 TSO。AMD 强大的工程资源能扩产能,但模型节奏(每年 1–2 次迭代) vs 硬件节奏(流片 12–18 个月)的错位仍是结构性挑战。
- 对小模型阵营是个利好。Physicial AI、agent、edge 设备这些“推理频繁、模型相对小且稳”的场景,未来 12 个月可能看到更多“ASIC + 标准化模型栈”的耦合方案。
对从业者来说,关注点很简单:AMD 与 Taalas 团队的整合节奏,以及第一批 HC-as-decode 的 Instinct 配套机柜什么时候进入主流云厂。Forbes 文章里那句 “May you live in interesting times” [^2],今年 AI 推理侧的从业者可能引用得比往年更频繁。
[^1]: AMD IR Press Release, “AMD Acquires Taalas to Advance Compute Solutions for Rapidly Growing AI Inference Market”, 2026-08-06. https://ir.amd.com/news-events/press-releases/detail/1296/amd-acquires-taalas-to-advance-compute-solutions-for-rapidly-growing-ai-inference-market
[^2]: Karl Freund, “Taalas Launches Hardcore Chip With ‘Insane’ AI Inference Performance”, Forbes, 2026-02-19. https://www.forbes.com/sites/karlfreund/2026/02/19/taalas-launches-hardcore-chip-with-insane-ai-inference-performance/
[^3]: Sally Ward-Foxton, “AI Chip Startup Taalas Acquired by AMD”, EE Times, 2026-08-06. https://www.eetimes.com/ai-chip-startup-taalas-acquired-by-amd/
[^4]: Taalas official Products page, “HC1 Technology Demonstrator”. https://taalas.com/products/