AMD 收下 Taalas 之后:把模型权重刻进芯片,推理的下一站在哪?
8 月 6 日美股收盘后,AMD 官宣收购多伦多初创 Taalas。这家 2023 年才成立的小公司不卖通用加速器,它做的事很简单也很激进——把模型权重直接蚀刻进芯片本身。配合这个时间节点看,NVIDIA 早在 2025 年 12 月就和 Groq 谈下了约 200 亿美元的推理 IP 授权;AMD 这次是把"为单一模型造芯"的路子整个收进自己的 Instinct 体系里。
数字先摆出来
Taalas 在 2026 年 2 月公开的测试芯片 HC1,用台积电 6nm 工艺制造,单卡跑 Meta 的 Llama 3.1 8B 跑到 16,960 tokens/秒。官方口径里这个速度比 NVIDIA GPU 快 48 倍,比 Cerebras 加速器快 8.5 倍。芯片面积 815mm²,53B 晶体管,2.5kW 单卡功耗。值得提醒一句:这是 Taalas 自家披露的 vendor claim,并不是第三方独立跑分;目前能在 chatjimmy.ai 上挂到真硬件做公开 demo,Hacker News 上实测到的速度区间在 14,000–17,000 tokens/秒之间。
数字之外更有意思的是架构。HC1 把芯片划成两块:
- Mask-ROM "recall fabric":模型的权重在流片时永久烧进晶体管之间的连线里
- SRAM "recall fabric":一小块可改写的区域,放 KV cache 和 LoRA 适配器
这意味着推理时不再需要从 HBM/DRAM 反复把权重搬运到计算单元。访存墙——也就是当下所有 LLM 推理最贵的成本——被直接干掉了。
HC2 把天花板推到 200 亿参数
按 Taalas 的计划,HC2 会在 2026 年夏天推出,单芯片目标 200 亿参数。从数学上推:50 片 HC2 通过 pipeline parallelism 级联,理论上就能跑通 1 万亿参数的模型。这和今天大模型推理的多卡部署走的是同一条路,只是换成了"硬编码权重"。
但这就是关键代价——模型一旦被蚀刻进硅,就和那一片芯片永久绑死。想要更新到 Llama 3.2 怎么办?Taalas 的方案是只换两层 metal mask,不用从零重做整片芯片;想要换整个新基模?对不起,从零重新流片。
灵活性 vs 速度:三条硬约束
把这件事放到 AI 基础设施的版图上看,有三条线卡死了 MSIC 不会一夜替代 GPU:
- 更新周期对不上。前沿实验室现在基本是按月发版,一个模型被刻进芯片 6 个月后,新版已经在端上了——硬件"过期"的速度会快过消费电子。
- 冻结的模型没法打补丁。一旦发现 jailbreak 或 prompt injection,硅片里的漏洞没法靠软件热修,所有部署出去的设备都带病。
- 面积换算术不划算。HN 社区估算,HC1 这种密度下存 4GB 权重需要约 800mm² 硅片,等价 DRAM 只需要约 80mm²——10 倍面积惩罚。手机这种对功耗和面积都极敏感的设备短期装不进去。
真正的用武之地:长生命周期的"窄"产品
把上面的限制反过来读,MSIC 的甜点场景反而清晰了:长寿周期 + 模型固定 + 低延迟 + 低功耗的窄产品。Robotics、Drive-thru 点单、车载视觉系统——这些场景的共同点是模型上线后基本不需要换,把模型权重刻死反而是 feature,不是 bug。
AMD 的 SVP of AI Vamsi Boppana 把这次收购的定位讲得很克制:"AMD 正在打造全栈 AI 平台,让客户能为每一类 AI 工作负载选到合适的算力。"言下之意:HC1/HC2 不是用来替代 MI355X 的,是拿来和 Instinct GPU 配对的——prompt 处理这种重计算留在 GPU 上,token 生成这种访存密集的活交给 Taalas 加速器。
推理成本曲线会怎么走
如果 Taalas 的 10–50x speedup 和每 token 成本在量产后真的能兑现,最直接的二阶影响是 test-time scaling。现在让模型"多想一会儿"再去回答是减幻觉最稳的方法之一,但代价是 token 暴增、延迟翻倍。推理芯片把每 token 成本砍一个数量级,模型就有空间把思考预算拉得更长,幻觉控制这件事的天花板会被悄悄推高。
另一条不能忽视的线是 NVIDIA 的反应。Groq 的 IP 已经在 2025 年 12 月装进了 NVIDIA 的产品线,Cerebras 在 wafer-scale 这条路上一路狂奔(今年 GTC 上用 Gemma 4 31B 跑到 1,851 tokens/秒)。AMD 这次收 Taalas 把"专用推理硅"这张桌子掀到了第 N 层——通用 GPU + 专用推理加速器的混合架构,从单家实验变成了行业共识。
所以呢
对关注 AI 基础设施的人来说,AMD-Taalas 不是"GPU 杀手"新闻,而是一个明确信号:推理市场的分层已经开始。训练还要靠 NVIDIA H100/B100/GB200 这类大算力 GPU;推理则会被拆成 prefill 用 GPU、decode 用专用芯片、再加上边缘用 MSIC 这种更激进的方案。闭源大模型按月发版的节奏,会把"灵活性"持续抬到比"极致性能"更高的优先级;反过来,那些模型固定、产品长寿的边缘/机器人/车载场景,会是 MSIC 真正落地的地方。
8 月 6 日是一个时间节点,但 Taalas 收购真正的余震,要等到 HC2 出片、跑通 200 亿参数那一天才会完全释放。