腾讯混元 Hunyuan-A13B 开源实测:80B 总参 / 13B 激活,GQA + FP8/INT4 把 MoE 推理门槛打到消费卡
背景:MoE 模型的"激活参数"为何重要
过去一年,主流大模型明显分成了两条路线。一条是"堆总参数 + 全激活"的密集型路线,代表是 Llama 3 70B、Qwen2.5-72B 这种全量激活的稠密模型;另一条是"总参数大、激活参数小"的 MoE 路线,通过路由只激活一小撮专家,在保持单次推理算力可控的前提下放大模型容量。DeepSeek-V3、Mixtral、Qwen3-A22B 都属于后者。
腾讯混元最近在 GitHub 开源的 Hunyuan-A13B,是这条路线的最新一站。它的总参数是 80B,但每次推理只激活 13B,比 Hunyuan-Large(389B 总参)小一个量级,激活参数也比 Qwen3-A22B(22B 激活)更小,瞄准的就是"在企业算力预算内塞下旗舰能力"这个长期痛点。
核心:细粒度 MoE + 双模思考 + 256K 上下文
Hunyuan-A13B 是细粒度(fine-grained)MoE,把专家切得更细,路由更灵活,这跟之前业内常见的 8/16 粗粒度专家结构有明显区别。配合 Grouped Query Attention(GQA),KV Cache 占用比 Multi-Head Attention 低一截,长上下文场景下显存压力直接下降一档。
模型原生支持 256K 上下文,官方 README 强调在长文本任务上表现稳定,这对代码库分析、长文档问答、Agent 长链路任务都直接有用。
另一个有意思的设计是双模思考:模型默认走慢思考(slow thinking / CoT),但用户可以在 prompt 前加 /think 或 /no_think 强制切换,或者调用 apply_chat_template 时把 enable_thinking 设为 False 直接关掉。这跟 Claude Opus 5 那条 adaptive thinking 路线一脉相承,只是 Hunyuan 给的是显式开关,部署端可控性更强。
量化体系:AngelSlim 一把梭,FP8/INT4 几乎不掉点
量化是这次开源最值得展开的部分。腾讯没有像别家那样丢一个 GPTQ/INT4 checkpoint 就完事,而是把量化工具体系 AngelSlim 和量化模型(BF16/FP8/INT4 checkpoint)一起放出,覆盖 BF16、FP8(static)、GPTQ-INT4 三档,直接对接 TensorRT-LLM、vLLM、SGLang 三大推理框架。
性能损失几乎可以忽略。README 给的对照表(基模型 vs FP8/INT4):
| Bench | BF16 | FP8 | INT4 |
|---|---|---|---|
| AIME 2024 | 87.3 | 86.7 | 86.7 |
| GSM8k | 94.39 | 94.01 | 94.24 |
| BBH | 89.1 | 88.34 | 87.91 |
| DROP | 91.1 | 91.1 | 91.05 |
AIME 2024 这种高难度数学基准,INT4 跟 BF16 只差 0.6 分,在很多企业私有部署场景里,这就是"能跑"和"跑不起"的区别。
Agent 能力:BFCL-v3 / τ-Bench / C3-Bench 拿第一档
Instruct 版本在 Agent 评测上是这张表最有信号的一行:
- BFCL-v3:78.3(Qwen3-A22B 是 70.8,DeepSeek R1 是 56.9)
- ComplexFuncBench:61.2(Qwen3-A22B 是 40.6,DeepSeek R1 是 41.1)
- C3-Bench:63.5(Qwen3-A22B 是 51.7)
数学上 Hunyuan-A13B 也不弱:AIME 2024 87.3、AIME 2025 76.8,跟 DeepSeek R1 一个量级,小幅落后 Qwen3-A22B。综合来看,它在 Agent 实用性这个当下最被企业买单的方向上,给出的权衡确实够厚道。
部署:三个推理后端,Docker 镜像都打包好了
部署侧的友好度是这个 repo 让人省心的部分:
- TensorRT-LLM:官方给了 hunyuaninfer/hunyuan-a13b 的 Docker 镜像,起服务一条命令
- vLLM 0.8.5:有专门的镜像,cuda 12.8 起步,TP=4 就能拉起 OpenAI 兼容 API
- SGLang:同样有官方镜像
INT4 量化版本理论上能塞进单卡 24GB 显存(80B 总参 INT4 约 40GB,实际推理时再加 KV 缓存和 batch 开销可能需要双卡或者 NVLink),但相对全量 BF16 需要多卡 H100,这已经是开源 MoE 落地最务实的姿态了。
个人评论:Hunyuan 在"实用开源"这个赛道上追平了
把视角拉到行业层面:
- 细粒度 MoE 是中国开源阵营的共同选择。Qwen3-A22B、DeepSeek V3 都是这条路。Hunyuan-A13B 选 80B/13B 这个档位,比 A22B 更克制,显然瞄准的是中等企业机房、单台 8 卡或 4 卡节点的预算线。
- 量化即产品。AngelSlim 这套工具不是额外福利,而是把 FP8/INT4 checkpoint 当作一等公民交付。对私有部署来说,这相当于把"买卡预算"和"模型能力"解耦了。
- Agent 评测权重在变化。BFCL-v3 / τ-Bench / C3-Bench 这类 agentic benchmark 的分数,正在变成企业采购开源模型的硬指标。Hunyuan-A13B 在这一档的领先,会让它在 2026 下半年的企业 Agent 选型里被反复点名。
所以呢:如果你正在选一个能本地部署、不挑卡、能跑 Agent 的开源 MoE,Hunyuan-A13B 是当下最值得放进 PoC 列表的候选之一。但要注意,80B 总参的 INT4 量化只是"能跑",真要做 Agent 长链路 + 256K 上下文,显存和吞吐还是要按 A22B 同等量级去规划,别被 13B 激活的纸面数字误导。