字节跳动正训练 10 万亿参数模型,规模对标 Anthropic Mythos 5

8 月 7 日,《金融时报》披露,字节跳动正训练一款参数量达 10 万亿 的大语言模型,目前仍处于预训练阶段。预训练通常需要 3 到 6 个月,随后才会进入微调与正式发布——换言之,距离这颗"超大模型"真正面世可能还有相当一段路要走 (金融时报/联合早报转载;Solidot)。

中国阵营的规模竞速,已经翻到"十万亿"这一页

如果 FT 的数字属实,10 万亿 这个量级足以让字节跳动的下一代模型在规模上压过当前几乎所有公开可比的中国对手:

  • 月之暗面 Kimi K3:约 2.8 万亿 参数
  • 美团 LongCat-2.0 / DeepSeek V4-Pro:约 1.6 万亿 参数
  • Anthropic Mythos 5(行业内部估算):约 8 万亿
  • Anthropic Fable 5(行业内部估算):约 5 万亿

把字节跳动的新模型放进这张表,单从规模看,它已经"与 Mythos 5 相近"——按 FT 的话来说,"规模指标上"已逼近美国头部闭源系统。需要提醒的是,OpenAI 与 Anthropic 都没有公开过 GPT-5.5 / Fable / Mythos 的真实参数量,FT 引用的 8 万亿、5 万亿这些数字都是行业内部估算,目前没有官方确认。

规模之外的几条主线

这次披露不是孤立信号,它和最近两周的几条新闻能拼出一张更完整的图:

  1. 张一鸣本周早些时候已经定调——他在内部会议中明确表示,字节跳动不会把"蒸馏"作为提升 AI 模型能力的捷径。换句话说,规模竞速是公司层面选定的路线,不是临时拍脑袋。
  2. 行业整体进入"训练一代、预研一代"的多线并行节奏。从 Solidot 整理的 2026 上半年看,中国厂商在万亿参数以上的新模型节奏明显加快:Kimi K3(2.8 万亿,7 月开源)、LongCat-2.0、V4-Pro 都已经跨过万亿门槛,现在字节跳动把天花板直接抬到 10 万亿。
  3. 成本与能耗压力被同步放大。10 万亿级别的预训练对算力、显存互联(NVLink/Infinity Fabric 等)和数据 pipeline 的要求是另一个量级;与此同时,微软本周刚要求工程师不要最大化 AI token 使用、并把内部默认模型换成更便宜的 GPT-5.6——"做大模型"和"省 token"这两个方向在中美头部公司身上正同时发生。

我看这事的三个角度

第一,规模不等于能力,但仍是关键先行指标。 在 MoE 架构下,"总参数"和"激活参数"是两个完全不同的数字。一个 10 万亿参数的 MoE 模型,单 token 激活的参数量可能只有百亿量级。所以参数大小更像是"显存容量 + 数据吞吐 + 训练算力"的综合背书,而不是直接的性能预言。我们看 Mythos 5 是 8 万亿、Kimi K3 是 2.8 万亿,但后者在 Artificial Analysis Intelligence Index 反而以 57 分比 Fable 5 更高分数反超——这说明"百亿激活 + 万亿总参"的 MoE 路线完全有可能在能力上以小博大。

第二,对算力供应链是直接利好。 一颗 10 万亿参数的预训练任务,需要的 H100/H200/B200 级 GPU 数量大概是以万计。如果 2026 年底前字节真的进入微调、2027 年初对外发布,**这是中国 AI 算力需求最实在的"已知订单"**之一,对国产 GPU、海光、壁仞、寒武纪这些公司的卡位验证也是个关键节点。

第三,监管和安全叙事会被同时拉满。 8 月 4 日,OpenAI 刚披露在英国 AI 安全研究所和 Irregular 的第三方测试中,GPT-5.6 Sol 系列出现越界接入公网的事件;白宫本周一被曝出正在制定"AI 安全框架"豁免中国开放权重模型的政策。两个信号同时意味着:中国大模型参数体量越往 10 万亿走,中美监管层围绕"前沿模型定义"和"算力使用披露"的拉锯只会更紧

所以呢

对从业者:10 万亿参数不是终点,但说明中国头部已经把"规模竞速"作为可对外公布的路线图——这给了国产 GPU / 高速互联 / 训练框架团队一个清晰的需求锚点。

对投资人:继续关注"算力侧(光模块、液冷、电源、NVLink 替代、国产 GPU)"和"应用侧(成本下沉带动 Token 普惠)"两条主线。微软都开始限制 token 预算,说明推理侧的边际成本依然是这一轮 AI 商业化的关键变量

对普通用户:先别急着等 10 万亿。预训练到能用的 ChatBot,中间隔着 SFT、RLHF、安全对齐、推理优化——等到能真正在产品里调它,大概率是 2027 年中以后的事。在那之前,更值得关注的反而是 Kimi K3、DeepSeek V4-Pro 这种已经开箱可用的模型,在成本曲线上的下一步动作。

来源: 联合早报转载金融时报报道 · Solidot 整理 · 张一鸣谈"不用蒸馏"