字节跳动押注 10 万亿参数:一次冲规模的明牌动作
8 月 7 日,《金融时报》报道称,字节跳动正在训练一款参数量高达 10 万亿的大模型,目前处于预训练阶段,通常还要三到六个月才能进入微调和最终发布。这条消息随后被联合早报、奇客 Solidot 等多家媒体转载(见 https://www.zaobao.com/news/china/story20260807-9486328 与 https://www.solidot.org/story?sid=85034)。
10 万亿到底意味着什么
参数是大模型从数据中学到的数值集合,通常被视作模型规模的粗略指标——规模不等于能力,但在闭源系统不公开参数的环境下,它仍是少有的可比锚点。把 10 万亿放回当下语境,可以看到三件事:
- 国内对比:字节 10 万亿 ≈ 月之暗面 Kimi K3(2.8 万亿)的 3.5 倍以上;此前领跑国内的美团 LongCat-2.0 与 DeepSeek V4-Pro 均为 1.6 万亿。10 万亿把国内头部模型的体量再向上推了一个数量级。
- 国际对比:OpenAI、Anthropic 不公开 GPT-5.5、Fable、Mythos 等闭源系统的具体参数,但《金融时报》引述行业估算称,Anthropic 当前最强的 Mythos 5 约 8 万亿参数,Fable 5 约 5 万亿——字节新模型已与 Mythos 处于同一规模区间。
- 节奏对比:国内头部厂商正在持续压缩迭代周期;Kimi K3、LongCat-2.0、V4-Pro 在过去几个月里相继跨过万亿门槛,字节这一步直接把上限抬到两位数。
为什么要「现在做这么大」
把字节这条线放进 2026 年下半年的几个公开线索看会更清楚:
- 开源路线的对位压力。Kimi K3、DeepSeek V4-Pro 走的是「参数可控 + 开源权重 + 跑分对标」路线,开放权重让中小厂可以本地化部署;字节选 10 万亿闭源,实际上是在用规模门槛换差异化护城河——开源阵营很难复刻 10 万亿这种体量的训练成本。
- 场景压力。豆包 2.1 Pro 已经把字节系模型矩阵拉到 180T 日均 token 的 MaaS 规模;在产品侧跑出真实高流量之后,基座模型若不进一步堆规模,很难在 LongCat、Kimi、DeepSeek、Qwen3.8-Max 之间的拉锯中维持能力上限。
- 算力与成本的取舍。预训练一个 10 万亿模型意味着训练算力、数据流水线、容错栈都要重新搭,这本身是一笔不小的固定投入——但对字节来说,豆包现有 MaaS 体量摊薄后,边际成本并不算夸张。
我的判断:规模竞赛的下一步不是更大,而是更稳
把这件事放在中美 AI 竞赛的更宏观背景里看,值得指出三点:
- 参数已经不是秘密武器。Kimi K3 57 分的强能力上限 + DeepSeek V4 Flash 把同等智能成本压到 GPT-5.6 Luna 的 35% 上下,说明真正决定格局的已经不是单一模型的「绝对规模」,而是「强能力 + 高性价比」两条腿;字节 10 万亿押的是上限,不是性价比。
- 闭源对闭源才是主战场。Mythos、Fable、GPT-5.5、字节新模型都是闭源,头部闭源模型之间的差距正在缩小,字节这一步更多是把「我不掉队」的信号立起来,而不是一举拉开身位。
- 真正的悬念在 2027 年上半年。预训练通常还要三到六个月,叠加微调、安全评估、合规上线,新模型最快也要 2026 年底到 2027 年初才会以产品形态面世——届时再看它对 Mythos 的真实能力对位,比现在追参数数字更有价值。
所以呢
对从业者:别被 10 万亿这个数字吓到,真正要看的是它发布后能不能在 Terminal Bench、AAII、IFEval 这类基准上把同规模段的 Mythos 5 拉下来;对投资者:字节这一步意味着国内闭源大模型的战线被进一步推高,开源模型路线在中短期内不会被这条路径取代;对普通用户:豆包现有能力会再上一档,但短期内不必急着把「国内最强模型」的桂冠戴在它头上——至少要等它真正进入微调阶段才有讨论意义。
参考来源:
- Financial Times 原报道(《联合早报》转载):https://www.zaobao.com/news/china/story20260807-9486328
- 奇客 Solidot 报道:https://www.solidot.org/story?sid=85034