Coding 之外,关于原生多模态的争论从未停止

过去一年,Coding 与 Agent 能力不断改写大模型排名,也是当前 AI 最快兑现商业价值的场景之一;但 Coding 之外,另一个更长期的命题正在被拉回到桌面中央:通用大模型要不要长出「眼睛」?

刚刚过去的 7 月,月之暗面发布 Kimi K3,总参数 2.8 万亿、支持 100 万 token 上下文,延续 K2.5 的 early fusion(早期融合)路线,在预训练阶段就把图文按固定比例混合,同时从零训练了约 4 亿参数的视觉编码器 MoonViT-V2,不再依赖 SigLIP 初始化权重。K3 在 Arena Frontend Code 榜单上曾以 1679 分登顶,浏览器开发平台 Puter 在测试页中故意埋了 5 处视觉偏差,K3 对照目标页与运行页截图,全部找出且零误报。月之暗面把这种「写完代码→看页面→再改」的循环命名为 vision in the loop:模型自己看自己写出来的东西。

而同期走向 GA 的 DeepSeek 走了另一种答案。DeepSeek V4-Flash 正式版总参数 2840 亿、每个 token 激活 130 亿,分别约为 K3 的十分之一和八分之一。它不调整架构、也不扩张参数规模,而是把更新集中在后训练。结果是:在 DeepSeek 公布的多项 Coding 与 Agent 评测中,正式版大幅超过预览版,甚至超过此前的 V4-Pro 预览版;Arena WebDev 公开得分也一度升至 1577,接近 GLM-5.2。

一句话总结:同样是在 Coding 这一张牌桌上,K3 选择为大模型额外接入视觉感知,V4-Flash 选择把 Coding 分数硬打到极致。

为什么 Agent 必须「看见」

一位多模态研究员把核心论点讲得很直白:「长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。视觉是一种更准确的反馈,也更贴近用户意图。」

纯文本模型本身仍然「看不见」。实际系统可以调 OCR、独立 VLM 或 MCP 接入的视觉工具——把图片转成文字、标签、坐标或结构化字段,再交给主模型推理。这条「外挂」路线工程上完全可行,但原生多模态派认为它有两个天花板:一是画面先被压缩成文字,带宽变窄;二是后训练时要让视觉反馈纳入同一条训练轨迹比较难。

杨立昆与 Ilya Sutskever 的分歧也适用于此:杨立昆认为「绝大多数人类知识,并没有以文本形式表达出来」,模型要真正理解物体、空间和行动,最终仍要从图像、视频和现实交互中学习;Ilya Sutskever 则坚持「文本是世界的一种投射」,只要模型持续吃文本,就能获得对世界的理解。两条路径都不否认多模态的价值,分歧只在时机与代价。

多模态的代价:不是 1+1,而是大于 2

把视觉接进 LLM,看起来只是新增一个输入接口,实际却要面对结构性冲突。图像与文字的数据结构、信息密度和学习速度都不同;它们共享同一套主干参数时,会和文本、代码、数学、推理争夺容量,不同训练目标也会相互干扰。

Kimi K2.5 的技术报告给出一个直观的消融证据:如果把视觉数据放到训练中后期才加入,模型的文本能力会先下降,再缓慢恢复。换句话说,「1+1 大于 2」是真实存在的成本——vision-in-the-loop 做得越好,语言/Coding 的稳定性越需要重新平衡。

另两个隐性成本:算力与数据。苹果 MM1 论文指出,视觉编码器、图像分辨率、视觉 token 数量都会显著影响效果;更高的分辨率与更多视觉 token 通常意味着更高的训练与推理开销。而对那些只需读几个字段的任务,让通用模型反复查看整张图片,未必比 OCR 或专业模型更划算。

国产头部已经分裂成两条路线

放眼 2026 年 8 月的国产通用基座阵营,路线选择已经肉眼可见:

  • 原生多模态派:月之暗面(Kimi K3,2.8T/104B)、阿里(Qwen3.8-Max,2.4T/95B,同时承载原生视觉、Coding 与 Cowork 能力)、字节(Doubao-Seed-2.1,视觉理解和多模态输入作为主要功能)——共同特征是「水桶模型」,在大参数规模下原生融合视觉;
  • 纯文本后训练派:DeepSeek(V4-Flash 284B/13B)、智谱(下一代通用基座被业内预期将进一步向多模态靠拢)、腾讯混元——基座仍以文本输入为主,先把 Coding/Agent 分数拉满。

DeepSeek 创始人梁文锋那句「把 AI 训练做好,并不需要世界模型,甚至不用多模态」,常被引用为「不看好多模态」的证据;他后半句补得也很直接——「多模态最终还是要做的。」这两句话并不矛盾,真正的分歧在于:Coding 还在快速迭代的阶段,要不要同步花资源训练视觉?

写作这篇文章的意义:两个时钟在赛跑

如果只看 Coding 与 Agent 的短期排名,这是一场几个月甚至几周就会重新洗牌的短跑;但如果把视野拉到世界模型这个维度,通用大模型从纯文本走向真正的视觉理解,是一场以年为单位的马拉松。

K3 在跑前一个时钟——它用 2.8 万亿参数、native 视觉、100 万上下文把 Arena Frontend Code 的上限往上顶了一截;V4-Flash 也在跑前一个时钟,它用 1/10 的参数规模、后训练蒸馏,在 Arena WebDev 反超了一众预览版。这两条路短期都有效,但分歧点决定了它们最终能抵达的地方不一样:

  • 当 vision in the loop 成为 Coding Agent 的标配反馈通道时,纯文本 + 后训练的路线会撞上「看得见看不见」的天花板;
  • 而当下一次多模态 benchmark 重新定义 SOTA 时,提前把视觉烧进主干的模型会立刻处在有利位置。

所以呢

对中国大模型而言,这不是关于 AGI 长期路线的分歧,更像是对发展时机和代价的不同押注。眼下商业化压力把 Coding 顶到牌桌门槛——Coding 冲不上去,可能就没有下一轮。但在 Coding 战事胶着的间隙,各家真正在投注的下一个筹码,是愿意提前为视觉留出多少模型容量、数据与算力。

可以确定的一点是:2026 下半年,围绕「原生多模态」的讨论还会持续升温。无论是 Puter 那 5 处被找出的视觉偏差、还是 V4-Flash 用 2840 亿参数在 WebDev 拿到 1577 分,都是这条路线之争的具体注脚。

参考资料:

  • 36氪《Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差》(李炤锋,2026-08-04):https://36kr.com/p/3924826666301831
  • Kimi K3 发布与 Arena Frontend Code 榜单表现(同上来源)
  • DeepSeek V4-Flash 正式版参数与 Arena WebDev 得分(同上来源)