2026 年 7 月,月之暗面 Kimi K3 与 DeepSeek V4-Flash 几乎前后脚发布。两款模型在 Coding 与 Agent 榜单上的位次咬得很紧,但走的却是完全不同的两条技术路线。

K3 是把视觉一起拉进主模型;V4-Flash 是把参数规模按下去,只靠后训练。

K3 总参数 2.8 万亿,每个 token 激活约 1040 亿,延续了 K2.5 的 early fusion 路线——在约 15 万亿混合图文 token 的联合预训练中,始终按固定比例混合文本与视觉数据,并从零训练了一个 4 亿参数的视觉编码器 MoonViT-V2。K3 发布后一度以 1679 分登顶 Arena Frontend Code,前面只剩 Claude Fable 5、GPT-5.6 Sol 等少数对手(Arena WebDev 上 K3 与 V4-Flash 也都跑进了 Top 区间,前者 1679 分,后者 1577 分)。

DeepSeek V4-Flash 选择不去掺和视觉。它的总参数只有 2840 亿,每个 token 激活约 130 亿,大约只有 K3 的十分之一和八分之一。模型没有调整架构和参数规模,而是把更新集中在后训练——结果,在 DeepSeek 自己公布的 Coding 和 Agent 评测中,正式版大幅超过预览版,甚至超过此前的 V4-Pro 预览版。

紧接着阿里发布的 Qwen3.8-Max,又选择了与 K3 相近的"大而全"方向:总参数 2.4 万亿,每个 token 激活约 950 亿,同时承载原生视觉、Coding 与 Cowork 能力。三家头部基模,排成两种路线:Kimi 与 Qwen 押宝"超大参数 + 原生多模态",DeepSeek 押宝"小模型 + 后训练加压"。

Agent 为什么需要眼睛

视觉对 Agent 越来越关键。OpenAI 1 月发布的企业使用报告显示,在研发岗位最常使用的三类 ChatGPT 工具中,图片上传排第三位,仅次于搜索和数据分析。当 Agent 开始生成网页、操作软件并检查运行结果,视觉就成了模型检查工作、发现错误和调整行动的反馈。

Kimi 方面把这种"在代码与截图之间反复迭代"的方式称为 "vision in the loop"——模型写完代码后查看页面,再根据视觉结果继续调整。浏览器开发平台 Puter 曾在测试网页中制造 5 处视觉偏差,K3 对照目标页与运行页截图全部找出,没有误报。

相比之下,纯文本模型只能靠 OCR 或外挂视觉语言模型先把图片转成文字、标签、坐标或结构化字段。在一位多模态研究员看来,这种"一个 LLM 是'瞎子',下游配一个能看清楚的小弟"的模块化方案有边界——视觉输入与语言主干之间"通信的通道会更宽",不是先把画面压缩成文字再交给另一个模型。原生多模态模型还可以在视觉强化学习中重新读取自己生成的页面或图像,把视觉结果纳入同一条训练轨迹。

但视觉是不是模型理解世界不可缺少的部分,业内始终没有共识。OpenAI 联合创始人、前首席科学家 Ilya Sutskever 曾把文本称为"世界的一种投射":人类已经把大量现实规律压缩进语言,模型持续学习文本,仍可能获得对世界的理解。Meta 首席 AI 科学家 Yann LeCun 几乎持相反判断:"绝大多数人类知识,并没有以文本形式表达出来。"语言是经过人类筛选和概括的信息,模型要理解物体、空间和行动,最终仍要从图像、视频和现实交互中学习。

视觉的代价:1+1 显著大于 2

把视觉嵌入主模型,代价并不只是"接入一个输入"。

图像与文字的数据结构、信息密度和学习速度不同。当它们共同训练同一套主干参数时,视觉数据会与文本、代码、数学和推理争夺模型容量;不同训练目标也可能相互干扰。Kimi K2.5 技术报告在一项融合时机消融实验中记录过这种影响:如果在训练中后期才加入视觉数据,模型的文本能力会先下降,再逐渐恢复。

"任务越多,越难平衡。"一位多模态研究员说,"只做一个任务,可以一直往一个方向调;同时做两个任务(视觉 + 文本),要么模型更大一点,要么数据更多一点。"

苹果公司的 MM1 技术报告也提示过类似结论:视觉编码器、图像分辨率和视觉 token 数量都会影响模型效果;更高的分辨率和更多视觉 token 通常也带来更高的训练与推理开销。对于只需读取几个字段的任务,让通用模型反复查看整张图片,不一定比 OCR 或专业模型来得划算。

时机分歧:把算力留给多模态还是 Coding

DeepSeek 创始人梁文锋此前说过一句话:"把 AI 训练做好,并不需要世界模型,甚至不用多模态。"但他同时表示:"多模态最终还是要做的。"这两句话并不矛盾。各家公司对多模态的长期价值没有太大分歧,真正的分歧在于时机和代价。

6 月底,智谱首席科学家唐杰在 X 平台向用户征集"下一版 GLM 必须加入哪些新功能",评论区反复出现的答案是"视觉"。从公开口径看,智谱与腾讯混元的下一代通用基座模型,都有可能进一步向原生多模态迈进。

但 DeepSeek V4-Flash 已经先一步证明,在不加入视觉、也不大幅扩张参数规模的情况下,后训练仍能显著提升 Coding 等核心任务能力。这就让当下的资源分配问题变得相当具体:把训练视觉的算力和数据预算,提前投入,还是先在 Coding 与 Agent 上把分数卷起来?

多位业内人士认为,在 Agent 任务链越来越长的阶段,Coding 才是上牌桌的门槛,Coding 冲不上去可能就没有未来的机会。换句话说,Coding 与 Agent 能力的变现速度是几个月甚至几周;而模型从"看得见"走到"看得懂"则是一个更漫长的进化周期。

评论:两个时钟同时在走

围绕多模态,国产头部基模正在打两种时间节奏的赛跑。

把视觉提前塞进主模型,意味着"未来看现在"——赌的是 Agent 接管更多长链任务、网页和 GUI 成为模型主要工作面之后,视觉反馈会从加分项变成入场券。K3、Qwen3.8-Max 押的就是这条路。

把视觉放一放、把参数规模按下去、把所有力气压在后训练,意味着"先守住眼下"——赌的是 Coding 与 Agent 榜单会持续滚动,排名比"看得见"更靠近现金流。DeepSeek V4-Flash 押的就是这条路。

这两条路线不是非此即彼。Kimi 的策略早就在做后训练,DeepSeek 早晚也会做原生多模态。但在 2026 年夏天这个时间点,它们各自在训练成本与产品决策之间画了一条明显的线——这条线与其说由技术结论决定,不如说由公司对节奏的判断决定。至于这两条线最终会在哪一年交汇,留给下一个交付周期去验证。

来源说明:本文事实点(模型参数、benchmark 分数、发布时间线、人物引语、技术报告结论)均回溯到原报道 36 氪《Kimi K3 与 DeepSeek V4 之间,隔着原生多模态的时间差》 及 Kimi K2.5 技术报告。