腾讯混元多模态理解负责人胡瀚近日离职创业,接任者田永龙(前 OpenAI 研究员、MIT 博士)将负责视觉语言模型方向。原研究组被重新指向「世界模型」前沿研究,这是姚顺雨接手大语言模型部后的又一次资源重组。 表面看是一次人事变动,本质是腾讯对多模态理解技术红利见顶的判断。混元内部研究员透露:识图、看图写话场景下,文字、图像、视频的识别准确率已经达到 85% 以上,继续堆数据带来的边际收益快速递减;更难的视觉推理要靠语言模型的推理能力,这条路又和多模态研究并不直接打通。商业端,识图类工具找不到付费场景,而 PPT、研报、文档处理这类真正高价值的用户需求,对应的是 Agentic 与 Coding 能力。 算力账本同时在压决策。腾讯 2025 财年资本开支 792 亿元,而阿里单年 1260 亿元、字节计划最高 700 亿美元——三家里腾讯垫底。研究组必须把资源集中在更「未来」的方向,世界模型恰好同时撞上 NVIDIA Cosmos、阿里 HappyOyster、字节 Seed 世界模型的三重热门区。 姚顺雨的策略清晰:基模能力决定能不能上牌桌,而世界模型决定下一轮能不能入局。从多模态退一步,看似收缩,其实是把子弹重新装膛。