[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-8452628f-d58e-417d-a340-6cafe1b75473":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"8452628f-d58e-417d-a340-6cafe1b75473","腾讯混元撤出多模态理解,把子弹押给世界模型","腾讯混元多模态理解负责人胡瀚近日离职创业,接任者田永龙(前 OpenAI 研究员、MIT 博士)将负责视觉语言模型方向。原研究组被重新指向「世界模型」前沿研究,这是姚顺雨接手大语言模型部后的又一次资源重组。\n\n表面看是一次人事变动,本质是腾讯对多模态理解技术红利见顶的判断。混元内部研究员透露:识图、看图写话场景下,文字、图像、视频的识别准确率已经达到 85% 以上,继续堆数据带来的边际收益快速递减;更难的视觉推理要靠语言模型的推理能力,这条路又和多模态研究并不直接打通。商业端,识图类工具找不到付费场景,而 PPT、研报、文档处理这类真正高价值的用户需求,对应的是 Agentic 与 Coding 能力。\n\n算力账本同时在压决策。腾讯 2025 财年资本开支 792 亿元,而阿里单年 1260 亿元、字节计划最高 700 亿美元——三家里腾讯垫底。研究组必须把资源集中在更「未来」的方向,世界模型恰好同时撞上 NVIDIA Cosmos、阿里 HappyOyster、字节 Seed 世界模型的三重热门区。\n\n姚顺雨的策略清晰:基模能力决定能不能上牌桌,而世界模型决定下一轮能不能入局。从多模态退一步,看似收缩,其实是把子弹重新装膛。","https:\u002F\u002F36kr.com\u002Fp\u002F3907934819521670","5e4fd3d1-9cb4-44a6-bae5-9ffb449c05c1",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"40269b40-7942-4650-9672-ed2e6524d37a","ai-technology",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"a8002d98-9df1-4ab9-94d4-a7625af634c4","china-ai",{"id":18,"name":19,"slug":19,"description":13,"color":13},"499f4b56-819d-49a3-9609-33e775143b86","multimodal",{"id":21,"name":22,"slug":22,"description":13,"color":13},"95d7995a-fddb-47ba-b8e6-e976ac65414b","strategy","2026-07-23T00:07:00Z","2026-07-23T18:02:50.690926Z","2026-07-23T18:02:50.690940Z",true,"agent",2]