检索和推荐的地基是嵌入模型——你刷到的每一条视频号、每一篇公众号文章,背后都是向量在算距离。大模型时代大家盯着对话和生成,嵌入这一层往往被忽视,但它恰恰是把多模态内容接进大系统的转接头。微信视觉团队(WeChat Vision)这次把自家生产环境里的全模态嵌入家族 WeMM-Embedding 整个开源了:2B、4B、9B 三档,Apache 2.0 许可,权重上了 Hugging Face,代码和评测全在 GitHub(arXiv: 2608.24053)。
一张表里的跨度
按官方技术报告,WeMM-Embedding 支持文本、图像、视频、视觉文档和任意交错多模态输入,统一映射到同一向量空间,嵌入取自专用
MMEB-v2(78 个数据集)上的官方结果:2B 版拿到 77.9 的总分,反超此前领先的 8B 开源基线——对照组里 Qwen3-VL-Embedding 8B 是 77.8,VLM2Vec 8B 只有 53.2。9B 版总分 80.6,其中图像 81.9、视频 74.3、视觉文档 83.3,是该表内的最高分(表内两个未公开权重的闭源提交 DME-Small/Medium 也没有超过它)。这些是官方口径的 benchmark 数字,复现代码已随仓库放出。
套娃维度与部署细节
工程上有两个值得注意的点。一是 Matryoshka(套娃)表示:三档模型分别支持 64 到 2048/2560/4096 的可变输出维度,官方数据显示 2B 模型截到 256 维仍保留全维度图文性能的 98.7%——意味着向量库存储成本可以压掉一个数量级而几乎不损失检索质量。二是推理栈:官方验证了 vLLM 0.27.0 和 SGLang 0.5.9 两种 serving 方案,推荐 transformers 5.2.0,评测管线里视频按 64 帧采样。
更严苛的 MMEB-v3 与自曝短板
团队同时放了 MMEB-v3 的成绩:190 个任务,含 78 个 v2 任务、53 个文本任务、47 个 agent 任务、11 个音频任务和 MCMR,不支持的任务直接计零分。WeMM 2B/4B/9B 分别拿到 56.0、58.2、59.5,都高于表内同档的 Qwen3-VL-Embedding(2B 50.9、8B 53.5),也压过 E5-Omni 和 Omni-Embed-Nemotron。但有意思的是音频列:WeMM 全线 0 分,因为模型目前不支持音频输入——官方把这条短板原样写进表格,而不是藏起来。
从跑分到朋友圈
真正的分量在于线上验证。技术报告称,这套模型在 26 项内部基准上取得显著增益,并通过 14 个线上 A/B 测试的持续检验,目前部署在微信的视频号、公众号、朋友圈和电商等推荐搜索场景。也就是说,这不是一个只在榜单上好看的学术模型,而是在微信核心场景里跑过全链路的工业件。
所以呢
嵌入模型是 RAG 和 Agent 时代的水电煤:多模态理解做得再好,检索层接不住就到不了用户手里。把一套生产级全模态嵌入连权重带评测全开源,等于给多模态检索生态补了一块地基——而 MMEB-v3 那一列显眼的 0 分也提醒我们:全模态的"全",永远差一块。
参考:arXiv 2608.24053(huggingface.co/papers/2608.24053)与 github.com/Tencent/WeMM-Embedding。