做检索的人一直面对同一个尴尬:文本用一套模型,图像换一套,音频再换一套,跨模态检索要么拼接多个嵌入向量,要么干脆放弃。9 月 21 日,阿里 ATH-MaaS 团队在 arXiv 公开技术报告(编号 2609.25165),放出一个试图终结这种碎片化的方案——Ovis-Omni-Embedding-3B,一个覆盖文本、图像、视频、音频、视觉文档乃至交错多模态输入的统一嵌入模型。

不拼塔,直接用全模态底座

大多数多模态嵌入模型的思路是"组装":文本塔加视觉塔,各自编码再对齐。Ovis 团队反其道而行,直接拿预训练好的 Qwen2.5-Omni-3B 全模态模型当底座,砍掉语音生成用的 Talker 模块和语言建模头,保留原生文本 tokenizer、视觉编码器、音频编码器和共享的 Thinker 主干——最后一个非填充 token 的末层隐藏状态,直接拿来当检索向量。

训练侧的三板斧也都围绕"统一"展开:对比学习加低秩初始化做适配;构造覆盖文本、图像、视频、音频和交错多模态数据的高质量语料,用同源采样保证批内负样本够"难";损失函数用 focal loss 强调困难样本,再加一个基于相似度的嵌入蒸馏,从互补专家模型转移细粒度相似结构。推理时的低秩特征分解则允许弹性降维——2048 维可以压到 1024、512、256 甚至 128,性能损失有限。

分数说话:音频组领先最多

官方自报的成绩单(GitHub README):在覆盖 190 个数据集的 MMEB-v3 上,Ovis-Omni-Embedding-3B 综合 58.46 分,比最强对比基线的 53.27 高出 5.19 分,六个模态组全部第一。分组看,音频组优势最大(50.08 vs 43.17,领先 6.91 分),Agent 检索组次之(45.52 vs 39.42,领先 6.10),图像组反而只领先 3.72 分。在完整对比表的 31 个条目里,它 22 个第一、8 个第二,唯一掉出前二的是 MultiConIR。

三个补充基准同样值得看:音频嵌入基准 MAEB 57.29(对比 LCO-Embedding-Omni-7B 的 53.54),视频基准 MVEB 61.77(对比 57.58)。但在纯文本检索的 RTEB 上,它对 Qwen3-Embedding-4B 的优势只有 67.35 比 67.27——0.08 分的差距,基本等于噪声。

冷水与看点

两盆冷水先泼。第一,这些分数全部来自团队自报,评测是本地跑分后插入对应榜单快照,尚无第三方复现。第二,也是更关键的:README 明确写着模型权重"暂未开源,将于近期放出"。一个声称统一全模态检索的模型,如果最终权重不放或放得抠门,行业影响力会大打折扣——3B 参数、2048 维嵌入的方案,只有在别人真能部署时才有意义。

看点同样有两个。其一,3B 参数在嵌入赛道属于轻量级,却能同时吃下六种模态,如果权重如期放出,对做 RAG、多模态知识库、Agent 记忆检索的团队是现成的地基。其二,弹性降维设计(2048→128)直接对标 Matryoshka 类方案,给了存储敏感场景一个官方退路。

所以呢?嵌入模型正在从"每个模态一个专家"走向"一个底座通吃",Ovis 证明了全模态底座改造成检索模型的路走得通,但 0.08 分的文本险胜和未放出的权重都在提醒:统一是趋势,护城河还没建起来。权重放出来那天,这篇报告才真正值得再看一遍。