人听到身后的门铃声,不用回头就知道它在哪;而今天的具身智能体几乎全是"聋子"——摄像头看不到的声源,对它们等于不存在。北大 VaLuE 实验室联合阿里、清华发布并开源了 OmniEcho,第一次把空间音频做成了具身智能的一等感知通道(arXiv:2609.23407)。

基准:真实场景里"听声辨位"

配套的 OmniEchoBench 覆盖 6 项任务、197 个真实音视频场景、2972 组问答和 900 条声导导航样本,音频全部用一阶高保真立体声场(FOA)四通道格式在 30 个真实室内环境采集,共 12900 条录音。问答部分拆得很细:声源方向 1069 题、3D 定位 521 题、声源运动 473 题、相机旋转 309 题,另有 600 题要求模型在鸟瞰地图上圈出声源位置——直接考"听觉+认知地图"的整合能力。题目设计刻意让声源处在画面外或正在穿越视野边界,视觉流单独不足以答题。

方法:冻结主干,只嫁接一只"空间耳朵"

OmniEcho 建在 Qwen3-Omni-30B-A3B 上,训练分三阶段:先用 10 万段合成 FOA 片段预训练轻量空间编码器(d=384),以 SigLIP 目标对齐文本语义;再加查询条件定位头,预测方位角、俯仰角和距离;最后把冻结的空间编码器"嫁接"进 Qwen3-Omni——原生音频塔、视觉塔全部冻结,只训 LLM 参数和投影层,空间 token 按 7Hz 网格插到语义音频 token 之后。训练数据共 363,193 条,第三阶段在 32 张 A100 上跑约 4 天。

跑分:大幅领先基线,但绝对值很低

音视频输入下,Qwen3-Omni 基线总分只有 18.5,OmniEcho 做到 28.5;认知地图子项从 22.3 拉到 47.5,提升最猛;3D 定位从 7.7 到 14.2。消融显示两只"耳朵"缺一不可:去掉原生音频编码器掉到 26.2,去掉 FOA 编码器掉到 19.8,第三阶段解冻空间编码器反而全面退化。导航侧,声导成功率 16.2%、SPL 11.5%,超过文本导航的 Seq2Seq(11.3)和双耳基线 SoundSpaces(5.4),但比文本指令的 InternVLA-N1(17.8)还低 1.6 个点;在 R2R 上 22.2% 的成功率也明显落后 VLN-R1、NAViLA-SAGE 等强文本方法。

所以呢

两个值得记住的信号:一是空间音频确实是没被吃干的信息源,单加一只冻结的"空间耳朵"就能让认知地图类任务翻倍;二是绝对分数揭示了真实差距——方向粗判可以,精细定位和距离估计仍是公开难题,论文自己也没回避。对做机器人和 Agent 的团队,基准与数据管线都已在 GitHub(PKU-VaLuE-Lab/OmniEcho)开源,等于免费领到一套"听力考卷"。当视觉卷到边际递减时,听觉可能是具身智能下一个便宜的增量。

参考:arxiv.org/abs/2609.23407