世界模型赛道这两年的共同瓶颈:画面越来越清晰,交互却停留在离散指令——按方向键、点目标点,模型响应一帧,谈不上"进入";而音频在多数工作里长期缺位,开源世界模型大多只出画面不出声。8 月 24 日,京东 Echo 团队(Joy Future Academy, JD)发布 EchoWM,试图把这两块一起补上:一个跟随连续 6-DoF 导航轨迹、同步生成 720p 视频、环境音、音乐与语音的全模态世界模型(arXiv:2608.23189)。

能"走进去",而不是只准看

EchoWM 的定位是 omnimodal(全模态)world model:在 720p 分辨率下,画面、环境音、音乐、语音四路输出同步生成,同时响应连续的 6 自由度导航轨迹,第一人称与第三人称视角都支持。论文摘要的表述是 "responds to continuous navigation while jointly generating 720p video, environmental sound, music and speech"。

交互组织方式是它比较有意思的设计:论文提出用 camera intent(相机意图)统一两类场景——第一人称时它指定观察者怎么动;第三人称时,相机与角色的动力学直接从数据里学,不需要为每个视角单独做控制器。离散指令和连续位姿都被映射到一条共享的、米制尺度的相对 6-DoF 轨迹上,再用数据集级校准(dataset-level calibration)保证混用不同来源数据训练后运动幅度依然一致。

8 步长视频,4 步因果世界模型

训练侧,EchoWM 构建了一套互补数据引擎来联合学音画生成与轨迹控制,先渐进式训练、再做自回归后训练以拉长生成时程。开源仓库给出的能力包括:8 步采样的长视频生成、4 步采样的因果世界模型、跨镜头记忆库维持角色外观与声音的连续性,以及在米制 6-DoF 控制下 60 秒稳定 rollout。

开源的部分足够实在:GitHub 仓库 jd-opensource/JoyAI-Echo(目前 1.9k star、168 fork)放出了推理代码与完整权重——约 46GB 的 safetensors 主模型加约 24GB 的 Gemma-3-12B 文本编码器;默认 25fps、241 帧、1280×736 配置下峰值显存约 46–50GB,一张 48GB 卡或 80GB 的 H100/A100 能跑通。论文提交一天,已在 Hugging Face Daily Papers 拿下 64 个 upvote,冲上 8 月 25 日热榜前排。

开源有诚意,但边界也清楚

需要泼冷水的点同样明显。第一,底座是 Lightricks 的 LTX2.3 视频生成器加 Google Gemma 文本编码器——EchoWM 是站在 LTX 肩膀上的改造与后训练,不是从零预训练。第二,许可证限学术研究与非商业使用(继承 LTX-2 Community License),商用需联系 Lightricks,想直接拿去做产品的团队要先读条款。第三,当前版本只支持文生视频与多镜头长视频(带音视频记忆),图生视频(I2V)尚未支持,官方称后续版本会补上。

仓库更新里,JoyAI-Echo 1.5 已宣布、代码"即将发布",TODO 列表里还有超分模块 Echo-SR 和 Director Agent。社区侧已有第三方 ComfyUI 节点,支持逐镜头改提示词、跨镜头记忆串联。

所以呢

世界模型的下一轮竞争,大概率不在"更清晰的一帧",而在两件事:连续控制(你能走进去)与音频补全(走进去之后有声音)。EchoWM 把这两件事打包进了一次开源发布——许可证虽然限制了商用,但它给了社区一个能复现、能改造的全模态基线。对做交互式内容、机器人仿真数据生成或游戏原型的团队,这 46GB 权重值得拉下来看一眼,参考实现与论文都在 GitHub