世界模型的演示视频这两年看了不少,但真想复现一个,地狱全在细节里:各家数据集的时间尺度、相机几何、字幕风格互不兼容,训练配方又和单一骨干绑死,论文之间几乎没法公平比较。9 月 3 日,一个以港中大(深圳)为首、联合 NVIDIA、MSRA 等九家机构的团队开源了 SolarWM,试图把这件事一次性捋直。

数据层:143 万条剪辑,先统一成一份契约

SolarWM 的第一步不是训模型,是修数据。它把 14 个数据集的 143 万条规范剪辑转换成统一的帧对齐契约,覆盖视觉观测、度量级相机几何、字幕、质量元数据、选择决策和来源信息,并且把源数据处理和训练混合设计解耦——想换数据配比,不用重跑整条管线。配套的 SolarWM-Data 已经上架 Hugging Face 和 ModelScope。

一套配方,三种骨干

框架在同一套相机条件化、训练和推理接口之下,实例化了四个 5B 到 33B 的模型,底座分别是 Wan2.2、LTX-2.5 和 MiniMax-H3,且各自保留原生表示与训练目标。训练路线是三段式:Stage0.5 做全片段双向 flow matching,建立视频、文本、相机条件的基础表示;Stage1 用教师强制加 AnyFlow 损失,让干净历史去条件化带噪目标块,同时学去噪和有限步流映射——论文强调这省掉了 DMD 之前单独的 ODE 或一致性蒸馏初始化;Stage2 用自梯度 forcing 做分布匹配蒸馏,因果学生模型在自己的 rollout 上训练,教师冻结、critic 可训。

5 秒片段,小时级交互

最有说服力的结果是:全部训练只用了 5 秒序列,得到的因果模型却能实时交互,rollout 长度从分钟级到小时级,不需要长序列微调,也不依赖 attention-sink 机制。项目代码、数据管线、配方和权重全部放出,代码走 Apache 2.0,GitHub 上线首日 249 star。

泼点冷水

细看 README,有三处值得冷静。其一,阶段表里只有 Wan2.2-5B 走完了全部三个阶段,Wan2.2-14B、LTX-2.5、MiniMax-H3 三个底座目前只放出 Stage0.5 双向权重,Stage1 和 Stage2 都标着 Coming soon。其二,公开数据发布并不包含完整视频载荷:latent 版按配方下载即可训练,raw-WDS 要么用 annotation 包从原始发布方自行重建,要么填表申请。其三,开源也有小字:代码是 Apache 2.0,但 LTX 衍生权重遵循 LTX 社区许可,MiniMax H3 许可含地域限制条款。

所以呢

从 ForgeWM、EchoWM 到 SolarWM,两个月内世界模型赛道连续出现全流程开源,方向很清楚:竞争正从谁的视频更好看,转向谁的数据契约和训练配方更可复用。SolarWM 这份跨骨干配方能不能被社区接住,就看那三格 Coming soon 什么时候填满。

参考:arXiv:2609.02886;github.com/Junchao-cs/SolarWM