世界模型大多只在像素层面打转:画面越来越精致,可一旦相机做横滚、俯仰这类非常规运动,重力方向漂了、几何塌了,穿帮立现。S-Lab 南洋理工、密歇根大学、北京交通大学与 ACE Robotics 的联合团队换了条路:与其事后修补,不如把物理和几何当作模型的原生状态(arXiv:2609.04196)。

三种原生世界状态

Puffin-World 是一个统一多模态架构,同时建模三类互补的世界状态:物理(重力场与纬度)、几何(深度)、外观(图像)。架构上由几何对齐的视觉编码器、LLM、扩散模型和轻量连接器组成,理解和生成共用同一套参数——同一个模型既能解读相机几何,也能合成世界一致的观测,不依赖任务专属的外部几何模块。

两处设计撑起了这条路线:一是 Omni-Camera 表征,用重力感知的绝对透视场配射线式相对几何,9 通道条件精确控制相机内参、朝向与轨迹;二是物理传播策略,把物理约束沿生成轨迹向前传递,在极端旋转和长相机运动下保住重力一致性。

四个基准的中位误差全第一

项目页报告称,在 Stanford2D3D、MegaDepth、TartanAir、LaMAR 四个公开基准上,Puffin-World 拿下 12/12 项最佳中位误差与 33/36 项最佳 AUC;LaMAR 上 roll 误差低至 0.26°,Stanford2D3D 上 vFoV 误差 1.62°。生成侧,自建 Puffin-Cam-Bench 上 up-vector / latitude / gravity 中位误差分别为 0.84°/1.26°/0.79°,FID 最低;RealEstate10K 上 PSNR 17.22、LPIPS 0.318 双指标第一;Puffin-Traj-Bench 上 roll/pitch 中位误差 0.80°/1.10°。闭环应用给了两类演示:模仿式世界探索与自校准探索——后者由模型推理当前物理状态并预测修正相机动作。

44.5M 张相机标注图怎么来

Scaling 是关键:Puffin-16M 数据集由 1500 万视觉-语言-相机三元组和 100 万条多样相机轨迹组成,团队还为 28 个常用公共数据集标注了 roll/pitch/vFoV,合计约 4450 万张相机标注图像,全部随 Hugging Face collection 放出。代码、模型、数据集三层全开源。

该泼的冷水

对照表里藏着细节:vFoV 这个维度上,专用相机内参估计器 AnyCalib 在 LaMAR 的中位误差 2.25°,仍优于 Puffin-World 的 2.73°——专材模型在特定指标上没有退场。另外 12/12 这类「全第一」是团队在自家项目页上对选定基线组合的报告,接收侧尚未有独立复现;统一架构做多任务,每个单点能力是否都扛得住专模型的挤压,要等第三方评测说话。

但对做世界模型的人来说,方向信号是明确的:像素保真之外,把重力、深度这些物理量当作一等公民建模,再配上 4450 万张标注图的开源底座,空间智能这条线从「会画」往「懂物理」又推了一步。