8 月 20 日提交到 arXiv 的一项研究(arXiv:2608.20335)把「随手拍一段视频」和「可自由转动视角的 4D 人体」直接连在了一起:4DAnyone 框架输入一段未经标定的单目视频,先生成数十路多视角一致的目标视频,再把这些视频提升为 4D 高斯泼溅(4DGS)人体模型。论文由浙江大学、蚂蚁集团、Robbyant、HKUST、CUHK 五家机构合作完成,项目页标注为 SIGGRAPH Asia 2026,代码与模型权重均已公开。

用生成模型「补齐」相机阵列

按照项目页的描述,照片级真实的 4D 人体重建通常依赖一组经过标定、时间同步的相机阵列,这严重限制了它在真实场景中的使用。4DAnyone 的思路是换个方向:重建需要的本来就是「那个阵列本来会拍到的几十路视频」,那就让视频扩散模型把这些视频生成出来,再用生成结果训练 4DGS。项目页的定位一句话就能讲完:单视频进,4D 人体出——不用 rig,不用标定,不用三脚架。

一致性为什么会在几十个视角上崩掉

直接把相机控制的视频扩散模型拉到这个规模,多视角一致性会失效。论文把根因归结为「有界注意力上下文」问题:当目标视角数量超过单次 DiT 前向的容量,生成就必须分组进行,而这暴露出两个耦合的瓶颈。参考侧,条件里包含所有已生成视角,上下文随视角数呈 O(N) 增长,跨视角的外观引导反而被稀释;目标侧,彼此不相交的分组无法直接交换信息,产生全局结构漂移。

对应的两个设计相当工程化:

  • Reference Context Packing(RCP):把持续增长的参考视角压缩为固定长度的混合分辨率上下文,参考侧复杂度从 O(N) 降到 O(1);
  • Target Context Routing(TCR):在去噪过程中轮换目标视角的分组方式——高噪声步骤跨组共享上下文,低噪声步骤稳定细节。

条件信号上还有一个关键取舍:用 3D 骨架提供「稀疏但准确」的几何线索,替代脆弱的稠密深度图与带噪声的相机参数。论文认为这是它在野外素材上能稳定泛化的原因。

游戏引擎造数据,两个基准验证

训练数据方面,团队用自研游戏引擎构建了 MVGameHuman 数据集,并与光场(light-stage)数据、野外视频混合训练。评测在 DNA-Rendering 与 DyMVHumans 两个基准上进行:论文报告其在新视角视频质量与下游 4DGS 重建两项上均优于既有方法,并表现出稳健的野外泛化;最终的 4DGS 模型训练用到了 FreeTimeGS。

开源与社区热度

代码托管在 GitHub(ant-research/4DAnyone),权重发布在 Hugging Face(AntResearch/4DAnyone)。8 月 21 日,这篇论文登上 Hugging Face Daily Papers 当日第三,拿到 64 个 upvote。对做自由视角体积视频、数字人内容的工作流来说,这是一个可以直接上手跑的管线,而不是只存在于论文里的方法。

从更大的视角看,4DAnyone 代表的是一类新解法:当重建(4DGS)与生成(视频扩散)在「多视角一致性」这个接口上相遇,瓶颈不再只在重建侧,而在生成侧的上下文管理——RCP 和 TCR 本质上都是在给 DiT 的注意力上下文做「预算管理」。这个思路对其他需要大规模一致生成的任务同样有参考价值:上下文不够用时,压缩它,而不是无限堆叠它。