数字人赛道最近一次范式跳跃,不是来自更大的模型或更强的语音驱动,而是来自一个看似不起眼的输入端改动:把参考素材从「一张照片」换成「一段视频」。
HeyGen Research 与南洋理工大学(NTU)联合团队在 8 月 27 日公开的 TAVR(Talking Avatar from Video Reference),把这个改动做成了可工程化的整套方案。论文已被 SIGGRAPH Asia 2026 大会接收,并已直接落地到 HeyGen 的产品线中。
单图参考的天花板
主流 talking avatar 系统都遵循 image-to-video 范式:用一张静态照片作身份参考,再由音频驱动生成。当目标场景的背景、姿态、光照都与参考照不同时,模型只能靠「幻觉」补齐其余细节,结果就是跨场景时 identity drift 和视觉伪影。
TAVR 把输入端升级为可变长度的视频片段(12 到 48 帧),让模型在生成前就能看到多角度、多表情、多光照下的同一身份。随着参考帧数从 12 增到 48,identity similarity 单调上升,而 lip sync 和整体画质都不退化。
架构设计:四块协同
TAVR 基于 Wan2.1-T2V-14B 视频扩散底座。真正让它能跑起来的是四个紧耦合设计:可变长度视频参考直接把多帧视频编码后送进扩散模型;Token Selection Module 用面部 bounding box 在 latent 空间里把身份相关的 token 筛出来,把背景和冗余帧丢回去控制计算量;Reference Self-Attention 把目标生成和参考 token 的注意力层合并,让参考 token 自然参与目标帧生成;Audio Cross-Attention 用 frame-wise 的 cross-attention 把驱动音频和参考音频同时注入生成流,保证 lip sync 和参考流的时间一致性。
三阶段训练
跨场景参考带来新问题:参考视频在演播室拍的,目标场景却在街头。直接把同场景数据喂给模型,模型只会学到「把参考视频的像素抄过来」,而不是「学会这个人的身份」。
TAVR 用三阶段训练解决:Stage 1 用同场景视频做基础预训练,让模型先学会把一个人的外观和动作复刻下来;Stage 2 改用跨场景视频对(同一个人、不同场景),逼着模型学真正的身份聚合而非像素复制;Stage 3 用 DPO 做任务特定的强化学习,把 ArcFace identity similarity 当作 reward 信号,并用空间 mask 把 reward 限定在前景人像区域。副作用是稳定性大幅提升:相比传统 QAT 路线在 step 700 后开始性能崩塌,TAVR 在 step 100 左右就达到峰值,之后几乎不漂移。
新基准与数字
团队从 TalkVid 里挑出 158 对同一人跨场景的视频对组成新 benchmark,要求同一人的参考视频和目标视频在背景上有最大差异,且通过 ArcFace threshold 强制面部一致性。
TAVR 用 20 帧参考就能拿到 overall quality 16.42 的分数,对比次优方法 HuMo 的 14.13 拉开 2.29 分。48 帧时 identity similarity 达到 0.83(参考侧)和 0.69(目标侧),是所有方法里最高的。TAVR 在拿到「选最佳单帧」的 oracle baseline 后仍然领先:把 HuMo 喂给它能拿到的最像目标帧的那张参考图,TAVR 仍然把 identity similarity 从 0.58 拉到 0.64,overall quality 从 14.50 拉到 16.29。增益确实来自多帧聚合,而不是运气好碰到了一张更好的单帧。
这件事为什么重要
TAVR 把 single-image reference 这个 2020 年代以来 talking avatar 的默认输入格式,正式替换成了 video reference。一旦被产品化,下游应用——主播、客服、教学、企业宣传——都不再需要用户去影棚拍一张标准的正面照,掏出手机录一段十几秒的小视频就够了。这对数字人赛道的可达性是结构性的变化。
更广义地说,这是视频生成模型在过去半年里的共同方向:模型不再被「输入端」的信息密度卡脖子,而是被「如何高效利用更长、更密的输入」卡脖子。TAVR 的解法对视频编辑、视频扩展、视频翻译都有参考价值。
参考材料:Hugging Face blog(HeyGenAI, August 27, 2026)https://huggingface.co/blog/HeyGenAI/tavr;arXiv 论文 https://arxiv.org/abs/2604.27918。