十个人的合影,让 AI 凭五到十张参考照片把每个人都放对位置、长对脸——这件事直到最近仍是身份保持生成里最容易翻车的场景。腾讯混元团队在 arXiv 发布的 WithEveryone 框架(论文)给出了一个思路:别急着画,先把谁站在哪规划清楚。

人一多,身份就漂

论文开篇点出的核心矛盾:当场景必须包含多个指定人物时,身份保持生成的可靠性会快速下降。模型要同时做对三件事——保留每个身份、把每张参考脸绑定到特定的人、把人放到正确的位置;而训练阶段的身份损失函数,还要在多个带噪声的预测人脸之间建立对应关系。任何一环松了,结果就是张冠李戴式的串脸,或者干脆把参考图里的脸直接复制粘贴过去。

四个组件:先规划,再渲染,监督对的脸

WithEveryone 的设计可以拆成四步:

  • 寻址 token:每个被选中的身份,以一个专属 token 的形式注入模型;
  • 身份-布局规划:模型先预测一份结构化的 identity-layout plan,再把它渲染成视觉条件,相当于先排好站位图再生成图像;
  • 布局接地 ID 损失(Layout-Grounded ID Loss):用标注好的人脸区域直接监督应该出现在这里的那个身份,绕开不稳定的 embedding 式人脸匹配;
  • ID 表示强制(ID Representation Forcing):在图像合成之前,先对每个身份各训练一个预测。

这套设计的关键词是接地(grounding):身份不再是漂在提示词里的抽象概念,而是被锚定到布局中的具体区域。

数字:相似度 0.462 到 0.499,伪影砍掉约三分之二

在一个身份不相交的基准上,论文报告 WithEveryone 取得了最高的 target-context 身份相似度:人脸相似度从 GPT-Image-2 的 0.462 提升到 0.499,复制粘贴伪影从 0.169 降到 0.055——约等于砍掉三分之二。覆盖面上,它能覆盖 97.3% 的请求身份,重复率只有 2.8%。论文的结论是:显式的身份-布局接地,让身份保持生成能扩展到更大的群组,而不依赖直接复制参考脸。

一个现实问题:权重暂时发不了

值得注意的细节在 GitHub 仓库的发布计划里:论文中的研究版本建立在一个许可证条款不允许发布 checkpoint 的基座模型上;为了给社区一个开放替代,团队正在一个支持开源发布的基模上重训新版本,代码和权重将在新版本就绪后放出。也就是说,短期内你能读到方法和论文,但拿不到可跑的权重——这与当前基模许可证反向约束研究可复现性的行业现状,是同一个症候。

论文登上 8 月 21 日的 Hugging Face Daily Papers 榜单,收获 39 个 upvote,GitHub 仓库已有 43 star。对做多人场景合成、虚拟合影类应用的团队来说,这篇值得放进观察列表;但要真正落地,还得等那个正在重训中的开源版本。什么时候权重能下载、开源版性能是否打折扣,才是这条技术路线从论文走向工具的关键一跃。