Page 111 - 《软件学报》2026年第5期
P. 111
1990 软件学报 2026 年第 37 卷第 5 期
细节, 但是也容易受到复杂形变和严重遮挡的影响.
一些方法考虑加入注意力机制, 在特征级别对原特征进行扭曲 [47,61,64–68] . GFLA [67] 提出的网络可分为全局流场
估计器和局部神经纹理渲染器两部分, 全局流场估计器负责提取全局相关性并生成流场, 局部神经纹理渲染器根
据得到的流场利用局部注意力块为目标采样逼真的源纹理. NTED 则引入双重注意力机制, 首先从参考特征图中
提取语义神经纹理特征, 然后根据从目标姿态中学习到的空间分布, 对提取的神经纹理进行分布操作. attLWG [66]
在 LWG 的基础上加入注意力机制, 以解决网络假定每个元素的原特征对目标生成成果的影响程度相同的问题.
在基于流的方法中引入注意力机制使合成结果更加真实, 但有显著姿态变化的情况仍对生成模型影响较大, 在
一次生成中对模型学习能力要求极高, 很难产生鲁棒的生成效果, 因此一些方法考虑使用渐进式的生成方案 [65,68,69] .
PATN [68] 使用渐进式生成的方案, 依靠注意力机制避免捕获全局流形的复杂结构的挑战, APATN [69] 在 PATN 的基
础上进行改进, 显式计算条件姿态和目标姿态之间的对齐关系, 为特征转移提供了更直接和平滑的指导, 而考虑到
PATN 只参考姿态来生成注意力, XingGAN [65] 让人体和外观特征相互参考进行改进. BiGraphGAN [64] 则提出的二
部图推理 (BGR) 模块推理二部图中源姿态和目标姿态之间的交叉长程关系, 从而减轻推理负担.
2.3 不可见外观信息的生成
在姿态控制人物图像视频生成任务中, 当目标姿态发生显著变化或出现肢体遮挡时, 部分区域的外观信息可
能无法从输入图像中直接获取. 针对这一挑战, 研究人员提出了多种解决方案, 主要通过引入人体先验信息以及
遮挡补全技术来生成高质量且风格一致的外观特征. 本文将从利用人体先验信息和遮挡补全技术两个方面展开
讨论.
2.3.1 利用人体先验信息
人体先验信息 (如对称性、几何形状等) 为不可见外观信息的生成提供了关键的约束条件. 通过利用这些先
验知识, 生成模型能够更合理地推测缺失部分的外观特征, 使生成结果更符合物理和视觉规律. 基于三维几何和
UV 补全的方法 [51,70–74] 主要通过将人体表面纹理映射到 UV 空间, 并对遮挡区域进行补全来实现. UV-GAN [71] 通过
构建 UV 补全网络来生成任意姿态的人脸, 将生成的 UV 图与三维可变形模型 (3DMM) [75] 相结合, 从而合成二维
图像. 在处理自遮挡问题时, UV-GAN 利用 UV 映射避免了传统基于颜色映射的模糊问题. 考虑到人体的自然对
称性为不可见区域提供了可靠的推测依据, 一些方法 [51,70,72] 则利用了人体的对称先验. Pose with Style 方法 [70] 利用
了人体对称性先验学习修复人体表面纹理和源图像之间的对应场, 并据此将从源姿态提取的局部特征迁移到目标
姿态. 而 StylePoseGAN [73] 通过将姿态条件化的 StyleGAN [76] 与代理几何相结合, 能够生成具有全局一致性的外观
特征, 但 StylePoseGAN 也指出它的全局解耦的方案限制了它保留复杂局部外观细节的能力. Grigorev 等人 [51] 则在
合成了人脸的基础上, 提出了区别于基于颜色的基于坐标的纹理补全方法, 使得生成模型即使在可见信息有限的
情况下也可以保留高层次的纹理细节. 3D-GCL [74] 方法则联合编码了全局语义相关性、局部变形和 3D 人体几何
先验, 使流具备三维感知能力, 并更好地处理姿态和视角的变化.
2.3.2 遮挡补全技术
遮挡补全技术的核心在于对目标图像的遮挡部分进行合理推测和补全, 使生成结果在视觉上更自然且符合逻
辑. 这些方法通常结合三维建模技术与深度学习网络进行实现. 如第 2.2.1 节中所提到的利用三维人体信息进行辅
助纹理扭曲的方法 [51–54,57] , 由于不能从输入图像中完整获取人体外观, 因此模型中从扭曲后的特征生成最终结果
的过程, 也均需要在无法观察完整表面纹理的情况下有对不可见部分进行修复生成的能力. 这部分能力通常是使
用基于 U-Net 的网络实现的. Neverova 等人 [54] 提出的方法允许从 STN 填充的表面节点扩展推理整个身体表面的
外观, 由于在训练期间不能观察到完整的表面纹理, 因此, 如图 6(a) 示意图所示, 该方法通过仅计算 UV 图中观察
到的部分的重建损失来进行训练. 此外, NHRR [72] 也借助深度姿态来表示人的姿态, 如图 6(b) 所示, 有别于传统基
于颜色的 UV 纹理映射, 该方法使用学习到的高维 UV 特征映射来编码外观, 再将中间特征图渲染成最终结果. 考
虑结合多源的条件信息, 可以使得方法生成更精确. AFMHIG [77] 利用多源条件输入对生成过程进行指导, 通过引入
局部注意力机制来从不同的源图像区域选择相关信息, 避免为每个特定的源图像数量构建特定的生成器, 从而能

