Page 110 - 《软件学报》2026年第5期
P. 110
李玘芮 等: 姿态控制人物图像视频生成技术综述 1989
进而优化生成图像的质量.
早期的工作 [43] 受空间变换网络 (spatial Transformer network, STN) [58] 的启发, 提出了通过拟合源二维关键点姿
态与目标二维关键点姿态之间的仿射变换矩阵, 利用 STN 将源图像调整为参考姿态. 这一方法的核心思想是通过
粗略的几何变换来对齐输入图像的外观特征, 从而使其适应目标姿态. 然而, 由于人体姿态的变形是高度非刚性
的, 这一假设并不总是适用于复杂的姿态变化, 因此, 假设原始姿态和目标姿态之间存在全局仿射变换的做法存在
局限性. 为了解决这一问题, 后续的研究提出了更为精细的特征对齐方法. 例如, CoCosNet [55] 和 CoCosNet v2 [56] 通
过将输入信息映射到共享的中间域, 计算出相应的相关性矩阵, 进而建立密集的对应关系. 这一方法有效克服了仿
射变换对细节捕捉的不足, 更好地处理了姿态间的复杂变换. 此外, NTED [47] 则通过引入双重注意力机制来提取语
义信息, 使得纹理信息在目标姿态下的对齐更加精确. 这一机制使得纹理扭曲过程不仅仅依赖几何对齐, 还融入了
语义层面的匹配, 从而进一步提升了生成结果的精细度与真实感. 针对更复杂的姿态变换, 一些方法则结合了显式
或隐式的三维人体信息, 以在三维空间内进行精细的纹理扭曲. 例如, Neverova 等人 [54] 和 M2E-try on Net [57] 采用了
预训练的姿态估计器 DensePose 对三维人体模型进行非刚性对齐, 借此实现了更为细致的纹理调整. 通过这种方
式, 模型能够在三维空间中更准确地捕捉到人体姿态的变化, 从而提升生成结果的自然性和真实感.
另一类方法则基于显式的参数化人体模型, 进行姿态迁移任务. 这类方法能够比传统的深度姿态估计方法更
好地关注身形的个性化特征, 尤其是四肢的旋转和细节. Zanfir 等人 [53] 通过直接使用基于重心坐标的变形对网格
三角形的色彩进行转移, 从而实现了精确的纹理扭曲. Grigorev 等人 [51] 则采用深度卷积网络, 将外观信息映射为完
整的身体纹理, 进一步提升了纹理调整的精准度和可控性. 此外, Li 等人 [52] 提出了一种新的方法, 通过根据可见性
图将特征图划分为互斥的区域, 并通过门控层生成完整的被扭曲的特征图. 这一方法通过划分特征区域, 能够更加
精确地控制哪些部分的纹理需要调整, 从而优化了生成结果的质量, 避免了传统方法中可能出现的纹理扭曲不自
然或不协调的问题. 由于这种借助三维人体信息的对齐无法处理由剧烈姿态变化引起的遮挡区域, 因此使用修复
来填充遮挡区域. 然而, 在被遮挡的区域结果通常是模糊的, 同时值得注意的是无论显式还是隐式, 也无论是深度
姿态还是三维参数模型这样的密集信息, 除了数据集标注稀缺的问题外, 还会增加模型的信息处理负担, 也会引入
相关估计方法不准确所带来的误差. 此外, 三维参数模型更侧重于身体重建而非衣服表面的重建, 所以在特定姿态
的生成任务中, 生成结果的外观上所产生的褶皱并不总是精确的.
2.2.2 深层特征扭曲
深层特征扭曲方法旨在克服基于像素的传统纹理扭曲在姿态变化过程中无法有效保留源图像色彩风格和细
节的局限性. 不同于直接在图像空间进行纹理扭曲, 这些方法通过在深层特征空间内进行扭曲, 试图更深入地理解
和适应显著姿态变化下的纹理变化. 这种方法尤其适用于需要对复杂姿态变化下的细节进行精细处理的任务.
早期的研究 (如 Def-GAN [59] ) 通过引入可变形的跳跃链接和局部仿射变换来处理由姿态差异引起的像素错
位. 尽管该方法能够对源图像进行一定程度的姿态对齐, 但由于仿射变换是线性的, 难以应对复杂的非刚性姿态变
形, 生成的边界通常较为模糊, 且容易受到姿态估计不准确的影响, 导致伪影或外观丢失等问题. 为了解决这一问
[5]
题, 许多后续研究引入了更为灵活的非线性变换. 例如, Warping GAN 结合了仿射变换和薄板样条变换 (thin plate
spline, TPS), 采用软门控机制来对空间进行更精细的对齐. 尽管 TPS 能够在一定程度上处理非刚性变形, 但其在
高维空间的适用性仍然受到限制, 尤其是在复杂姿态迁移中, TPS 可能无法完美捕捉高频细节变化.
考虑到非刚性姿态形变对纹理扭曲的影响, 一部分方法选择基于全局流从源图像迁移外观细节 [6,39,52,60–63] . Li
等人 [52] 除了上一节提到的纹理扭曲之外, 也考虑了深层特征扭曲, 考虑到引入三维模型信息的推理负担问题, 提
出了仅从二维表示中集成关于三维几何信息的隐式推理方法, 通过外观流生成模块编码从源到目标密集的对应关
系, 并据此扭曲纹理和特征. Zheng 等人 [60] 也通过学习到的姿态流来学习复杂的姿态变形, 但提出一种无监督的流
学习方案, 避免了效率较低的流真值的生成步骤. 与基于三维信息学习流的 LWG [39] 和 Li 等人 [52] 提出的方法不同
的是基于解析图像的外观流生成方案 ClothFlow [63] , 它首先合成一个目标人体解析图, 然后估计一个密集的流来扭
曲源图像特征, DwNet [62] 则通过估计变形网格来扭曲特征. 而考虑图像特征和像素位置之间的相互依赖问题,
Tabejamaat 等人 [61] 则鼓励流只关注外观未正确生成的区域, 生成独立图像块. 基于流的方法虽然可以生成逼真的

