Page 114 - 《软件学报》2026年第5期
P. 114
李玘芮 等: 姿态控制人物图像视频生成技术综述 1993
2.5 高效训练和使用模型
姿态控制人物图像视频生成任务中, 由于训练需要高标准的数据集以及存在一些如虚拟试衣等应用场景的需
求, 如何提高模型的训练效率与实际使用中的推理性能是研究的关键问题之一.
2.5.1 数据集局限
在姿态控制任务中, 数据集的限制主要表现在两方面: 一是对数据集的内容要求较高, 一些全监督学习方法需
要同一人在相同衣装下的不同姿态图像, 而一些模型对数据集复杂的背景比较敏感, 此类数据获取成本较高; 二是
数据的多样性和规模不足, 导致模型在真实场景中的泛化能力受到一定的制约. 为了解决这一问题, 研究者提出了
无监督学习、少样本泛化能力增强和数据集扩展等方法.
一部分方法提出通过无监督学习, 使用非配对数据引入循环一致性进行映射学习 [94–96] , 缓解了对成对数据集
的依赖. UPIS [94] 提出了完全无监督的策略, 通过以姿态为条件的双向生成过程, 将姿态迁移后的图像再映射回原
姿态, 从而可以在使用非配对数据的情况下使用重建损失进行监督. 但同时由于其对数据映射的控制能力不足, 其
生成效果较为有限. SPT [96] 进一步引入语义信息, 在没有配对监督的情况下, 为语义解析转换创建伪标签, 利用循
环一致性进行训练, 以完全无监督的方式生成人物图像. C2GAN [95] 则引入三重循环一致性, 即一个图像生成循环
和两个关键点生成循环之间相互隐式地约束, 提供了互补的信息. Wang 等人 [85] 则关注少样本泛化能力, 通过引入
注意力机制的网络权重生成模块, 提升了少样本场景下的泛化能力, 使模型能够在测试时利用少量示例图像来学
习合成以前未见过的主题或场景的视频. 一些方法尝试为数据稀缺提供更直接的手段, 通过利用更多的训练数据 [97]
或引入新的训练任务 [98] 来提升模型的表现. Follow your pose [97] 利用图像-姿态对、无姿态视频以及预训练的文本
到图像模型来生成姿态可控的视频, 扩大了可用数据的范围. 此外, DPTN [98] 通过引入源姿态指导合成源图像的辅
助任务, 探索双任务的相关性, 进一步增强了模型的训练效果.
2.5.2 模型性能
在实际应用中, 姿态控制生成模型的性能不仅取决于训练数据的质量, 还与模型架构设计和在推理阶段的高
效性有关.
由粗到细的生成策略常用于应对模型参数的初始化问题, 也能保留不同尺度层面上的信息作为指导 [16,45,48,56,60,99–102] .
采用由粗到细的生成策略的方法通常具有两个部分, 一个部分生成粗糙结果, 在第 2 个部分再进行细化补充. PG 2[16] 、
DRN [48] 、ADGAN++ [45] 、PCDM [99] 、Zheng 等人 [60] 的方法和 SCA-GAN [101] 在第 2 阶段使用同一尺度的粗粒度结
果进行指导. PG 2[16] 开创性地提出了自上而下的基于生成式对抗网络的解决方案, 它首先提出了两阶段模型, 直接
将带有外观信息的源图像和目标姿态连接起来作为模型输入, 在第 1 阶段主要关注全局的外观和结构, 生成相对
粗略的结果, 第 2 阶段再在第 1 阶段初步结果的基础上进行外观细节的补充. SCA-GAN [101] 利用像素级边缘映射
的高频信号来指导生成过程, 从而增强服饰纹理和边缘细节的保留. 考虑到在应用中使用者更有可能将注意力集
中在语义丰富和细节丰富的位置, DRN 方法 [48] 则除了在整张图上进行细节补充生成外, 还在人脸区域进行精细的
转移补充. 但是只使用单尺度粗糙结果进行指导在一些显著姿态变化的情况下, 细节保留能力较差. 除了单尺度的指导外,
一些研究团队则考虑到将由粗到细的策略应用到多尺度的学习中 [56,100,102] , 能够在复杂姿态变化中更好地保留外
观特征. CoCosNet v2 [56] 考虑到直接在全分辨率上建立由姿态到图的对应关系会增加模型拟合难度, 还容易受到细
节信息的干扰, 于是采用分层策略, 将低分辨率的预测结果作为高分辨率的指导, 再通过 PatchMatch [103] 高效地计
算对应关系, 此举不仅节省了时间开销, 而且考虑了更大尺度上的上下文匹配和历史估计结果, 为最终生成提供多
尺度的指导. Roy 等人 [100] 的方法利用不同分辨率级别的注意力链接来保留生成图像中的粗、细外观属性. CFLD [102]
通过其所提出的感知细化解码器来逐步细化可学习查询来获得粗粒度的提示, 由此获得多尺度的纹理细节信息,
以保留源图像更准确的纹理细节.
一些方法则考虑引入渐进式生成模型, 以减轻每一步模型建模的复杂度, 以达成更好的生成效果. 但考虑到提
高生成效果同时也承担了更大的计算开销, 一些方法则提出设计轻量级模型和优化模型能力的方法, 以降低计算
复杂度、提高推理效率. 比如 MotionFollower、MimicMotion、Animate Anyone、UniAnimate 和 UniAnimate-Dit [104]

