Page 105 - 《软件学报》2026年第5期
P. 105
1984 软件学报 2026 年第 37 卷第 5 期
现有的综述文献虽然从多个角度探讨了姿态控制人物图像视频生成技术的进展, 但在基于扩散方法学习和视频
生成方法的论述上仍显不足, 特别是在从解决技术挑战的角度进行文献综述方面的讨论相对薄弱. 本文旨在围绕现
有技术的挑战出发, 对当前主流的姿态控制生成方法进行详细分类和分析, 并探讨它们在实际应用中的可行性与局限性.
具体而言, 本文将从以下几个方面展开讨论: (1) 介绍姿态控制人物图像视频生成技术的基础理论和前置知
识, 重点包括生成模型、姿态表示等关键技术; (2) 基于姿态控制人物图像视频生成任务遇到的姿态迁移过程中外
观信息的有效提取和重排、不可见信息的生成、一致性保持、模型的高效训练与使用等几大难点, 详细分析和探
讨现有研究方法的相关解决策略; (3) 讨论现有方法的常用的数据集大小、特点等信息, 并整理了相关测试基准,
并从虚拟试衣、视频生成和编辑和多模态结合生成等应用场景展开讨论, 分析其在实际应用中遇到的限制和现有
技术仍遇到的技术难点; (4) 讨论姿态控制人物图像视频生成技术可能的未来发展趋势.
本文的目的在于为研究人员提供一个系统的总结和参考, 从而推动姿态控制人物图像视频生成技术在各行业
中的应用与创新.
1 前置知识
姿态控制人物图像视频生成技术涉及多个前沿领域的交叉与融合. 为便于理解, 本文将首先介绍该技术的核
心理论与基础技术, 包括生成模型、姿态数据表示等关键技术.
1.1 生成模型
生成模型是姿态控制人物图像视频生成技术的核心, 决定了生成效果的质量与多样性. 生成模型的目标是从
输入数据中学习到潜在的分布, 并利用该分布生成与输入条件匹配的图像或视频. 在姿态控制人物图像视频生成
任务中, 生成模型不仅需要根据输入的姿态数据生成人物图像, 还需要确保生成结果符合源图像中人物的外观, 也
符合现实世界的物理规律和美学要求.
1.1.1 生成对抗网络 (GAN)
GAN 是一种由生成器和判别器组成的模型, 通过两者之间的对抗训练来学习数据分布. 在图像生成领域,
GAN 主要是结合卷积神经网络实现生成能力, 生成器尝试生成逼真的图像以欺骗判别器, 而判别器则努力区分真
实图像和生成图像. 通过这种“博弈”过程, 生成器逐渐学习到如何生成更为真实的图像. 在姿态控制人物图像视频
生成任务中, 条件生成对抗网络 (cGAN)、pix2pix [14] 和 pix2pixHD [15] 等方法常用于生成符合特定姿态要求的虚拟
人物图像. 例如, PG 2[16] 使用条件生成对抗网络来学习将特定姿态信息映射到目标图像, 生成具有预定姿态的人物
图像. 但由于其特殊优化目标, GAN 容易出现不稳定的训练结果, 导致生成的样本多样性有限.
1.1.2 变分自编码器 (VAE)
变分自编码器 (variational autoencoder, VAE) [17] 是一种通过最大化数据的似然函数来学习潜在空间表示的生
成模型. 与 GAN 相比, VAE 通常在图像生成的精度上有所欠缺, 但在多样性和模型训练的稳定性方面表现更好.
VAE 在姿态生成中常用于将图像转化为潜在空间表示, 通过操控潜在空间的特征来控制生成图像的姿态和
外观. VAE+GAN 组合模型也常被应用, 比如 VU-Net [18] 组合 VAE 与 GAN, 以平衡生成质量和多样性, 提高姿态迁
移的生成水平.
1.1.3 扩散模型 (diffusion model)
扩散模型是近年来在图像合成领域崛起的一种生成模型. 与 GAN 不同, 扩散模型通过逐步去噪的方式生成
图像或视频. 扩散模型的工作原理包括两个关键阶段: 正向扩散过程和逆向生成过程, 它通过定义一个扩散步骤的
马尔可夫链, 在正向扩散过程中逐渐向数据添加随机噪声, 然后在逆向生成过程中学习逆扩散过程, 从噪声中构建
所需的生成结果. 由于其生成过程中的精细控制, 扩散模型能够产生更加细致且真实感较强的图像或视频效果.
在人工智能生成领域解决 GAN 模型训练不稳定和生成数据多样性不足等问题上, 扩散模型逐渐成为一种重
要的替代方法. 然而, 扩散模型在速度方面存在明显的缺点, 因为它需要大量的迭代来逐步去噪, 使得生成过程相
对较慢. 此外, 扩散模型的训练过程也可能出现不稳定, 需要精心设计的网络架构和训练策略来确保模型的稳定性

