Page 108 - 《软件学报》2026年第5期
P. 108
李玘芮 等: 姿态控制人物图像视频生成技术综述 1987
2.1 人物外观信息的保留
人物外观信息的保留是姿态控制生成任务中的核心问题之一. 其目标是确保生成结果的外观细节 (如面部、
衣物纹理等) 与输入人物图像高度一致, 尤其是在姿态发生显著变化的情况下, 这一问题尤为重要. 若外观信息未
能有效保留, 生成结果可能会出现失真、模糊或与原始图像不一致等现象, 从而降低生成效果的可用性和可信度.
在姿态迁移任务中, 人物的姿态变化可能会导致: 在语义复杂区域 (面部或衣物的复杂图案、纹理部分) 人物
面部 ID 和服装纹理等细节无法完整保留, 生成结果在特定区域出现模糊伪影, 或者是出现错误的纹理、不合理的
衣服褶皱和人体轮廓, 导致生成结果不自然不可信. 这些问题与生成模型处理复杂图像特征, 特征提取能力密切相关.
2.1.1 提取有效的整体外观特征
在人物姿态生成领域, 一个有效的解决思路是尽可能完整地提取和保留外观特征, 尤其是面部和衣物纹理等
细节信息. 这些外观特征在姿态变化过程中容易受到模糊或丢失, 因此需要借助合适的网络结构来准确提取和保
持这些细节.
为此, 如图 4(a) 所示, 一些方法 [1,30–32] 提出了通过利用大规模数据集预训练的模型 (如 CLIP [33] 和 VAE [17] ) 来提
取图像的外观特征, 再将这些特征作为条件输入到生成网络中, 以此增强生成图像在细节保留方面的能力. DreaMov-
ing [31] 和 MotionFollower [32] 采用单一模型来提取全局特征, 但由于 CLIP 在处理细粒度纹理信息时存在一定限制,
[1]
一些研究 (如 DreamPose [30] 和 DisCo ) 进一步结合了 VAE 模型和适配器模块, 对特征进行多维度提取, 从而获得
更加完整的外观特征. 此外, 一些基于 U-Net 结构的方法 [34–37] 也被提出. 如图 4(b) 所示, 这些方法通过 U-Net 架构
的编码器提取图像的全局特征, 再通过解码器将提取的特征应用到生成过程中. MagicPose [34] 提出使用多源注意力
模块来提供详细的外观指导, 以增强生成过程中的细节表现; MagicAnimate [35] 主张通过提取密集的视觉特征来保
留参考图像中的身份和背景信息. 如图 4(c) 所示, Animate Anyone [36] 设计了一个对称的 U-Net 结构, 并在每一层利
用空间注意力将特征注入扩散方法中的去噪过程, 从而有效保留外观条件.
CLIP
适配器
VAE
姿态 输入图像 预训练编码器 生成图像
(a) 利用 CLIP、VAE 等预训练模型提取图像特征
U-Net 架构
编码器
姿态 输入图像 噪声 生成图像
(b) 通过 U-Net 架构的编码器提取图像的全局特征
去噪
编码器 U-Net 网络
预训练编码器
输入图像 姿态 噪声 生成图像
(c) 将特征注入扩散方法中的去噪过程
图 4 整体外观特征提取示意图
2.1.2 对不同属性的特征进行解耦
另一种有效的解决思路是通过对参考图像的不同属性特征进行解耦, 包括前景和背景的分离、外观和姿态的

