Page 106 - 《软件学报》2026年第5期
P. 106
李玘芮 等: 姿态控制人物图像视频生成技术综述 1985
和生成质量.
在姿态控制生成中, 扩散模型已被应用于生成符合特定姿态要求的人物图像和视频, 并展示了其在细节生成
和质量上的优势. 比如 PIDM [19] 作为完成姿态控制生成任务的第 1 个基于扩散的方法, 用渐进变换的方法实现了
高质量的合成结果.
1.2 姿态数据的表示
人体的姿态是指一个人某一个时刻静态的身体形态, 包含对身体各部位如: 头、手臂、腿部等所在位置的描
述. 在姿态控制的人物图像视频生成任务中, 人体姿态的表示对人体姿态描述的完整程度一定程度上影响了相关
生成模型的生成能力 [20] . 常用的姿态表示方法如图 2 所示.
参考图像 二维关键点姿态 深度姿态 人体解析图像 SMPL 模型
图 2 常用姿态表示方法示意图
1.2.1 二维关键点姿态
较为直接和便于操作的姿态表示是二维关键点姿态表示, 它通过人物不同关键点在图像中的位置来表示姿
态, 这些关键点对应着人体上 25 个有一定自由度的关节, 比如: 颈部、肩部、肘关节、腕关节、膝关节等. 该姿态
表示除了人工标注, 通常通过二维人体姿态估计方法来获得, 比如完成单人姿态估计任务的 DeepPose [21] 以及完成
多人姿态估计任务的 OpenPose [22] 和 AlphaPose [23] . 二维关键点表示姿态的方法的优点是直接且便于操作, 也保留
了一部分关键的姿态信息, 但是由于二维表示的局限性, 在人体姿态迁移的任务中不能有效地使生成模型获得空
间信息 [24] , 从而影响了生成模型对一些有交叠肢体的姿态的理解. 同时由于这种方法只包含了对关键点位置信息
的描述, 没有对关节扭转角度的关键信息, 增加了生成模型的学习负担.
1.2.2 深度姿态
深度姿态技术通过将二维图像中的每个像素映射到三维人体表面, 为姿态估计和生成任务提供了更加丰富的
细节信息 [25] . DensePose [26] 是这一领域的代表性技术, 可以输出在包含人物的图像上预测的 IUV 图 (图像像素与三
维人体模型之间的映射关系图), IUV 图代表了稠密网格顶点与图像像素之间的对应关系, 每一个有效的像素点都
对应了一个三维向量, 包含了该点所在人体模型的位置, 例如头部、手臂等以及对应的贴图坐标. IUV 图可以通过
预定义的双射映射将信息映射回三维的 SMPL (skinned multi-person linear) 模型, 在人体姿态迁移任务中, 可以帮
助确保转移的姿态和人体的外观纹理对齐. 但同时, 使用 IUV 图也需承担一定的计算开销.

