Page 106 - 《软件学报》2026年第5期
P. 106

李玘芮 等: 姿态控制人物图像视频生成技术综述                                                         1985


                 和生成质量.
                    在姿态控制生成中, 扩散模型已被应用于生成符合特定姿态要求的人物图像和视频, 并展示了其在细节生成
                 和质量上的优势. 比如       PIDM [19] 作为完成姿态控制生成任务的第        1  个基于扩散的方法, 用渐进变换的方法实现了
                 高质量的合成结果.
                  1.2   姿态数据的表示
                    人体的姿态是指一个人某一个时刻静态的身体形态, 包含对身体各部位如: 头、手臂、腿部等所在位置的描
                 述. 在姿态控制的人物图像视频生成任务中, 人体姿态的表示对人体姿态描述的完整程度一定程度上影响了相关
                 生成模型的生成能力       [20] . 常用的姿态表示方法如图     2  所示.



























                     参考图像               二维关键点姿态             深度姿态            人体解析图像            SMPL 模型
                                                图 2 常用姿态表示方法示意图

                  1.2.1    二维关键点姿态
                    较为直接和便于操作的姿态表示是二维关键点姿态表示, 它通过人物不同关键点在图像中的位置来表示姿
                 态, 这些关键点对应着人体上         25  个有一定自由度的关节, 比如: 颈部、肩部、肘关节、腕关节、膝关节等. 该姿态
                 表示除了人工标注, 通常通过二维人体姿态估计方法来获得, 比如完成单人姿态估计任务的                             DeepPose [21] 以及完成
                 多人姿态估计任务的        OpenPose [22] 和  AlphaPose [23] . 二维关键点表示姿态的方法的优点是直接且便于操作, 也保留
                 了一部分关键的姿态信息, 但是由于二维表示的局限性, 在人体姿态迁移的任务中不能有效地使生成模型获得空
                 间信息  [24] , 从而影响了生成模型对一些有交叠肢体的姿态的理解. 同时由于这种方法只包含了对关键点位置信息
                 的描述, 没有对关节扭转角度的关键信息, 增加了生成模型的学习负担.
                  1.2.2    深度姿态
                    深度姿态技术通过将二维图像中的每个像素映射到三维人体表面, 为姿态估计和生成任务提供了更加丰富的
                 细节信息   [25] . DensePose [26] 是这一领域的代表性技术, 可以输出在包含人物的图像上预测的            IUV  图  (图像像素与三

                 维人体模型之间的映射关系图), IUV         图代表了稠密网格顶点与图像像素之间的对应关系, 每一个有效的像素点都
                 对应了一个三维向量, 包含了该点所在人体模型的位置, 例如头部、手臂等以及对应的贴图坐标. IUV                             图可以通过
                 预定义的双射映射将信息映射回三维的              SMPL (skinned multi-person linear) 模型, 在人体姿态迁移任务中, 可以帮
                 助确保转移的姿态和人体的外观纹理对齐. 但同时, 使用                IUV  图也需承担一定的计算开销.
   101   102   103   104   105   106   107   108   109   110   111