Page 115 - 《软件学报》2026年第5期
P. 115

1994                                                       软件学报  2026  年第  37  卷第  5  期


                 尝试设计轻量级姿态引导器, 在保持生成质量的同时, 减少了模型参数量和计算成本. 此外, 还能通过削减冗余计
                 算进一步加速生成过程, 适合实时应用场景. 而             CoP [105] 为减轻推理负担, 引入姿态链结构, 通过对生成器的条件约
                 束进行分层建模, 避免了从源姿态一次性转换到目标姿态的挑战, 降低了高维输入对生成过程的复杂性, 同时确保
                 生成结果的姿态和外观一致性.
                  3   数据集与评价指标


                  3.1   数据集
                    数据集是训练和评估姿态控制生成模型的重要基础, 根据模型设计, 不同方法对数据集的需求不同. 根据任务
                 的具体需求, 本文对相关数据集进行收集整理, 按照其模态、内容类别将其分类, 其详细信息显示如表                              1  和表  2, 分
                 别按照图像类和视频类分类. 其中图像类较为常见的数据集是                    Market-1501  和  DeepFashionHD, 姿态控制的图像生
                 成方法通常同时在这两个数据集上进行训练和测试. 常用的视频类数据集包含                         Human3.6M、Tai-Chi、TikTok  等,
                 其中, Tai-Chi 不是现成的数据集, 使用     Tai-Chi 需要自行通过提供的视频        id  和裁剪框从  YouTube 上下载和裁剪.

                                          表 1 图像类姿态控制人物图像视频生成数据集

                    分类        名称                  数据大小                分辨率                特点
                  行人图像     Market-1501 [106]  1 501个人的32 668张图像      128×64  行人数据集, 姿态变化不显著
                                       52 712张图像, 约200 000对不同姿态相同            模特服装展示图, 人物体型、背景单一,
                                   [107]
                           DeepFashion                               256×256
                                       外观图像                                  姿态偏向直立
                                                                             展示服装的图像, 部分展示下装的图像
                                 [108]
                             MVC       161 260张图像, 每件相同衣物有4个视图 1960×2240
                                                                             不包含人物上半身
                                       75 016张模特图像, 与对应的9 732件服装
                                  [109]
                            LookBook                                 256×256  背景较DeepFashion更复杂
                                       图像
                                    [107] 52 712张图像, 约200 000对不同姿态相同         比DeepFashion有更高的分辨率, 达到
                          DeepFashionHD                              1101×750
                                       外观图像                                  1101×750
                                       62 780个包含同一人物两张不同姿态的图                 比DeepFashion多加了衣服平铺的图像,
                                 [110]
                             MPV                                     256×192
                  时尚服饰                 像以及对应衣服图像的三元组                         但是在姿态控制任务中作用一致
                                       11 283个包含同一人物两张不同姿态的图
                                   [111]
                           FashionOn                                 288×192  暂未开源
                                       像以及对应衣服图像的三元组
                                    [112] 28 714个包含同一人物两张不同姿态的图
                          FashionTryOn                               256×192  与DeepFashion相同
                                       像以及对应衣服图像的三元组
                                                                             完整人体图像, 含有对服装样式和材质
                            DeepFashion-  44 096张图像, 对应的解析图像、二维关
                                [113]                                1101×750  以及对整体穿着的文字描述, 但缺少同
                              MM       键点以及深度姿态
                                                                             一外观的不同姿态的成对图像
                                       230 000张图像, 对应的解析图以及二维关 1024×512– 手动注释的解析图像与二维关键点, 缺
                                 [114]
                             SHHQ
                                       键点                           2240×1920 少同一外观的不同姿态的成对图像

                                          表 2 视频类姿态控制人物图像视频生成数据集

                 分类        名称                    数据大小                 分辨率                特点
                              [115]
                         UCF101     13 320段视频                        320×240 包含人与人、人与物交互的内容
                                    2 326段15个动作的视频片段, 对应的二维关键
                               [116]
                        Penn action                                  640×480 室外场景
                                    点姿态, 相机视角
                                    11人的总共超过3 600 000帧的视频片段, 对应             室内场景, 17个动作, 每个动作有4个视
                                [117]
                       Human3.6M                                    1000×1000
                                    的二维关节点姿态, 像素级的身体部位的标注                   角, 提供三维关节位置
                 动作                                                         提供下载和预处理脚本, 需要自行从
                         Tai-Chi [82]  280段太极视频                      256×256
                                                                            YouTube下载
                             [39]
                          iPER      30个人的206段视频, 总共包含241 654帧        256×256 包含不同体型的人物、不同风格的衣服
                         iPER-HD [39]  30个人的206段视频, 总共包含241 654帧    1024×1024 比iPER的分辨率大, 达到1024×1024帧
                               [118]
                        MotionVid   1 200 000个文本-姿态配对                多分辨率 目前该领域最大规模的数据集
   110   111   112   113   114   115   116   117   118   119   120