Page 115 - 《软件学报》2026年第5期
P. 115
1994 软件学报 2026 年第 37 卷第 5 期
尝试设计轻量级姿态引导器, 在保持生成质量的同时, 减少了模型参数量和计算成本. 此外, 还能通过削减冗余计
算进一步加速生成过程, 适合实时应用场景. 而 CoP [105] 为减轻推理负担, 引入姿态链结构, 通过对生成器的条件约
束进行分层建模, 避免了从源姿态一次性转换到目标姿态的挑战, 降低了高维输入对生成过程的复杂性, 同时确保
生成结果的姿态和外观一致性.
3 数据集与评价指标
3.1 数据集
数据集是训练和评估姿态控制生成模型的重要基础, 根据模型设计, 不同方法对数据集的需求不同. 根据任务
的具体需求, 本文对相关数据集进行收集整理, 按照其模态、内容类别将其分类, 其详细信息显示如表 1 和表 2, 分
别按照图像类和视频类分类. 其中图像类较为常见的数据集是 Market-1501 和 DeepFashionHD, 姿态控制的图像生
成方法通常同时在这两个数据集上进行训练和测试. 常用的视频类数据集包含 Human3.6M、Tai-Chi、TikTok 等,
其中, Tai-Chi 不是现成的数据集, 使用 Tai-Chi 需要自行通过提供的视频 id 和裁剪框从 YouTube 上下载和裁剪.
表 1 图像类姿态控制人物图像视频生成数据集
分类 名称 数据大小 分辨率 特点
行人图像 Market-1501 [106] 1 501个人的32 668张图像 128×64 行人数据集, 姿态变化不显著
52 712张图像, 约200 000对不同姿态相同 模特服装展示图, 人物体型、背景单一,
[107]
DeepFashion 256×256
外观图像 姿态偏向直立
展示服装的图像, 部分展示下装的图像
[108]
MVC 161 260张图像, 每件相同衣物有4个视图 1960×2240
不包含人物上半身
75 016张模特图像, 与对应的9 732件服装
[109]
LookBook 256×256 背景较DeepFashion更复杂
图像
[107] 52 712张图像, 约200 000对不同姿态相同 比DeepFashion有更高的分辨率, 达到
DeepFashionHD 1101×750
外观图像 1101×750
62 780个包含同一人物两张不同姿态的图 比DeepFashion多加了衣服平铺的图像,
[110]
MPV 256×192
时尚服饰 像以及对应衣服图像的三元组 但是在姿态控制任务中作用一致
11 283个包含同一人物两张不同姿态的图
[111]
FashionOn 288×192 暂未开源
像以及对应衣服图像的三元组
[112] 28 714个包含同一人物两张不同姿态的图
FashionTryOn 256×192 与DeepFashion相同
像以及对应衣服图像的三元组
完整人体图像, 含有对服装样式和材质
DeepFashion- 44 096张图像, 对应的解析图像、二维关
[113] 1101×750 以及对整体穿着的文字描述, 但缺少同
MM 键点以及深度姿态
一外观的不同姿态的成对图像
230 000张图像, 对应的解析图以及二维关 1024×512– 手动注释的解析图像与二维关键点, 缺
[114]
SHHQ
键点 2240×1920 少同一外观的不同姿态的成对图像
表 2 视频类姿态控制人物图像视频生成数据集
分类 名称 数据大小 分辨率 特点
[115]
UCF101 13 320段视频 320×240 包含人与人、人与物交互的内容
2 326段15个动作的视频片段, 对应的二维关键
[116]
Penn action 640×480 室外场景
点姿态, 相机视角
11人的总共超过3 600 000帧的视频片段, 对应 室内场景, 17个动作, 每个动作有4个视
[117]
Human3.6M 1000×1000
的二维关节点姿态, 像素级的身体部位的标注 角, 提供三维关节位置
动作 提供下载和预处理脚本, 需要自行从
Tai-Chi [82] 280段太极视频 256×256
YouTube下载
[39]
iPER 30个人的206段视频, 总共包含241 654帧 256×256 包含不同体型的人物、不同风格的衣服
iPER-HD [39] 30个人的206段视频, 总共包含241 654帧 1024×1024 比iPER的分辨率大, 达到1024×1024帧
[118]
MotionVid 1 200 000个文本-姿态配对 多分辨率 目前该领域最大规模的数据集

