Page 107 - 《软件学报》2026年第5期
P. 107
1986 软件学报 2026 年第 37 卷第 5 期
1.2.3 人体解析图像
人体解析图像指在图像解析过程中生成的分割图像, 也称为标注图或者是掩膜, 其根据语义为人体图像上的
像素标注类别或标签, 这些类别或标签指示了背景或者人体不同的部位, 比如头发、手臂、躯干等, 也会指示不同
的着装类别, 比如上衣、裤子、连衣裙等. 它相对于仅指示关键点位置的姿态表示来说, 包含了语义信息, 从而能
够帮助保留不同区域上的外观纹理细节, 也能更有效地处理姿态遮挡的问题. 但同时, 获取准确的人体解析图像相
较于基于关键点表示的姿态更具挑战性, 并且其准确程度也会影响模型的训练效果.
1.2.4 SMPL 模型
SMPL 模型是一种基于顶点的参数化人体模型, 可以通过参数来控制以及准确地表示人体姿态 [27] . 具体来说,
SMPL 模型包括 6 890 个顶点、23 个分别拥有 3 个自由度的关节以及 1 个代表全局方向的根节点, 通过 75 个 θ
参数和 10 个 β 参数来分别控制姿态和人体体型. 除了 SMPL 模型之外, 还有能模拟软组织的 DMPL [28] 、加入了
手部信息的 SMPL+H 以及加入了手部和面部信息的 SMPL-X [29] 等扩展模型. 这些模型通过参数化的方式能够实
现对人体体型和姿态的精确控制, 能够帮助模型定位人体外观纹理位置, 但在姿态控制人物图像视频生成任务中
使用 SMPL 模型同时也意味着需要承担相当大的计算开销.
2 姿态控制人物图像视频生成挑战与解决策略
姿态控制人物图像视频生成任务通常给定两种信息: 人物外观和人物目标转移姿态. 当前, 外观与姿态信息的
表达方式尚不能足够精细、完整地提供生成人物所需的信息, 这导致该任务在生成合理、准确且真实的人物图像
方面面临巨大挑战. 所以, 要在有限的信息输入下精准地控制生成人物的姿态和合理推理其服饰在不同姿态下的
表现是极具挑战的任务, 这些挑战主要集中在以下几个方面: 人物外观信息的保留与一致性、不可见外观信息的
生成、一致性问题以及高效训练与使用模型. 如图 3 所示, 本节将围绕这些挑战展开讨论, 结合当前的研究成果与
技术发展, 对每项挑战背后的核心问题进行分析, 并探讨现有方法的解决策略和局限性.
姿态控制人物生成挑战
人物外观信息的保留 外观信息的重排 不可见外观信息的生成 一致性问题 高效训练和使用模型
由粗到细/渐进生成
数据集
图 视
片 频
类 类
DeepFashion Market-1501 Human3.6M TikTok Tai-Chi
应用
The woman in the image is wearing a
dark blue cardigan with a …
虚拟试穿与时尚行业 视频生成与编辑 多模态结合生成
图 3 姿态控制人物图像视频生成挑战、数据集与应用示意图

