Page 112 - 《软件学报》2026年第5期
P. 112
李玘芮 等: 姿态控制人物图像视频生成技术综述 1991
更有效地捕捉原人物的外观信息. 而 TPSMM [78] , 如图 6(c) 所示, 为了更真实地恢复纹理缺失的区域, 为每一层扭
曲特征图预测遮挡掩膜, 并通过多分辨率处理实现特征融合优化. 该方法能够针对不同层次的特征重点进行调整,
在恢复纹理缺失区域时表现优异.
扭曲 扭曲
损失函数
修补网络 惩罚
输入图像 扭曲的不完整纹理图 扭曲的不完整纹理图 目标图像
(a) 仅计算 UV 图中观察到的部分的重建损失, 推理整个身体表面的外观
修补网络
输入图像 扭曲的不完整纹理图 UV 图
(b) 使用学习到的高维 UV 特征映射来编码外观
光流 多分辨率遮挡掩膜
修补网络
输入图像 生成图像
(c) 为每一层扭曲特征图预测遮挡掩膜, 通过多分辨率处理实现特征融合优化
图 6 遮挡补全技术代表方法示意图
2.4 一致性问题
在姿态控制人物图像视频生成任务中, 一致性问题是实现高质量生成效果的关键挑战之一. 它包括背景一致
性、姿态一致性以及时间一致性. 这些问题不仅涉及对图像局部细节的生成质量, 还关乎整体生成结果在空间和
时间维度上的自然性和稳定性.
2.4.1 背景一致性
背景的一致性是指在生成不同姿态人物的同时, 保持场景背景的视觉稳定性. 由于背景与目标人物之间一般
相关性较弱, 背景部分在受到人物动作或姿态变化的干扰之后, 人体的遮挡会导致生成结果中的背景出现错位或
不连贯. 在图像生成领域, 常见的解决背景一致性的方法是在前后景分离后, 单独对背景进行修复 [39,66] . 而在视频
生成领域则通常通过分离前后景运动, 追踪背景的运动来保证一致性 [37,79,80] . Liu 等人 [37] 提出了一种稀疏跟踪点方
法, 将前景和背景的运动表示分开, 通过跟踪背景的运动轨迹来确保背景稳定性. 而 Follow-your-pose v2 [80] 观察到,
直接在有噪声的数据集上优化模型会出现背景不稳定的问题, 因此提出利用光流的引导, 并将其与其他条件导引
器集成, 进一步增强背景的整体稳定性. 此外, MRAA [79] 通过引入额外的仿射变换, 对非目标相关的全局运动进行
建模, 显式地对训练帧之间的背景或摄像机运动进行建模, 这样也能帮助模型更集中关注前景目标, 使识别的点更
加稳定.
2.4.2 姿态一致性
姿态一致性指姿态控制生成任务中, 生成结果严格遵守输入姿态的要求. 由于图像生成人物不涉及时间维度
的建模, 姿态迁移通常表现较好. 相较之下, 由于姿态序列的动态变化和数据质量等原因, 姿态一致性主要在姿态

