Page 112 - 《软件学报》2026年第5期
P. 112

李玘芮 等: 姿态控制人物图像视频生成技术综述                                                         1991


                 更有效地捕捉原人物的外观信息. 而           TPSMM  [78] , 如图  6(c) 所示, 为了更真实地恢复纹理缺失的区域, 为每一层扭
                 曲特征图预测遮挡掩膜, 并通过多分辨率处理实现特征融合优化. 该方法能够针对不同层次的特征重点进行调整,
                 在恢复纹理缺失区域时表现优异.




                           扭曲                                                                扭曲
                                                                        损失函数
                                                            修补网络          惩罚
                 输入图像               扭曲的不完整纹理图                                 扭曲的不完整纹理图           目标图像
                                      (a) 仅计算 UV 图中观察到的部分的重建损失, 推理整个身体表面的外观







                                                                  修补网络
                       输入图像             扭曲的不完整纹理图                                              UV 图
                                             (b) 使用学习到的高维 UV 特征映射来编码外观

                                     光流      多分辨率遮挡掩膜





                                                                      修补网络
                     输入图像                                                                     生成图像
                                    (c) 为每一层扭曲特征图预测遮挡掩膜, 通过多分辨率处理实现特征融合优化
                                              图 6 遮挡补全技术代表方法示意图

                  2.4   一致性问题

                    在姿态控制人物图像视频生成任务中, 一致性问题是实现高质量生成效果的关键挑战之一. 它包括背景一致
                 性、姿态一致性以及时间一致性. 这些问题不仅涉及对图像局部细节的生成质量, 还关乎整体生成结果在空间和
                 时间维度上的自然性和稳定性.
                  2.4.1    背景一致性
                    背景的一致性是指在生成不同姿态人物的同时, 保持场景背景的视觉稳定性. 由于背景与目标人物之间一般
                 相关性较弱, 背景部分在受到人物动作或姿态变化的干扰之后, 人体的遮挡会导致生成结果中的背景出现错位或
                 不连贯. 在图像生成领域, 常见的解决背景一致性的方法是在前后景分离后, 单独对背景进行修复                              [39,66] . 而在视频
                 生成领域则通常通过分离前后景运动, 追踪背景的运动来保证一致性                      [37,79,80] . Liu  等人  [37] 提出了一种稀疏跟踪点方
                 法, 将前景和背景的运动表示分开, 通过跟踪背景的运动轨迹来确保背景稳定性. 而                        Follow-your-pose v2 [80] 观察到,
                 直接在有噪声的数据集上优化模型会出现背景不稳定的问题, 因此提出利用光流的引导, 并将其与其他条件导引
                 器集成, 进一步增强背景的整体稳定性. 此外, MRAA             [79] 通过引入额外的仿射变换, 对非目标相关的全局运动进行
                 建模, 显式地对训练帧之间的背景或摄像机运动进行建模, 这样也能帮助模型更集中关注前景目标, 使识别的点更
                 加稳定.
                  2.4.2    姿态一致性
                    姿态一致性指姿态控制生成任务中, 生成结果严格遵守输入姿态的要求. 由于图像生成人物不涉及时间维度
                 的建模, 姿态迁移通常表现较好. 相较之下, 由于姿态序列的动态变化和数据质量等原因, 姿态一致性主要在姿态
   107   108   109   110   111   112   113   114   115   116   117