Page 108 - 《软件学报》2026年第5期
P. 108

李玘芮 等: 姿态控制人物图像视频生成技术综述                                                         1987


                  2.1   人物外观信息的保留
                    人物外观信息的保留是姿态控制生成任务中的核心问题之一. 其目标是确保生成结果的外观细节                                  (如面部、
                 衣物纹理等) 与输入人物图像高度一致, 尤其是在姿态发生显著变化的情况下, 这一问题尤为重要. 若外观信息未
                 能有效保留, 生成结果可能会出现失真、模糊或与原始图像不一致等现象, 从而降低生成效果的可用性和可信度.
                    在姿态迁移任务中, 人物的姿态变化可能会导致: 在语义复杂区域                     (面部或衣物的复杂图案、纹理部分) 人物
                 面部  ID  和服装纹理等细节无法完整保留, 生成结果在特定区域出现模糊伪影, 或者是出现错误的纹理、不合理的
                 衣服褶皱和人体轮廓, 导致生成结果不自然不可信. 这些问题与生成模型处理复杂图像特征, 特征提取能力密切相关.
                  2.1.1    提取有效的整体外观特征
                    在人物姿态生成领域, 一个有效的解决思路是尽可能完整地提取和保留外观特征, 尤其是面部和衣物纹理等
                 细节信息. 这些外观特征在姿态变化过程中容易受到模糊或丢失, 因此需要借助合适的网络结构来准确提取和保
                 持这些细节.
                    为此, 如图   4(a) 所示, 一些方法  [1,30–32] 提出了通过利用大规模数据集预训练的模型          (如  CLIP [33] 和  VAE [17] ) 来提
                 取图像的外观特征, 再将这些特征作为条件输入到生成网络中, 以此增强生成图像在细节保留方面的能力. DreaMov-
                 ing [31] 和  MotionFollower [32] 采用单一模型来提取全局特征, 但由于  CLIP  在处理细粒度纹理信息时存在一定限制,
                                             [1]
                 一些研究   (如  DreamPose [30] 和  DisCo ) 进一步结合了  VAE  模型和适配器模块, 对特征进行多维度提取, 从而获得
                 更加完整的外观特征. 此外, 一些基于          U-Net 结构的方法   [34–37] 也被提出. 如图  4(b) 所示, 这些方法通过   U-Net 架构
                 的编码器提取图像的全局特征, 再通过解码器将提取的特征应用到生成过程中. MagicPose                       [34] 提出使用多源注意力
                 模块来提供详细的外观指导, 以增强生成过程中的细节表现; MagicAnimate                 [35]  主张通过提取密集的视觉特征来保
                 留参考图像中的身份和背景信息. 如图            4(c) 所示, Animate Anyone [36] 设计了一个对称的  U-Net 结构, 并在每一层利
                 用空间注意力将特征注入扩散方法中的去噪过程, 从而有效保留外观条件.


                                                    CLIP
                                                                      适配器

                                                    VAE

                              姿态     输入图像         预训练编码器                              生成图像
                                             (a) 利用 CLIP、VAE 等预训练模型提取图像特征


                                                                   U-Net 架构
                                                                    编码器

                               姿态      输入图像        噪声                                 生成图像
                                             (b) 通过 U-Net 架构的编码器提取图像的全局特征

                                                                  去噪
                                        编码器                            U-Net 网络

                                      预训练编码器
                            输入图像                    姿态       噪声                        生成图像
                                                (c) 将特征注入扩散方法中的去噪过程
                                                图 4 整体外观特征提取示意图

                  2.1.2    对不同属性的特征进行解耦
                    另一种有效的解决思路是通过对参考图像的不同属性特征进行解耦, 包括前景和背景的分离、外观和姿态的
   103   104   105   106   107   108   109   110   111   112   113