Page 113 - 《软件学报》2026年第5期
P. 113

1992                                                       软件学报  2026  年第  37  卷第  5  期


                 迁移的视频生成任务中被关注. 视频生成的姿态迁移方法可以依据姿态控制方式分为用参考视频中人物动作进行
                 控制  [3,4,15,32,36,41,49,78,81–85] 和使用抽象姿态序列进行控制  [1,30,31,34,35] . 使用参考视频中的姿态进行控制的方法面临着准
                 确提取运动信息的压力. 许多方法试图对运动表示进行建模, 解耦运动和外观信息以提高姿态生成的准确性. 一部
                 分方法使用现成的姿态估计器对原视频的动作进行提取: Chan                   等人  [49] 、Yang  等人  [41] 、TPSMM [78] 通过使用预训
                 练的姿态估计器      OpenPose [22] 从原视频中提取二维关键点姿态, 考虑到不同视频中的人物可能有不同的肢体比例、
                 视角以及与相机的距离, Chan       等人  [49] 通过全局姿态归一化对提取的姿态序列进行变换, 以适应目标人物的身形和
                                             [4]
                 位置. MotionFollower、MimicMotion 、Animate Anyone、UniAnimate 则使用  DWPose 工具  [86]  来从视频中提取
                                                                        [3]
                 二维关键点姿态序列. 而另一部分方法使用估计流的方法对动作进行建模                        [78,81,82] . Vid2vid [87]  使用光流预测网络来
                 估计视频帧之间的运动, 并使用          FlowNet2  提取的光流作为真值进行监督, Monkey-Net       [81] 通过预测无监督关键点
                 估计运动的光流, 并用该光流驱动生成器生成目标姿态. FOMM                  [82] 则引入了局部仿射变换, 在     Monkey-Net 的基础
                 上在每个关键点附近进行一阶泰勒展开, 并使用局部仿射变换在每个关键点的邻域内估计运动, 然后用密集运动
                 网络基于运动表示生成密集光流指导姿态控制. 但由于通过关键点来估计运动存在不明确的问题, 生成结果会混
                 入背景的视觉信息, 帧间的对应关系也难以建立. MRAA                则改进了   FOMM  的缺点, 直接使用主成分分析计算运动
                 热图中的平移、旋转和缩放等变换, 使用与有意义的语义部分相对应的区域而非关键点来表示运动, 能提供更丰
                 富的运动信息. 此外, TPSMM      通过引入薄板样条变换来模拟复杂的人体姿态变化, 通过结合多个薄板样条变换和
                 背景的仿射变换生成最终的光流, 并据此在生成过程中对源图像进行变形, 以匹配目标图像的运动.
                    在基于姿态序列的控制中, 一些方法通过利用人体先验知识, 让姿态的输入包含密集的姿态信息, 以提高姿态
                 控制的准确性. 人体先验知识通常通过深度信息, 密集姿态、三维参数模型和网格等形式来传递. 比如                              DreaMoving
                 加入  DWPose 工具提取的深度信息帮助模型理解身体不同部位与环境的空间关系, DreamPose                     [30] 和  MagicAnimate
                 则利用   DensePose 提取密集姿态, 将这些细节融入生成器中以增强生成质量. 但此类姿态表示通常不能 表示出人
                 体的关节约束等先验, Human4DiT      [88] 、Champ [89] 和  VividPose [84] 则引入了三维参数模型, VividPose 使用三维信息
                 与深度和网格信息同时对姿态控制进行更高层次的条件约束, 从而更好地理解复杂运动. 为了更好地利用姿态序
                 列约束生成结果, 不同方法探索了不同的姿态指导模块. DreamPose 和                Champ  直接连接姿态信息和噪声输入到去
                 噪  U-Net 中, 不同之处在于, Champ   结合了渲染的深度图像、法线图和从             SMPL  序列获得的语义图, 以及基于骨
                                                                                         [34]
                 架的运动指导, 以全面的       3D  形状和详细的姿态属性组成多层次的运动信息进行指导, MagicPose 、MagicAnimate、
                                    [1]
                 Animate Anyone、DisCo 基于  ControlNet [90] 利用  U-Net 作为参考控制模块将姿态注入生成模型. 一些方法比如
                 MotionFollower、MimicMotion  和  UniAnimate 则设计了仅由卷积层组成的轻量神经网络作为姿态指导模块, 不涉
                 及大量的注意力计算, 降低了计算代价.
                  2.4.3    时间一致性
                    姿态可控的角色视频生成技术在广告制作和内容创作等领域具有重要应用价值. 但是现有的视频生成方法在
                 面对复杂场景, 例如存在身体遮挡、多角色互动或者复杂变化的背景的时候, 现有方法常常面临画面不连贯或细
                 节跳动的问题. 因此, 现有方法通常需要依赖于具有稳定背景和良好时间一致性的大规模高质量视频数据集进行
                 训练, 也就提高了在实际应用中的门槛. 研究者就如何解决确保连续帧之间的动作流畅和视觉连贯性的问题, 提出
                 了多种方法, 例如三元组损失         [91] 、时间平滑策略  [49] 等. 其中, Yan  等人  [91] 引入三元组损失来约束时间一致性, 追求
                 连续帧之间的外观平滑, 提高生成质量. Chan 等人            [49] 则通过时间平滑策略, 预测两个连续的帧, 减少了帧间闪动的
                 现象. 此外, 受  AnimateDiff [92] 的启发, 一些方法还通过合并时间运动模块来进一步增强时间一致性                   [35,36,80] , 利用
                 U-Net 网络来捕捉具有复杂细节的视频特征. Animate Anyone 通过引入时间层建模多帧之间的关系, 从而显著提
                 高了视频生成的稳定性, 也在模拟连续和平滑的时间运动过程的同时, 保留了视觉质量中的高分辨率细节. Liu 等人                              [37]
                 提出了一种逐片段生成策略, 将长序列视频划分为多个片段, 其中每个前一个片段的终帧作为后一个片段的条件
                 输入. 为了防止预测视频帧潜在的错误在整个生成过程中被累积, 他们设计了将从初始参考图像中提取全局特征
                 持续注入生成过程的策略, 同时支持了视觉一致性和时间连贯性. HumanDiT                    [93] 则在姿态迁移任务中, 插入      τ 帧过
                 渡姿态, 平滑连接初始帧与目标姿态, 减少动作突变.
   108   109   110   111   112   113   114   115   116   117   118