Page 104 - 《软件学报》2026年第5期
P. 104

李玘芮 等: 姿态控制人物图像视频生成技术综述                                                         1983


                 commonly  used  generative  models  and  pose  representation  methods  in  pose-guided  generation.  It  also  reviews  the  datasets,  their  sizes,
                 characteristics, and evaluation benchmarks used in this field. Furthermore, this study discusses the applications of this technology in virtual
                 try-on,  video  generation  and  editing,  and  multimodal  content  generation.  It  highlights  the  remaining  challenges,  such  as  the  retention  of
                 personalized  information,  generation  in  complex  scenes,  and  model  efficiency  and  real-time  performance.  Finally,  this  study  discusses
                 potential  future  development  trends  of  pose-guided  generation  technology,  aiming  to  provide  researchers  with  a  systematic  summary  and
                 reference to promote its application and innovation across industries.
                 Key words:  pose-guided generation; person image and video generation; generative adversarial network (GAN); diffusion model; controllable
                         generation
                    随着计算机视觉、图形学和深度学习技术的飞速发展, 姿态控制人物图像视频生成技术                              (pose-guided person
                 image and video generation) 逐渐成为人工智能领域的重要研究方向. 如图          1  所示, 该任务通常在给定人物外观
                 (appearance) 和人物姿态  (pose) 的输入条件下进行, 人物的外观通常由一张二维图像表示, 而指定的人物姿态则由
                 二维关键点姿态等方法表示, 其核心目标是将输入中的人物转换为指定姿态, 同时确保人物的外观特征得以保留.
                 通过精确控制人物的姿态并保持其外观特征, 我们能够生成逼真的人物图像或视频, 这对于提升用户体验和推动
                 技术创新具有重要意义.

                                                               Encoder  Decoder



                                                                    Encoder  Decoder

                             参考图像                 姿态数据          生成模型                    生成图片
                                             图 1 姿态控制人物图像视频生成任务

                    这一技术不仅在娱乐、游戏、虚拟现实等行业中具有重要应用                       [1–4] , 还在时尚电商、广告内容生成和社交媒
                 体内容创作等多个领域        [5–11] 展示了其潜力. 在娱乐和游戏行业, 姿态控制人物图像视频生成技术可以用于创建逼
                 真的虚拟角色, 增强玩家的沉浸感; 在时尚电商领域, 姿态控制生成技术使得消费者能够在没有试穿的情况下, 通
                 过虚拟试衣体验快速看到自己穿上不同服装后的效果                   [6,7,9] ; 在广告内容生成领域, 品牌商可以利用这项技术通过
                 自动生成广告短片或个性化内容来减少拍摄成本, 提高创作效率; 此外, 社交平台也逐步采用这一技术, 通过虚拟
                 人物和增强现实      (AR) 互动, 增强用户体验和娱乐性        [10,11] .
                    姿态控制人物图像视频生成技术的广泛应用, 离不开近年来各类生成模型等前沿技术的进步. 特别是生成对
                 抗网络   (generative adversarial network, GAN) [12] 和扩散模型  [13] 等生成模型, 这些方法的成功使得姿态生成任务在视
                 觉效果上逐渐突破传统方法的局限, 达到前所未有的精度和真实感. 生成对抗网络通过对抗训练的方式有效提升
                 了生成图像的质量, 尤其在处理高复杂度姿态时, 能够生成高质量、自然流畅的人物图像. 扩散模型作为近年来崭
                 露头角的生成模型, 凭借其逐步去噪的生成机制, 使得图像细节可以被更加精确地捕捉, 从而进一步提升了生成人
                 物的真实感. 与此同时, 随着更高效的姿态估计和              3D  建模的发展, 生成的虚拟人物不仅能够在二维平面上表现出
                 自然流畅的动作, 更能够模拟复杂的三维空间姿态和动态行为. 这一进步使得虚拟人物图像视频生成的应用场景
                 不再局限于静态图像的生成, 而扩展到视频生成、实时互动和增强现实等领域, 极大地丰富了应用场景.
                    尽管这一领域取得了显著进展, 姿态控制人物图像视频生成仍然面临诸多技术挑战. 首先, 如何在完成多变的
                 姿态迁移任务的情况下保留外观信息并保持外观的高度一致性是一个关键的问题. 尤其是在人物姿态发生较大变
                 化时, 需要保持面部、衣物、身体细节等外观特征的一致性, 避免在姿态转换过程中出现失真或不自然的现象. 其
                 次, 由于姿态生成任务通常需要处理复杂场景中的遮挡和不可见部分, 如何推测并生成符合风格一致性的外观来
                 补充这些缺失的外观信息, 也是一项严峻的挑战. 此外, 姿态、背景和时间一致性问题, 即如何确保在生成过程中
                 保持人物动作的流畅可控、背景的稳定和谐和时间一致性也是动态视频生成中的一大难题. 这些挑战的解决对于
                 提升生成质量、增强应用场景中的用户体验至关重要.
   99   100   101   102   103   104   105   106   107   108   109