Page 118 - 《软件学报》2026年第5期
P. 118

李玘芮 等: 姿态控制人物图像视频生成技术综述                                                         1997


                 体型上出现的效果, 从而容易影响消费者的判断. 图               7  展示了虚拟试衣效果和一些失败案例. 同时, 目前在虚拟试
                 衣上的场景也逐渐开始向三维人体扩展.




















                                         (a) 虚拟试衣应用                   (b) 失败案例
                                                   图 7 虚拟试衣应用案例

                  4.2   视频生成与编辑
                    姿态控制生成技术在视频生成与编辑中的应用, 为影视、艺术、广告创作和娱乐等行业提供了前所未有的创
                 新工具. 通过将姿态信息注入生成器中, 模型可以生成动态视频内容或对已有视频进行精细化编辑, 这不仅降低了
                 内容制作成本, 还显著提升了创作的灵活性和效率.
                    在广告内容创作中, 由于常需展示服装、配饰等产品的动态效果, 一些技术提出可以从静态图像生成连续图
                 像序列来展示服装       [8] , 这类技术能够显著降低传统拍摄和后期制作的复杂性, 使得创作者能够快速生成高质量的
                 动态广告内容. 此外在娱乐、艺术等领域, MimicMotion           和  UniAnimate 等技术可以生成目标人物模仿参考动作的
                 视频, 而  DisCo  和  BodyROI7  方法可以实现视频中背景和人物的可控, 使用户能够实现更高的视频生成灵活性. 同
                 时, 与视频生成领域的问题一致, 目前应用的挑战集中在生成的实时性和时间一致性, 实现包含多角色交互、角色
                 与环境互动的视频生成技术仍有待进一步发展.
                  4.3   多模态结合生成

                    姿态控制任务结合多模态进行生成, 通过将多种输入模态                   (比如: 文本、姿态、视觉提示等) 整合为条件信息,
                                                        [137]
                 进一步提高了生成结果的多样性和实用性. UPGPT                 提出一个接受文本、姿态和视觉提示的多模态扩散模型进
                 行生成任务, 同时可以继续接受编辑操作. 这些方法通过增强条件的表达能力, 使生成器能够更好地捕捉目标姿态
                 与外观的细节, 也提升了技术的易用性. HumanDreamer           [118] 则将视频生成分为文本到姿态       (text-to-pose) 和姿态到
                 视频  (pose-to-video) 两阶段, 通过文本控制生成多样化姿态, 再基于姿态生成高质量视频, 解决了传统方法依赖预
                 定义姿态的局限性.
                  5   挑战与展望

                    姿态控制人物图像视频生成技术的不断发展使其在虚拟试穿、影视、广告、艺术等领域应用中取得了显著
                 进展. 然而, 在实际应用和研究过程中, 仍然存在许多尚未完全解决的技术挑战. 本节将从个性化信息的保留、复
                 杂场景生成、生成即时性这          3  方面总结讨论关键的代表性挑战.
                  5.1   研究挑战
                  5.1.1    外观信息的保留
                    姿态控制生成任务要求生成给定参考图像人物外观下, 具有目标姿态的人物, 而现有技术在已经应用至商用
   113   114   115   116   117   118   119   120   121   122   123