Page 118 - 《软件学报》2026年第5期
P. 118
李玘芮 等: 姿态控制人物图像视频生成技术综述 1997
体型上出现的效果, 从而容易影响消费者的判断. 图 7 展示了虚拟试衣效果和一些失败案例. 同时, 目前在虚拟试
衣上的场景也逐渐开始向三维人体扩展.
(a) 虚拟试衣应用 (b) 失败案例
图 7 虚拟试衣应用案例
4.2 视频生成与编辑
姿态控制生成技术在视频生成与编辑中的应用, 为影视、艺术、广告创作和娱乐等行业提供了前所未有的创
新工具. 通过将姿态信息注入生成器中, 模型可以生成动态视频内容或对已有视频进行精细化编辑, 这不仅降低了
内容制作成本, 还显著提升了创作的灵活性和效率.
在广告内容创作中, 由于常需展示服装、配饰等产品的动态效果, 一些技术提出可以从静态图像生成连续图
像序列来展示服装 [8] , 这类技术能够显著降低传统拍摄和后期制作的复杂性, 使得创作者能够快速生成高质量的
动态广告内容. 此外在娱乐、艺术等领域, MimicMotion 和 UniAnimate 等技术可以生成目标人物模仿参考动作的
视频, 而 DisCo 和 BodyROI7 方法可以实现视频中背景和人物的可控, 使用户能够实现更高的视频生成灵活性. 同
时, 与视频生成领域的问题一致, 目前应用的挑战集中在生成的实时性和时间一致性, 实现包含多角色交互、角色
与环境互动的视频生成技术仍有待进一步发展.
4.3 多模态结合生成
姿态控制任务结合多模态进行生成, 通过将多种输入模态 (比如: 文本、姿态、视觉提示等) 整合为条件信息,
[137]
进一步提高了生成结果的多样性和实用性. UPGPT 提出一个接受文本、姿态和视觉提示的多模态扩散模型进
行生成任务, 同时可以继续接受编辑操作. 这些方法通过增强条件的表达能力, 使生成器能够更好地捕捉目标姿态
与外观的细节, 也提升了技术的易用性. HumanDreamer [118] 则将视频生成分为文本到姿态 (text-to-pose) 和姿态到
视频 (pose-to-video) 两阶段, 通过文本控制生成多样化姿态, 再基于姿态生成高质量视频, 解决了传统方法依赖预
定义姿态的局限性.
5 挑战与展望
姿态控制人物图像视频生成技术的不断发展使其在虚拟试穿、影视、广告、艺术等领域应用中取得了显著
进展. 然而, 在实际应用和研究过程中, 仍然存在许多尚未完全解决的技术挑战. 本节将从个性化信息的保留、复
杂场景生成、生成即时性这 3 方面总结讨论关键的代表性挑战.
5.1 研究挑战
5.1.1 外观信息的保留
姿态控制生成任务要求生成给定参考图像人物外观下, 具有目标姿态的人物, 而现有技术在已经应用至商用

