Page 117 - 《软件学报》2026年第5期
P. 117

1996                                                       软件学报  2026  年第  37  卷第  5  期



                                   表 4 姿态控制人物图像视频生成方法在             TikTok  数据集上的评测

                                                              Image                          Video
                       方法         数据来源
                                            FID↓   SSIM↑  PSNR↑ (dB)  LPIPS↓    L1↓     FID-VID↓  FVD↓
                      FOMM          [1]     85.03  0.648     29.01     0.335  3.61E–04    90.09   366.39
                      MRAA          [79]    54.47  0.672     18.14     0.296  3.21E–04    66.36   284.82
                      TPSMM         [78]    53.78  0.673     18.32     0.299  3.23E–04    72.55   306.17
                     DreamPose      [1]     79.46  0.509     13.19     0.450  6.91E–04    80.51   551.56
                     MagicPose      [34]    25.50  0.752     29.53     0.292  0.81E–04    46.30     -
                      DisCo         [1]     30.75  0.668     29.03     0.292  3.78E–04    59.90   292.80
                    MagicAnimate    [35]    32.09  0.714     29.16     0.239  3.13E–04    21.75   179.07
                   Animate Anyone   [36]     -     0.718     29.56     0.285    -          -      171.90
                  Animate Anyone 2  [40]     -     0.812     30.82     0.223    -          -      144.65

                  3.2.2    主观指标
                    在姿态控制人物图像视频生成任务的评估中, 除了客观的定量指标外, 主观指标也发挥着至关重要的作用. 主
                 观指标主要通过用户实验来直接评判生成图像的视觉效果与自然性, 从而弥补客观评价指标的局限性. 具体而言,
                 研究团队通常采用用户评分方法衡量图像的整体质量、姿态准确性以及细节保留效果等关键维度, 并以平均分作
                 为最终的质量评判标准. 然而, 这种调研方式也存在一些明显的不足, 例如较强的主观性以及较高的人力成本.
                    在实际操作中, 研究团队所采用的主观评测方法大致可以分为评级打分和偏好性比较两大类. 所选择的评测
                 方法的依据多种多样, 涵盖了真实性、姿态转移的准确性、视频生成中的时间一致性、运动的真实性、平滑度以
                 及重演的准确性等诸多方面.
                  4   应 用

                    姿态控制人物图像视频生成技术的多样化应用场景展现了其广泛的实用性和商业价值. 在虚拟试穿、广告内
                 容创作、视频生成、虚拟现实增强现实、与多模态技术结合等场景下, 相关技术不断提升生成结果的可控度、可
                 行性和质量    [135] , 提升用户体验的同时也不断开辟着新的应用场景.
                  4.1   虚拟试穿与时尚行业
                    虚拟试穿是姿态控制人物图像视频生成技术的核心应用场景之一, 通过将目标服装映射到指定姿态下的虚拟
                 人物图像中, 可以极大地提升用户的试衣体验, 同时相关电商也可以以更低的成本完成广告信息的制作.
                    从用户端出发, 用户对线下购物的需求有一部分体现在对试衣的需要, 但是通过姿态控制生成技术, 如                                M2E-
                 try on Net [57] 等技术可以将服装从提供的模特图像中提取, 产生目标人物的试衣图像, 用户便可以在线上购物中获
                 得试衣的体验. 为了满足用户对虚拟试衣的需要, 现有技术也拓展出更多的可控性、灵活性. 为了满足用户对服装
                 个性化的需求, 生成模型也开始支持对服装组件的编辑. 一些方法                     [44–46] 通过编辑特定的服装部件     (如改变衣领、
                 袖口的样式), 进一步增强了虚拟试穿系统的灵活性. DiOr 提出循环的生成流水线, 可以实现穿衣顺序的可控性以
                                                             [6]
                 及服装之间的不同交互, 比如先穿          T  恤再穿外套, 或者是将上衣的底部塞到裤子里之类的要求, 从而实现更真实的
                 试穿体验. 而目前新兴的整合完整的虚拟穿衣技术也层出不穷, 如代表了最新技术前沿的                             OOTDiffusion [136] 模型
                             [7]
                 和  OutfitAnyone 借助扩散模型, 在试衣中可以支持不同的身材, 支持不同衣物的组合搭配, 也实现了对高分辨率
                 试穿效果的支持. 其中      OutfitAnyone 还可以结合  Animate Anyone [36] 算法进行视频生成的下游任务. 从设计者出发,
                 一些方法   [18,38] 提供了从学习到的特征空间采样生成新样本的技术, Yang            等人  [41] 则提供了改变部件色彩的技术, 可
                 以使效果呈现的成本降低, 从而辅助相关设计师进行新服装的设计工作. 从商户端出发, 虚拟试穿技术则可以帮助
                 商家进行低成本的产品宣传图的制作, Fang 等人             [23] 提出在静态图像之间合成连续的图像序列来动态展示服装的
                 方法, 而如绘蛙、linkfox   等平台可以只通过产品图像完成多姿态多视角模特试穿、展示视频生成等任务. 但同时
                 由于目前技术对细节保留, 布料仿真不够真实、精确, 虚拟试衣难以准确描述真实产品的版型在不同姿态及不同
   112   113   114   115   116   117   118   119   120   121   122