Page 431 - 《软件学报》2026年第4期
P. 431

1872                                                       软件学报  2026  年第  37  卷第  4  期


                    对于图像驱动视频生成方法, 表           3  列出了  DisCo [41] 、MagicAnimate [42] 、Animate Anyone [38] 、Champ [43] 、
                 UniAnimate [40] 和  Animate Anyone 2  [49] 共  6  个方法在  TikTok benchmark  的定量对比结果. 图像驱动的视频生成需要
                 较大计算资源, 在不插帧优化的情况下, 上述             6  个方法在   32  帧的视频生成至少需要约        64 GB  的显存, 参数量在
                 1.2B  左右, 同时在  A100  显卡上运算约为   4 min 左右.

                                      表 3 图像驱动视频生成方法在          TikTok  数据集上定量对比

                           方法                 SSIM↑          PSNR (dB)↑        LPIPS↑          FVD↓
                              [41]
                          DisCo                0.668           29.03            0.292          292.80
                                 [42]
                       MagicAnimate            0.714           29.16            0.239          179.07
                                 [38]
                       Animate Anyone          0.718           29.56            0.285          171.90
                              [43]
                          Champ                0.802           29.91            0.234          160.82
                                [40]
                        UniAnimate             0.811           30.77            0.231          148.06
                                  [49]
                      Animate Anyone 2         0.812           30.82            0.223          144.65

                    对于多概念生成与组合方法, 由于目前缺乏合适的定量指标去衡量生成的图片是否符合多概念条件, 一般
                 采用定性对比的方法. 图        14  列出  TokenVerse [58] 中  ConceptExpress  [57] 、Break-A-Scene  [55] 、DreamBooth  [13] 、
                 OMG [62] 和  TokenVerse [58] 在  3  组概念图像上的对比, 其中“ ' ”表示使用多概念联合训练策略. 基于适配器组合的
                 方法  OMG [62] 对于输入图像中多概念的隔离依然存在挑战, 而自定义单词组合方法                     ConceptExpress [57] 和  Break-A-
                 Scene [55] 则在细节保持方面存在缺陷, 例如图        14  中第  1  行的猫以及第  3  行的帽子. 目前基于     DiT [59] 模型的方法
                 TokenVerse 取得了最好的效果. 在模型大小和显存消耗方面, 前              5  个方法都是基于     Stable Diffusion  进行微调, 模
                 型大小为    1B  左右, 显存消耗在    8–10 GB  之间, 而  TokenVerse 采用  DiT  模型, 模型大小为  12B  左右, 显存消耗增
                 至  42 GB.

                         概念图像           ConceptExpress [57]  Break-A-Scene′ [55]   DreamBooth′ [13]   DreamBooth [13]  OMG [62]  TokenVerse [58]






                                                              (a) A cat next to a doll in the garden






                                                                  (b) A cat wearing a hat





                                                              (c) A man wearing a hat and glasses
                                               图 14 多概念生成与组合方法对比

                    对于多概念属性可控编辑方法, 表           4  和图  15  列出基于  BlobCtrl [66] 中  AnyDoor [67] 、Magic Fixup [72] 、Gligen [71]
                 和  BlobCtrl [66] 在  BlobBench  的定量和定性对比结果. 如图  15  所示, 基于布局引导的图像生成方法       Gligen [71] 无法重
                 现输入场景, Magic Fixup [72] 则在移动和改变尺寸的任务上缺乏对空白的修补, AnyDoor             [67]  和  BlobCtrl  [66] 都取得了
                 不错的效果. 在模型大小和显存消耗方面, AnyDoor             [67] 和  Magic Fixup [72] 的参数量在  1B  左右, 推理显存消耗在
                 8–10 GB. Gligen  由于需要引入定位指令, 参数量增至       1.1B  左右, 显存消耗增至    11 GB  左右. 而  BlobCtrl  [66] 的参数
   426   427   428   429   430   431   432   433   434   435   436