Page 431 - 《软件学报》2026年第4期
P. 431
1872 软件学报 2026 年第 37 卷第 4 期
对于图像驱动视频生成方法, 表 3 列出了 DisCo [41] 、MagicAnimate [42] 、Animate Anyone [38] 、Champ [43] 、
UniAnimate [40] 和 Animate Anyone 2 [49] 共 6 个方法在 TikTok benchmark 的定量对比结果. 图像驱动的视频生成需要
较大计算资源, 在不插帧优化的情况下, 上述 6 个方法在 32 帧的视频生成至少需要约 64 GB 的显存, 参数量在
1.2B 左右, 同时在 A100 显卡上运算约为 4 min 左右.
表 3 图像驱动视频生成方法在 TikTok 数据集上定量对比
方法 SSIM↑ PSNR (dB)↑ LPIPS↑ FVD↓
[41]
DisCo 0.668 29.03 0.292 292.80
[42]
MagicAnimate 0.714 29.16 0.239 179.07
[38]
Animate Anyone 0.718 29.56 0.285 171.90
[43]
Champ 0.802 29.91 0.234 160.82
[40]
UniAnimate 0.811 30.77 0.231 148.06
[49]
Animate Anyone 2 0.812 30.82 0.223 144.65
对于多概念生成与组合方法, 由于目前缺乏合适的定量指标去衡量生成的图片是否符合多概念条件, 一般
采用定性对比的方法. 图 14 列出 TokenVerse [58] 中 ConceptExpress [57] 、Break-A-Scene [55] 、DreamBooth [13] 、
OMG [62] 和 TokenVerse [58] 在 3 组概念图像上的对比, 其中“ ' ”表示使用多概念联合训练策略. 基于适配器组合的
方法 OMG [62] 对于输入图像中多概念的隔离依然存在挑战, 而自定义单词组合方法 ConceptExpress [57] 和 Break-A-
Scene [55] 则在细节保持方面存在缺陷, 例如图 14 中第 1 行的猫以及第 3 行的帽子. 目前基于 DiT [59] 模型的方法
TokenVerse 取得了最好的效果. 在模型大小和显存消耗方面, 前 5 个方法都是基于 Stable Diffusion 进行微调, 模
型大小为 1B 左右, 显存消耗在 8–10 GB 之间, 而 TokenVerse 采用 DiT 模型, 模型大小为 12B 左右, 显存消耗增
至 42 GB.
概念图像 ConceptExpress [57] Break-A-Scene′ [55] DreamBooth′ [13] DreamBooth [13] OMG [62] TokenVerse [58]
(a) A cat next to a doll in the garden
(b) A cat wearing a hat
(c) A man wearing a hat and glasses
图 14 多概念生成与组合方法对比
对于多概念属性可控编辑方法, 表 4 和图 15 列出基于 BlobCtrl [66] 中 AnyDoor [67] 、Magic Fixup [72] 、Gligen [71]
和 BlobCtrl [66] 在 BlobBench 的定量和定性对比结果. 如图 15 所示, 基于布局引导的图像生成方法 Gligen [71] 无法重
现输入场景, Magic Fixup [72] 则在移动和改变尺寸的任务上缺乏对空白的修补, AnyDoor [67] 和 BlobCtrl [66] 都取得了
不错的效果. 在模型大小和显存消耗方面, AnyDoor [67] 和 Magic Fixup [72] 的参数量在 1B 左右, 推理显存消耗在
8–10 GB. Gligen 由于需要引入定位指令, 参数量增至 1.1B 左右, 显存消耗增至 11 GB 左右. 而 BlobCtrl [66] 的参数

