Page 429 - 《软件学报》2026年第4期
P. 429
1870 软件学报 2026 年第 37 卷第 4 期
表 1 物体驱动学习方法在 DreamBench 数据集上定量对比
方法 类型 网络架构 DINO-I↑ CLIP-I↑ CLIP-T↑ 推理时间 推理显存消耗 (GB)
真实匹配图像 - - 0.774 0.885 - - -
[14]
Textual Inversion 基于优化 U-Net 0.569 0.780 0.255 19.2 min 6
[13]
DreamBooth 基于优化 U-Net 0.668 0.803 0.305 22.3 min 6
[99]
Custom Diffusion 基于优化 U-Net 0.643 0.790 0.305 6.1 min 5
[18]
ELITE 基于学习 U-Net 0.621 0.771 0.293 3.2 s 6
[19]
BLIP-Diffusion 基于学习 U-Net 0.594 0.779 0.300 4.1 s 8
[20]
IP-Adapter 基于学习 U-Net 0.667 0.813 0.289 3.3 s 7
[22]
Subject-Diffusion 基于学习 U-Net 0.711 0.787 0.293 4.3 s 8
[24]
OmniGen 基于学习 DiT 0.693 0.810 0.320 6.2 s 40
[25]
UniReal 基于学习 DiT 0.702 0.806 0.326 6.5 s 40
A can with a
mountain in the
background
A toy on a
cobblestone
street
A boot in
the jungle
概念图像 文本指令 Textual Inversion [14] DreamBooth [13] Custom Diffusion [99] ELITE [18] IP-Adapter [20] Subject-Diffusion [22]
IMG1
The can is
placed on a
table full of
fruits
IMG1
The cat is
climbing
the tree
概念图像 文本指令 UniReal [24] OmniGen [25] BLIP-Diffusion [19] ELITE [18] IP-Adapter [20]
图 12 物体驱动学习方法在 DreamBench 数据集上定性对比
对于人像驱动学习方法, 基于 StoryMaker [35] 和 Visual Persona [37] , 表 2 和图 13 列出 MM-Diff [32] 、PhotoMaker-
V2 [27] 、IP-Adapter-FaceID [20] 、InstantID [30] 、StoryMaker [35] 和 Visual Persona [37] 在互联网人物数据集和 PPR10K 数
据集上的定量和定性对比结果. 从图 13 中可以看到, 这些方法都能在一定程度上保持住 ID, 而 StoryMaker [35] 通过
对人脸和角色的分别建模, 在半身人像生成上性能取得领先. 而全身人像生成上, 除 Visual Persona 外的方法都缺
乏对全身的建模, 因而身体的生成并不好. 人像驱动学习方法均为基于学习的方法, 推理速度在 A100 显卡上小于
5 s. 这些方法都是基于 Stable Diffusion 上进行微调, 模型参数量在 1B 左右. StoryMaker 需同时提取人脸和图像特
征, 推理的显存占用较高, 需 14 GB.

