Page 432 - 《软件学报》2026年第4期
P. 432
何子健 等: 基于扩散模型的个性化图像生成方法综述 1873
量在 1.5B 左右, 推理显存消耗在 17 GB 左右. 相对应地, 由于 BlobCtrl [66] 能够实现高效精细的元素级别的操作, 目
前取得了最好的编辑效果.
表 4 多概念属性可控编辑方法定量对比
组合 移动 替换 改变尺寸 推理显存
方法
CLIP↑ DINO↑ CLIP↑ DINO↑ CLIP↑ DINO↑ CLIP↑ DINO↑ 消耗 (GB)
[67]
AnyDoor 0.867 0.812 0.854 0.817 0.817 0.802 0.833 0.837 10
[71]
Gligen 0.707 0.578 0.712 0.624 0.684 0.606 0.782 0.694 12
[72]
Magic Fixup 0.805 0.786 0.846 0.824 0.842 0.801 0.837 0.852 8
[66]
BlobCtrl 0.883 0.869 0.889 0.878 0.862 0.860 0.865 0.891 17
BlobCtrl [66]
AnyDoor [67]
Gligen [71]
Magic Fixup [72]
(a) 组合 (b) 移动 (c) 改变尺寸 (d) 替换
图 15 多概念属性可控编辑方法在 BlobBench 数据集上定性对比
对于虚拟试衣方法, 表 5 和表 6 分别对基于模板的方法和自由生成两种类别的算法进行定量对比, 基于模板
的方法包括 HR-VTON [75] 、LaDI-VTON [76] 、DCI-VTON [77] 、Stable VITON [78] 、OOTDiffusion [80] 、IDM-VTON [81]
和 BooW-VTON [82] . 自由生成的方法包括 StableGarment [83] 、Magic Clothing [85] 、IMAGDressing [84] 和 AnyDressing [87] .
图 16 给出 BooW-VTON [82] 对于基于模板的虚拟试衣方法的定性对比, 而图 17 则给出了 AnyDressing [87] 中对自由
生成该类方法的定性对比. 对于图 16 展示的结果对比, HR-VTON 是基于 GAN 的方法, 虽然生成速度很快 (<200 ms),
但是生成质量较差. 其他 8 个方法均为基于扩散模型的算法, LaDI-VTON 和 DCI-VTON 采用跨注意力输入衣服
特征, 生成质量有所提高但泛化性能依然不足 (如图 16 第 3 行), 生成速度在 3 s 左右, 模型大小约为 1B, 显存消耗
为 7–8 GB. 而 OOTDiffusion、IDM-VTON、BooW-VTON、Stable VITON 均使用双 U-Net, 衣服细节特征保留得

