Page 432 - 《软件学报》2026年第4期
P. 432

何子健 等: 基于扩散模型的个性化图像生成方法综述                                                       1873


                 量在  1.5B  左右, 推理显存消耗在    17 GB  左右. 相对应地, 由于   BlobCtrl [66] 能够实现高效精细的元素级别的操作, 目
                 前取得了最好的编辑效果.

                                             表 4 多概念属性可控编辑方法定量对比

                                    组合              移动              替换             改变尺寸         推理显存
                      方法
                                CLIP↑  DINO↑    CLIP↑  DINO↑    CLIP↑  DINO↑    CLIP↑  DINO↑    消耗 (GB)
                          [67]
                   AnyDoor      0.867   0.812   0.854   0.817   0.817   0.802   0.833   0.837     10
                         [71]
                    Gligen      0.707   0.578   0.712   0.624   0.684   0.606   0.782   0.694     12
                           [72]
                  Magic Fixup   0.805   0.786   0.846   0.824   0.842   0.801   0.837   0.852      8
                         [66]
                    BlobCtrl    0.883   0.869   0.889   0.878   0.862   0.860   0.865   0.891     17







                              BlobCtrl [66]






                              AnyDoor [67]







                               Gligen [71]






                           Magic Fixup [72]



                                          (a) 组合        (b) 移动       (c) 改变尺寸        (d) 替换
                                   图 15 多概念属性可控编辑方法在           BlobBench  数据集上定性对比

                    对于虚拟试衣方法, 表       5  和表  6  分别对基于模板的方法和自由生成两种类别的算法进行定量对比, 基于模板
                 的方法包括    HR-VTON [75] 、LaDI-VTON [76] 、DCI-VTON [77] 、Stable VITON [78] 、OOTDiffusion [80] 、IDM-VTON [81]
                 和  BooW-VTON [82] . 自由生成的方法包括  StableGarment [83] 、Magic Clothing [85] 、IMAGDressing [84] 和  AnyDressing [87] .
                 图  16  给出  BooW-VTON [82]  对于基于模板的虚拟试衣方法的定性对比, 而图          17  则给出了  AnyDressing [87] 中对自由
                 生成该类方法的定性对比. 对于图          16 展示的结果对比, HR-VTON    是基于   GAN  的方法, 虽然生成速度很快       (<200 ms),
                 但是生成质量较差. 其他       8  个方法均为基于扩散模型的算法, LaDI-VTON          和  DCI-VTON  采用跨注意力输入衣服
                 特征, 生成质量有所提高但泛化性能依然不足              (如图  16  第  3  行), 生成速度在  3 s 左右, 模型大小约为  1B, 显存消耗
                 为  7–8 GB. 而  OOTDiffusion、IDM-VTON、BooW-VTON、Stable VITON  均使用双  U-Net, 衣服细节特征保留得
   427   428   429   430   431   432   433   434   435   436   437