Page 429 - 《软件学报》2026年第4期
P. 429

1870                                                       软件学报  2026  年第  37  卷第  4  期



                                      表 1 物体驱动学习方法在        DreamBench  数据集上定量对比

                       方法           类型      网络架构      DINO-I↑  CLIP-I↑  CLIP-T↑  推理时间    推理显存消耗 (GB)
                    真实匹配图像           -         -       0.774   0.885     -        -            -
                              [14]
                  Textual Inversion  基于优化    U-Net     0.569   0.780    0.255   19.2 min        6
                            [13]
                    DreamBooth     基于优化      U-Net     0.668   0.803    0.305   22.3 min        6
                              [99]
                  Custom Diffusion  基于优化     U-Net     0.643   0.790    0.305    6.1 min        5
                          [18]
                      ELITE        基于学习      U-Net     0.621   0.771    0.293     3.2 s         6
                             [19]
                   BLIP-Diffusion  基于学习      U-Net     0.594   0.779    0.300     4.1 s         8
                            [20]
                     IP-Adapter    基于学习      U-Net     0.667   0.813    0.289     3.3 s         7
                              [22]
                  Subject-Diffusion  基于学习    U-Net     0.711   0.787    0.293     4.3 s         8
                           [24]
                     OmniGen       基于学习       DiT      0.693   0.810    0.320     6.2 s        40
                           [25]
                     UniReal       基于学习       DiT      0.702   0.806    0.326     6.5 s        40

                            A can with a
                            mountain in the
                            background

                             A toy on a
                             cobblestone
                             street




                              A boot in
                              the jungle

                   概念图像      文本指令    Textual Inversion [14]  DreamBooth [13]  Custom Diffusion [99]  ELITE [18]  IP-Adapter [20]  Subject-Diffusion [22]

                 IMG1
                               The can is
                               placed on a
                               table full of
                               fruits

                 IMG1
                               The cat is
                               climbing
                               the tree


                   概念图像         文本指令       UniReal [24]  OmniGen [25]  BLIP-Diffusion [19]  ELITE [18]  IP-Adapter [20]
                                     图 12 物体驱动学习方法在         DreamBench  数据集上定性对比

                    对于人像驱动学习方法, 基于         StoryMaker [35] 和  Visual Persona [37] , 表  2  和图  13  列出  MM-Diff [32] 、PhotoMaker-
                 V2 [27] 、IP-Adapter-FaceID [20] 、InstantID [30] 、StoryMaker [35] 和  Visual Persona [37] 在互联网人物数据集和  PPR10K  数
                 据集上的定量和定性对比结果. 从图           13  中可以看到, 这些方法都能在一定程度上保持住              ID, 而  StoryMaker [35] 通过
                 对人脸和角色的分别建模, 在半身人像生成上性能取得领先. 而全身人像生成上, 除                         Visual Persona 外的方法都缺
                 乏对全身的建模, 因而身体的生成并不好. 人像驱动学习方法均为基于学习的方法, 推理速度在                             A100  显卡上小于
                 5 s. 这些方法都是基于     Stable Diffusion  上进行微调, 模型参数量在  1B  左右. StoryMaker 需同时提取人脸和图像特
                 征, 推理的显存占用较高, 需       14 GB.
   424   425   426   427   428   429   430   431   432   433   434