Page 424 - 《软件学报》2026年第4期
P. 424

何子健 等: 基于扩散模型的个性化图像生成方法综述                                                       1865


                 插入、去除、移动等, 希望能够用自动化工具实现像                 Adobe Photoshop  那样对多元素的细粒度控制. 图       10  列出主
                 体移动, 多主体和场景混合以及图像重绘这              3  种可控编辑操作    [66] . ControlNet [10] 和  IP-Adapter [20] 最早为这样基于扩
                 散模型的生成式模型设计了可控生成的范式. 它们将条件图像                    (例如姿态、布局图像) 作为额外输入, 并将它们的
                 特征注入主    U-Net 中. 但这个工作不支持交互式、多轮、基于元素的操作                 (例如, 组合、调整大小、排列), 这些操
                 作对于创意工作流程至关重要. 面临的挑战包括: 1) 视觉元素的解耦和表示, 2) 连续布局控制, 3) 保持外观和身份,
                 4) 维持视觉特征, 5) 缺乏用于端到端训练的大规模配对训练数据.

                                                  a doll wearing a shirt and a necklace
                                                      词编码器
                          概念 1: necklace



                                            细节调           扩散模型              自解码器
                                             制器
                           概念 2: shirt





                            概念 3: doll
                                                                       [58]
                                            (a) 自定义单词组合的代表方法 TokenVerse  的流程
                                                         预训练扩散模型


                                                                                          多概念
                                                                                          图像


                                     适配器         适配器       适配器        适配器        适配器      多概念模
                                                                                          型适配器
                                           模型解耦融合
                                                          结合文本和
                                          微调后的扩散模型
                                                          额外控制
                                                                      [63]
                                             (b) 适配器组合的代表方法 Mix-of-Show  的流程
                                                图 9 多概念生成与组合示意图

                    AnyDoor [67] 首先研究了概念插入的问题, 如何既准确且无缝地将目标物体放置到场景图像的期望位置中. 具
                 体而言, AnyDoor 通过将目标物体作为模板, 重新生成场景图像中由框/掩码标记的局部区域. 为实现这一点, AnyDoor
                 使用  DINO [68] 作为  ID  提取器来提取概念物体的关键      ID  特征, 并使用了一个类似     ControlNet 的结构来获取物体的
                 细节图作为补充. DragonDiffusion  [69] 则探讨了物体移动编辑问题, 在扩散模型上实现了拖拽式的图像元素编辑操
                 作. 该方法将图像编辑操作重新定义为预训练扩散模型中特征对应关系的优化过程, 其核心在于构建与编辑目标
                 对齐的能量函数, 并通过梯度引导实现精确控制. 具体而言, 该方法提出了两项关键技术: 1) 基于特征对应关系的
                 梯度优化机制, 将用户拖拽操作转化为潜在空间的特征调整; 2) 视觉交叉注意力策略, 利用记忆库设计保持编辑区
                 域与原始图像的一致性. 得益于这些高效的设计, 所有内容编辑和一致性操作都来自原图像特征对应关系, 无需额
                 外的模型微调或附加模块.
   419   420   421   422   423   424   425   426   427   428   429