Page 424 - 《软件学报》2026年第4期
P. 424
何子健 等: 基于扩散模型的个性化图像生成方法综述 1865
插入、去除、移动等, 希望能够用自动化工具实现像 Adobe Photoshop 那样对多元素的细粒度控制. 图 10 列出主
体移动, 多主体和场景混合以及图像重绘这 3 种可控编辑操作 [66] . ControlNet [10] 和 IP-Adapter [20] 最早为这样基于扩
散模型的生成式模型设计了可控生成的范式. 它们将条件图像 (例如姿态、布局图像) 作为额外输入, 并将它们的
特征注入主 U-Net 中. 但这个工作不支持交互式、多轮、基于元素的操作 (例如, 组合、调整大小、排列), 这些操
作对于创意工作流程至关重要. 面临的挑战包括: 1) 视觉元素的解耦和表示, 2) 连续布局控制, 3) 保持外观和身份,
4) 维持视觉特征, 5) 缺乏用于端到端训练的大规模配对训练数据.
a doll wearing a shirt and a necklace
词编码器
概念 1: necklace
细节调 扩散模型 自解码器
制器
概念 2: shirt
概念 3: doll
[58]
(a) 自定义单词组合的代表方法 TokenVerse 的流程
预训练扩散模型
多概念
图像
适配器 适配器 适配器 适配器 适配器 多概念模
型适配器
模型解耦融合
结合文本和
微调后的扩散模型
额外控制
[63]
(b) 适配器组合的代表方法 Mix-of-Show 的流程
图 9 多概念生成与组合示意图
AnyDoor [67] 首先研究了概念插入的问题, 如何既准确且无缝地将目标物体放置到场景图像的期望位置中. 具
体而言, AnyDoor 通过将目标物体作为模板, 重新生成场景图像中由框/掩码标记的局部区域. 为实现这一点, AnyDoor
使用 DINO [68] 作为 ID 提取器来提取概念物体的关键 ID 特征, 并使用了一个类似 ControlNet 的结构来获取物体的
细节图作为补充. DragonDiffusion [69] 则探讨了物体移动编辑问题, 在扩散模型上实现了拖拽式的图像元素编辑操
作. 该方法将图像编辑操作重新定义为预训练扩散模型中特征对应关系的优化过程, 其核心在于构建与编辑目标
对齐的能量函数, 并通过梯度引导实现精确控制. 具体而言, 该方法提出了两项关键技术: 1) 基于特征对应关系的
梯度优化机制, 将用户拖拽操作转化为潜在空间的特征调整; 2) 视觉交叉注意力策略, 利用记忆库设计保持编辑区
域与原始图像的一致性. 得益于这些高效的设计, 所有内容编辑和一致性操作都来自原图像特征对应关系, 无需额
外的模型微调或附加模块.

