Page 419 - 《软件学报》2026年第4期
P. 419
1860 软件学报 2026 年第 37 卷第 4 期
图像编码器 文本编码器 V 图像
*
V 图像 文本编码器
*
特征融合
添加 添加
噪声 噪声
扩散 模型 扩散模型
输入图像 重建损失 重建图像 输入图像 重建损失 重建图像
训练阶段 训练阶段
测试阶段 测试阶段
*
图像编码器 文本编码器 V +概念
V +概念 文本编码器
*
特征融合
参考图像
扩散 模型 扩散 模型
噪声图像 迭代去噪 噪声图像 迭代去噪
个性化图像 个性化图像
(a) 基于优化的方法 (b) 基于学习的方法
训练模块 冻结模块
图 6 物体驱动学习示意图
DisenBooth [15] 注意到了微调时主体相关信息和非主体相关信息在潜在嵌入空间中存在耦合, 这使得: 1) 隐藏
在耦合嵌入中与主体无关的信息主导生成过程, 使得生成的图像严重依赖于无关信息, 从而忽略了控制的文本描
述; 2) 本应该主导生成的主体信息无法得到恰当保留, 进而导致生成时图像中的主体发生畸变. 为解决这些问题,
DisenBooth 在去噪过程中对预训练的扩散模型进行微调, 采用解耦的嵌入来分别保留主体身份信息并捕捉与身份
无关的信息, 并设计了新颖的弱去噪和对比嵌入辅助机制, 以实现更高效的解耦.
2.1.2 基于学习的方法
基于学习的方法框架因其在测试阶段无需微调的特性, 逐渐成为更具现实应用潜力的解决方案. 这类方法的
核心思想是通过引入额外的模块或预训练模型 (如视觉编码器、适配器模块或分割掩码等), 将主体图像直接映射
到生成模型的表示空间中, 从而避免微调网络的时间开销. 如图 6(b) 所示, 基于学习的方法会以参考图像和文本
描述作为两部分独立输入, 并通过在训练阶段大量数据样本重建的训练得到一个良好的图像编码器, 同时还会设
计一个合适的图像特征和文本特征融合的模块, 最终将特征注入扩散模型之中.
如何高效获取图像特征是基于学习方法的关键, 一个通用的做法是借助预训练的跨模态模型例如 CLIP [16] 和
BLIP [17] . ELITE [18] 和 BLIP-Diffusion [19] 是这个思想的两个典型方法. ELITE 通过预训练的视觉编码器 CLIP 提取主
体多层次图像特征, 然后将这些特征直接映射到文本空间, 从而实现高效的主体驱动生成.
ELITE 使用全局和局部映射机制, 分别捕捉主体的整体外观和细节特征, 从而生成高质量的个性化图像. 而
BLIP-Diffusion 设计了一个基于 BLIP-2 的多模态表示学习框架, 这个框架主要包含 2 个组成部分: 一个预训练的
图像编码器, 用于提取图像特征, 而另一个是多模态编码器 (Q-Former), 用于图像文本对齐. 该多模态编码器的输
入是可学习的查找 token 和文本, 输出与文本对齐的图像特征. 这些查找 token 通过自注意力与文本进行交互以及
通过交叉注意力与图像特征进行交互. 然而, 这两个方法对主体姿态和背景的鲁棒性较差, 容易受到无关因素的影
响, 且依赖于预训练的视觉编码器, 可能无法完全捕捉复杂主体的特征.

