Page 425 - 《软件学报》2026年第4期
P. 425
1866 软件学报 2026 年第 37 卷第 4 期
①
②
③
(a) 主体移动 (b) 多主体和场景混合 (c) 图像重绘
图 10 常见的多概念属性可控编辑
仅用图像特征进行操作往往缺乏足够的精度, 一些工作开始借助布局进行更稳定的图像编辑. Zhang 等人 [70]
提出了首个用于单张图像布局编辑的框架, 实现对单张图像进行连续编辑的同时并保持图像概念的外观属性. 该
研究通过两个关键技术突破解决了这一挑战: 首先, 开发了掩码文本反演方法, 将图像中的多个对象概念解耦并嵌
入到独立的文本标记中, 有效保持了各对象的视觉属性; 其次, 设计了一种无需训练的优化策略, 通过对预训练扩
散模型施加布局控制约束, 使生成图像既能忠实呈现学习到的视觉概念, 又能精确匹配用户指定的新布局. 这种端
到端的解决方案不仅实现了高质量的布局编辑效果, 还保持了原始图像的核心视觉特征. Gligen [71] 可以根据文本
描述和定位指令生成图像. 定位指令提供有关图像的附加信息, 例如边界框、深度图、语义地图等. 为了防止知识
遗忘, Gligen [71] 冻结基座模型权重, 并添加新的可训练门控 Transformer 层, 以接收新的定位输入. 在训练期间,
Gligen 使用门控机制逐渐将新的定位信息融合到预训练模型中. 这种设计使得生成灵活, 并提高了质量和可控性.
Magic Fixup [72] 提出了一种包含变换与协调两阶段处理的流程框架, 能够从原始图像中迁移精细细节特征, 并保持
各组成部分的视觉一致性. 但由于其训练依赖于视频数据, 在实际图像编辑应用时可能会导致性能下降. MS-
Diffusion [73] 提出了基于布局引导的多概念零样本图像个性化框架, 该框架整合了多主体的兼容性、零样本学习能
力的融入、布局引导的提供以及基础模型参数的保留. MS-Diffusion 将布局 token 与特征重采样器相结合以保持
主题之间的细节保真度, 并改进了交叉注意力机制, 使其能够适应多主体输入, 确保每个主体条件作用于特定区
域. 该多主体交叉注意力机制在保持文本控制的同时, 协调了主题之间的和谐组合.
上面的工作大多只探讨了多概念属性编辑的部分操作, 为进一步设计多概念属性统一的视觉理解框架, 研究
者们从元素建模进行设计, 增强编辑的可控性. 元素级别视觉建模的本质在于位置、语义和身份的灵活解耦和表
示. BlobCtrl [66] 设计了 Blob 作为视觉基元来实现这一点. 这种 Blob 是一个概率二维高斯分布, 几何上表现为一个
椭圆. Blob 参数能够精确指定位置、大小和方向, 而高斯平滑性确保了和谐且连续的布局控制. 对于视觉概念保
持, BlobCtrl 使用可微分斑点溅射结合变分自编码器特征来保持外观. 借助这种特殊的 Blob 基元设计, BlobCtrl 实
现了高效精细的元素级别的操作, 包括图像中概念主体的插入、移动、去除、替换等. 扩散模型的高维噪声输入
空间并不天然适合图像反演或空间编辑. Mu 等人 [74] 提出了一种图像表示方法, 利用扩散模型促进输入图像的空
间编辑. 具体地, 他们考虑学习将输入编码为能够忠实重建输入图像的“图像元素”. 这些元素可以由用户直观地编
辑, 并通过扩散模型解码为真实的图像.
3.3 多概念服装组合试衣
虚拟试衣作为多概念个性化生成的重要子任务, 旨在生成穿着指定服装且保持人物身份一致性的图像, 在电
子商务和创意设计领域具有广泛的应用前景. 这个任务的示意图如图 11 所示, 服装提取 U-Net 网络用于提取多个
服装的特征, 然后将这些特征以注意力的方式注入生成图像的主 U-Net 中. 同时为保持人物的一致性, 服装试衣的
方法会将人物身体进行遮挡, 将仅保留人脸信息的图像以及姿态图作为条件输入. 一些方法还会设计相应的文本
辅助最终的图像生成.
早期的虚拟试衣方法 [75−77] 采用二阶段网络. 第 1 阶段是学习服装图像到生成图像的像素级别的变换, 这一步
被称为“变形”; 第 2 阶段则是将变形后的服装“融合”到人物之中. 该种方法缺乏将服装概念深入挖掘的过程, 单纯

