Page 425 - 《软件学报》2026年第4期
P. 425

1866                                                       软件学报  2026  年第  37  卷第  4  期



                                                      ①

                                                      ②


                                                      ③


                            (a) 主体移动                  (b) 多主体和场景混合                    (c) 图像重绘
                                               图 10 常见的多概念属性可控编辑

                    仅用图像特征进行操作往往缺乏足够的精度, 一些工作开始借助布局进行更稳定的图像编辑. Zhang                              等人  [70]
                 提出了首个用于单张图像布局编辑的框架, 实现对单张图像进行连续编辑的同时并保持图像概念的外观属性. 该
                 研究通过两个关键技术突破解决了这一挑战: 首先, 开发了掩码文本反演方法, 将图像中的多个对象概念解耦并嵌
                 入到独立的文本标记中, 有效保持了各对象的视觉属性; 其次, 设计了一种无需训练的优化策略, 通过对预训练扩
                 散模型施加布局控制约束, 使生成图像既能忠实呈现学习到的视觉概念, 又能精确匹配用户指定的新布局. 这种端
                 到端的解决方案不仅实现了高质量的布局编辑效果, 还保持了原始图像的核心视觉特征. Gligen                           [71] 可以根据文本
                 描述和定位指令生成图像. 定位指令提供有关图像的附加信息, 例如边界框、深度图、语义地图等. 为了防止知识
                 遗忘, Gligen  [71] 冻结基座模型权重, 并添加新的可训练门控          Transformer 层, 以接收新的定位输入. 在训练期间,
                 Gligen  使用门控机制逐渐将新的定位信息融合到预训练模型中. 这种设计使得生成灵活, 并提高了质量和可控性.
                 Magic Fixup [72] 提出了一种包含变换与协调两阶段处理的流程框架, 能够从原始图像中迁移精细细节特征, 并保持
                 各组成部分的视觉一致性. 但由于其训练依赖于视频数据, 在实际图像编辑应用时可能会导致性能下降. MS-
                 Diffusion [73] 提出了基于布局引导的多概念零样本图像个性化框架, 该框架整合了多主体的兼容性、零样本学习能
                 力的融入、布局引导的提供以及基础模型参数的保留. MS-Diffusion                将布局   token  与特征重采样器相结合以保持
                 主题之间的细节保真度, 并改进了交叉注意力机制, 使其能够适应多主体输入, 确保每个主体条件作用于特定区
                 域. 该多主体交叉注意力机制在保持文本控制的同时, 协调了主题之间的和谐组合.
                    上面的工作大多只探讨了多概念属性编辑的部分操作, 为进一步设计多概念属性统一的视觉理解框架, 研究
                 者们从元素建模进行设计, 增强编辑的可控性. 元素级别视觉建模的本质在于位置、语义和身份的灵活解耦和表

                 示. BlobCtrl [66] 设计了  Blob  作为视觉基元来实现这一点. 这种    Blob  是一个概率二维高斯分布, 几何上表现为一个
                 椭圆. Blob  参数能够精确指定位置、大小和方向, 而高斯平滑性确保了和谐且连续的布局控制. 对于视觉概念保
                 持, BlobCtrl 使用可微分斑点溅射结合变分自编码器特征来保持外观. 借助这种特殊的                      Blob  基元设计, BlobCtrl 实
                 现了高效精细的元素级别的操作, 包括图像中概念主体的插入、移动、去除、替换等. 扩散模型的高维噪声输入
                 空间并不天然适合图像反演或空间编辑. Mu              等人  [74] 提出了一种图像表示方法, 利用扩散模型促进输入图像的空
                 间编辑. 具体地, 他们考虑学习将输入编码为能够忠实重建输入图像的“图像元素”. 这些元素可以由用户直观地编
                 辑, 并通过扩散模型解码为真实的图像.
                  3.3   多概念服装组合试衣
                    虚拟试衣作为多概念个性化生成的重要子任务, 旨在生成穿着指定服装且保持人物身份一致性的图像, 在电
                 子商务和创意设计领域具有广泛的应用前景. 这个任务的示意图如图                      11  所示, 服装提取   U-Net 网络用于提取多个
                 服装的特征, 然后将这些特征以注意力的方式注入生成图像的主                     U-Net 中. 同时为保持人物的一致性, 服装试衣的
                 方法会将人物身体进行遮挡, 将仅保留人脸信息的图像以及姿态图作为条件输入. 一些方法还会设计相应的文本
                 辅助最终的图像生成.
                    早期的虚拟试衣方法        [75−77] 采用二阶段网络. 第  1  阶段是学习服装图像到生成图像的像素级别的变换, 这一步
                 被称为“变形”; 第    2  阶段则是将变形后的服装“融合”到人物之中. 该种方法缺乏将服装概念深入挖掘的过程, 单纯
   420   421   422   423   424   425   426   427   428   429   430