Page 423 - 《软件学报》2026年第4期
P. 423

1864                                                       软件学报  2026  年第  37  卷第  4  期


                 互处理和模型适应性等挑战. 未来的研究需要进一步探索更高效的框架和更精细的交互建模方法, 以推动该技
                 术在更广泛的实际应用中的发展. 例如, 如何在不损害模型生成能力的前提下实现更复杂的角色和环境交互,
                 以及如何提升生成视频的多样性和真实感, 都是值得深入研究的方向. 随着深度学习技术和多模态学习方法的
                 不断发展, 个性化视频生成技术有望在更多实际场景中得到广泛应用, 为人工智能生成内容                                (AIGC) 领域带来
                 更多创新和突破.
                  3   多概念个性化生成

                    视觉世界是一个由丰富视觉概念组成的复杂图景, 涵盖了多样的物体、姿态、光照条件、材质和纹理, 这些
                 元素通常以复杂的方式交织在一起. 文本到图像模型展现了学习和表达这种复杂性的卓越能力, 生成的图像不仅
                 能够捕捉单个概念, 还能将它们无缝整合到多样且连贯的场景中. 基于此, 研究者逐步从单概念的个性化生成迈向
                 多概念的个性化生成. 本节将分多概念生成与组合、多概念属性可控编辑以及多概念服装组合试衣这                              3 部分进行介绍.

                  3.1   多概念生成与组合
                    如后文图    9  所示, 多概念的生成与组合目前大概可以分为两类, 第              1  种是自定义单词组合方法, 旨在从单张或
                 少量图像中学习多个概念, 在学习的过程中对这些概念进行语义解耦, 使自定义的概念                            token  能够在新的组合中
                 重复使用. 第   2  种是适配器组合方法, 考虑直接组合多个学习好特定概念的适配器模型, 在组合的过程中实现概念
                 间的调制和优化. 先谈第       1  种, Break-A-Scene [55] 采用  DreamBooth 微调方法, 组合概念时使用用户提供的空间掩码
                 来隔离图像中的概念. 然而, 因为它无法解耦对象的姿态和外观, 这种方法对空间掩码的依赖存在显著局限性.
                 Inspiration Tree [56] 和 ConceptExpress [57] 通过从单张图像中联合学习多个词嵌入来提取多个概念, 每个词嵌入代表
                 一个不同的概念. 然而, 这些方法实现的解耦是不可预测的, 无法控制图像的哪些方面被分离为独立概念, 这限制
                 了方法的灵活性和可用性, 使其在生成复杂和多样化组合时效果不佳. TokenVerse                     [58] 针对基于  DiT [59] 的文本到图
                 像模型进行研究. 它观察到         DiT  的调制空间具有语义性, 能够实现对复杂概念的局部化控制. 基于这一发现,
                 TokenVerse 设计了一种基于优化的框架, 该框架以图像和文本描述为输入, 并为每个词在调制空间中找到一个独
                 特的方向. 这些方向随后可用于生成新图像, 将学习到的概念以所需的配置组合在一起. 对于概念的组合问题, token
                 merging (ToMe) [60] 发现词语  token  经过编码后天然地存在语义耦合并且      token  存在语义可加性. ToMe 手动聚合相
                 关  token  成混合概念, 使得多个混合概念不容易互相干扰, 大大增强了多概念组合的稳定性.
                    第  2  类方法旨在将来自不同图像的概念组合到单张生成图像中. 概念组合方法通常利用 LoRA                         [29] 来学习新概
                 念  (通常每张图像一个概念), 并提出合并多个 LoRA 以同时运行的技术. 一些方法如                        LoRA-composer  [61]  和
                 OMG [62] , 通过结合空间条件   (例如空间掩码) 并为图像的特定区域分配局部提示来实现这一点. 然而, 这限制了自
                 然重叠概念的组合能力, 例如一个人佩戴的项链, 这无法通过掩码区别划分. 其他方法                          (Gu  等人  [63] 、Po 等人  [64] 、
                 Shah  等人  [65] ) 则融合多个  LoRA, 使它们能够协同工作. 其中    Mix-of-Show [63] 定义利用多个概念 LoRA 来联合支持
                 多个定制概念的场景为去中心化概念定制. Mix-of-Show             采用嵌入分解     LoRA (ED-LoRA) 进行单模型调优, 并通
                 过梯度融合在中心节点上保留单一概念的领域本质, 理论上支持无限的概念融合. Po                           等人  [64] 提出了正交适应方
                 法, 旨在鼓励在微调过程中彼此独立的定制模型具有正交的残差权重. 这确保了在推理过程中, 定制模型能够以最
                 小干扰进行叠加. Shah    等人  [65] 则提出了  ZipLoRA, 专注于简单有效地组合单独的内容主体和风格概念.
                    多概念生成与组合的研究在近年来取得了显著进展, 但仍面临诸多挑战. 单图像多概念解耦学习方法目前仍
                 不够成熟, 但在导致生成多样化和复杂组合时仍需进一步提升灵活性和可控性. 而多模型概念组合优化方法通过
                 LoRA  技术和梯度融合等手段, 显著提升了概念组合的效率和生成图像的质量, 但在处理自然重叠概念和复杂交
                 互场景时仍有改进空间.
                  3.2   多概念属性可控编辑
                    元素级别的图像处理长期以来一直是数字艺术的目标, 现实生活中人们采用                          Adobe Photoshop  这样的编辑工
                 具进行视觉元素的精确操控. 除了多概念的图像生成外, 研究者进一步地对图像这些元素进行更深入的讨论, 包括
   418   419   420   421   422   423   424   425   426   427   428