Page 423 - 《软件学报》2026年第4期
P. 423
1864 软件学报 2026 年第 37 卷第 4 期
互处理和模型适应性等挑战. 未来的研究需要进一步探索更高效的框架和更精细的交互建模方法, 以推动该技
术在更广泛的实际应用中的发展. 例如, 如何在不损害模型生成能力的前提下实现更复杂的角色和环境交互,
以及如何提升生成视频的多样性和真实感, 都是值得深入研究的方向. 随着深度学习技术和多模态学习方法的
不断发展, 个性化视频生成技术有望在更多实际场景中得到广泛应用, 为人工智能生成内容 (AIGC) 领域带来
更多创新和突破.
3 多概念个性化生成
视觉世界是一个由丰富视觉概念组成的复杂图景, 涵盖了多样的物体、姿态、光照条件、材质和纹理, 这些
元素通常以复杂的方式交织在一起. 文本到图像模型展现了学习和表达这种复杂性的卓越能力, 生成的图像不仅
能够捕捉单个概念, 还能将它们无缝整合到多样且连贯的场景中. 基于此, 研究者逐步从单概念的个性化生成迈向
多概念的个性化生成. 本节将分多概念生成与组合、多概念属性可控编辑以及多概念服装组合试衣这 3 部分进行介绍.
3.1 多概念生成与组合
如后文图 9 所示, 多概念的生成与组合目前大概可以分为两类, 第 1 种是自定义单词组合方法, 旨在从单张或
少量图像中学习多个概念, 在学习的过程中对这些概念进行语义解耦, 使自定义的概念 token 能够在新的组合中
重复使用. 第 2 种是适配器组合方法, 考虑直接组合多个学习好特定概念的适配器模型, 在组合的过程中实现概念
间的调制和优化. 先谈第 1 种, Break-A-Scene [55] 采用 DreamBooth 微调方法, 组合概念时使用用户提供的空间掩码
来隔离图像中的概念. 然而, 因为它无法解耦对象的姿态和外观, 这种方法对空间掩码的依赖存在显著局限性.
Inspiration Tree [56] 和 ConceptExpress [57] 通过从单张图像中联合学习多个词嵌入来提取多个概念, 每个词嵌入代表
一个不同的概念. 然而, 这些方法实现的解耦是不可预测的, 无法控制图像的哪些方面被分离为独立概念, 这限制
了方法的灵活性和可用性, 使其在生成复杂和多样化组合时效果不佳. TokenVerse [58] 针对基于 DiT [59] 的文本到图
像模型进行研究. 它观察到 DiT 的调制空间具有语义性, 能够实现对复杂概念的局部化控制. 基于这一发现,
TokenVerse 设计了一种基于优化的框架, 该框架以图像和文本描述为输入, 并为每个词在调制空间中找到一个独
特的方向. 这些方向随后可用于生成新图像, 将学习到的概念以所需的配置组合在一起. 对于概念的组合问题, token
merging (ToMe) [60] 发现词语 token 经过编码后天然地存在语义耦合并且 token 存在语义可加性. ToMe 手动聚合相
关 token 成混合概念, 使得多个混合概念不容易互相干扰, 大大增强了多概念组合的稳定性.
第 2 类方法旨在将来自不同图像的概念组合到单张生成图像中. 概念组合方法通常利用 LoRA [29] 来学习新概
念 (通常每张图像一个概念), 并提出合并多个 LoRA 以同时运行的技术. 一些方法如 LoRA-composer [61] 和
OMG [62] , 通过结合空间条件 (例如空间掩码) 并为图像的特定区域分配局部提示来实现这一点. 然而, 这限制了自
然重叠概念的组合能力, 例如一个人佩戴的项链, 这无法通过掩码区别划分. 其他方法 (Gu 等人 [63] 、Po 等人 [64] 、
Shah 等人 [65] ) 则融合多个 LoRA, 使它们能够协同工作. 其中 Mix-of-Show [63] 定义利用多个概念 LoRA 来联合支持
多个定制概念的场景为去中心化概念定制. Mix-of-Show 采用嵌入分解 LoRA (ED-LoRA) 进行单模型调优, 并通
过梯度融合在中心节点上保留单一概念的领域本质, 理论上支持无限的概念融合. Po 等人 [64] 提出了正交适应方
法, 旨在鼓励在微调过程中彼此独立的定制模型具有正交的残差权重. 这确保了在推理过程中, 定制模型能够以最
小干扰进行叠加. Shah 等人 [65] 则提出了 ZipLoRA, 专注于简单有效地组合单独的内容主体和风格概念.
多概念生成与组合的研究在近年来取得了显著进展, 但仍面临诸多挑战. 单图像多概念解耦学习方法目前仍
不够成熟, 但在导致生成多样化和复杂组合时仍需进一步提升灵活性和可控性. 而多模型概念组合优化方法通过
LoRA 技术和梯度融合等手段, 显著提升了概念组合的效率和生成图像的质量, 但在处理自然重叠概念和复杂交
互场景时仍有改进空间.
3.2 多概念属性可控编辑
元素级别的图像处理长期以来一直是数字艺术的目标, 现实生活中人们采用 Adobe Photoshop 这样的编辑工
具进行视觉元素的精确操控. 除了多概念的图像生成外, 研究者进一步地对图像这些元素进行更深入的讨论, 包括

