Page 418 - 《软件学报》2026年第4期
P. 418

何子健 等: 基于扩散模型的个性化图像生成方法综述                                                       1859


                  1.2   个性化图像生成任务
                    个性化图像生成的核心任务是生成包含用户指定概念                    (例如特定主体、人脸或风格) 并符合给定文本指令的

                 图像. 视觉概念由一组图像表示, 记为           X c , 这些图像包含目标概念     y c  和文本指令  . 例如图   5  中  X c  包含了两个概
                                                                               y t
                 念主体玩偶以及木马, 这两个概念分别用文本“doll”和“rocking horse”表示, 文本指令是“a doll riding rocking horse
                 in the garden”. 个性化图像生成的核心挑战在于两点, 一是要求保持个性化主体图像的高保真度, 二是满足多样化
                                                                                                     G  的
                 文本指令的精准对齐. 在此, 我们首先在不同生成模型的统一框架下定义个性化图像生成. 形式上, 生成模型
                 生成过程可以描述为:

                                                        x = G(ε,c;θ G )                               (2)
                 其中,  θ G  表示生成模型  G  的参数,  ε ∼ N(0,I) 是从高斯分布中随机采样的噪声.        c = [c 0 ,...,c N ] 是一组可选条件, 例
                                          X c  和目标文本  , 个性化图像生成的目标是生成图像  , 该图像既包含给定的视
                 如文本或语义图. 给定概念图像                      y t                           x c
                 觉概念  y c , 又与  y t  所指示的描述保持一致:

                                                     x c = G(z,c,y t ,X c ;θ G )                      (3)
                    生成过程通常包括概念反演和个性化生成两个主要步骤. 首先在概念反演步骤中, 给定的概念图像                                X c  被投影
                 到表征空间, 以获得条件       c c :

                                                         c c = ϕ(X c )                                (4)
                 其中,   ϕ(·) 表示反演操作, 可以使用各种反演空间和反演方法来完成这一投影. 接着我们将                     c c  输入生成模型  G 会生
                 成包含概念    y c  的图像. 接着在个性化生成中, 概念条件        c c  与目标文本  y t  结合, 生成所需图像:

                                                     x c = G(z,c,y t ,c c ;θ G )                      (5)
                    本文后续将探讨      G 是扩散模型的情况, 基于扩散模型的个性化生成研究目前的发展.
                  2   单主体个性化生成

                    随着基于扩散模型的生成式方法的快速发展, 图像生成质量得到很大的提升                          [2] . 研究者逐渐向可控生成的方
                 向  [10−12] 进行探索, 其中一个重要的课题就是保持主体的个性化生成. 本节先从单主体的个性化生成开始介绍, 包含
                 物体驱动学习、人像驱动学习、图像驱动个性化视频生成这                     3  部分.
                  2.1   物体驱动学习
                    物体驱动学习是个性化生成最常见的学习范式, 旨在通过用户提供的少量物体图像或描述, 生成或识别与该
                 物体相关的内容. 与传统的生成或识别任务不同, 物体驱动学习强调对特定物体的精确建模和控制, 使得生成或识
                 别的内容能够高度符合用户的需求. 这些方法大致上可以分为两类: 基于优化的方法和基于学习的方法. 这两类方
                 法训练和推理的流程如图         6  所示.
                  2.1.1    基于优化的方法
                    基于优化的方法通过微调生成模型的参数, 将用户提供的主体图像映射到生成模型的表示空间中, 从而生成
                 符合文本描述的图像. 个性化生成的一个关键问题是如何用文本表示特定的概念物体, 一个通用的做法为使用需
                              V  代表需要学习的新概念. 该符号通过少量数据训练进行优化学习, 这个过程完成后在推理时能
                               ∗
                 优化学习的符号
                 够和其他词自由组合进行个性化的生成. DreamBooth             [13] 和 Textual Inversion [14] 是两种经典的主体驱动生成方法.
                 DreamBooth  通过微调 U-Net 模型的参数, 将主体图像映射到一个特殊的提示词                V  上. 具体来说, DreamBooth 使
                                                                                 ∗
                 用少量主体图像和对应的文本描述对生成模型进行微调, 使得模型能够在新生成的图像中保持主体的身份特征.
                 尽管 DreamBooth 在生成高质量图像方面表现出色, 但其计算成本较高, 且容易受到背景和姿态等无关因素的影
                 响. Textual Inversion [14] 则通过微调提示词的嵌入表示来实现主体驱动生成. 与 DreamBooth        不同, Textual Inversion
                 不修改生成模型的参数, 而是通过学习一个新的提示词嵌入来表示主体. 这种方法在保持主体身份的同时, 减少了
                 计算开销, 但在生成复杂场景或多主体图像时, 容易出现主体特征丢失或文本描述不一致的问题.
   413   414   415   416   417   418   419   420   421   422   423