Page 418 - 《软件学报》2026年第4期
P. 418
何子健 等: 基于扩散模型的个性化图像生成方法综述 1859
1.2 个性化图像生成任务
个性化图像生成的核心任务是生成包含用户指定概念 (例如特定主体、人脸或风格) 并符合给定文本指令的
图像. 视觉概念由一组图像表示, 记为 X c , 这些图像包含目标概念 y c 和文本指令 . 例如图 5 中 X c 包含了两个概
y t
念主体玩偶以及木马, 这两个概念分别用文本“doll”和“rocking horse”表示, 文本指令是“a doll riding rocking horse
in the garden”. 个性化图像生成的核心挑战在于两点, 一是要求保持个性化主体图像的高保真度, 二是满足多样化
G 的
文本指令的精准对齐. 在此, 我们首先在不同生成模型的统一框架下定义个性化图像生成. 形式上, 生成模型
生成过程可以描述为:
x = G(ε,c;θ G ) (2)
其中, θ G 表示生成模型 G 的参数, ε ∼ N(0,I) 是从高斯分布中随机采样的噪声. c = [c 0 ,...,c N ] 是一组可选条件, 例
X c 和目标文本 , 个性化图像生成的目标是生成图像 , 该图像既包含给定的视
如文本或语义图. 给定概念图像 y t x c
觉概念 y c , 又与 y t 所指示的描述保持一致:
x c = G(z,c,y t ,X c ;θ G ) (3)
生成过程通常包括概念反演和个性化生成两个主要步骤. 首先在概念反演步骤中, 给定的概念图像 X c 被投影
到表征空间, 以获得条件 c c :
c c = ϕ(X c ) (4)
其中, ϕ(·) 表示反演操作, 可以使用各种反演空间和反演方法来完成这一投影. 接着我们将 c c 输入生成模型 G 会生
成包含概念 y c 的图像. 接着在个性化生成中, 概念条件 c c 与目标文本 y t 结合, 生成所需图像:
x c = G(z,c,y t ,c c ;θ G ) (5)
本文后续将探讨 G 是扩散模型的情况, 基于扩散模型的个性化生成研究目前的发展.
2 单主体个性化生成
随着基于扩散模型的生成式方法的快速发展, 图像生成质量得到很大的提升 [2] . 研究者逐渐向可控生成的方
向 [10−12] 进行探索, 其中一个重要的课题就是保持主体的个性化生成. 本节先从单主体的个性化生成开始介绍, 包含
物体驱动学习、人像驱动学习、图像驱动个性化视频生成这 3 部分.
2.1 物体驱动学习
物体驱动学习是个性化生成最常见的学习范式, 旨在通过用户提供的少量物体图像或描述, 生成或识别与该
物体相关的内容. 与传统的生成或识别任务不同, 物体驱动学习强调对特定物体的精确建模和控制, 使得生成或识
别的内容能够高度符合用户的需求. 这些方法大致上可以分为两类: 基于优化的方法和基于学习的方法. 这两类方
法训练和推理的流程如图 6 所示.
2.1.1 基于优化的方法
基于优化的方法通过微调生成模型的参数, 将用户提供的主体图像映射到生成模型的表示空间中, 从而生成
符合文本描述的图像. 个性化生成的一个关键问题是如何用文本表示特定的概念物体, 一个通用的做法为使用需
V 代表需要学习的新概念. 该符号通过少量数据训练进行优化学习, 这个过程完成后在推理时能
∗
优化学习的符号
够和其他词自由组合进行个性化的生成. DreamBooth [13] 和 Textual Inversion [14] 是两种经典的主体驱动生成方法.
DreamBooth 通过微调 U-Net 模型的参数, 将主体图像映射到一个特殊的提示词 V 上. 具体来说, DreamBooth 使
∗
用少量主体图像和对应的文本描述对生成模型进行微调, 使得模型能够在新生成的图像中保持主体的身份特征.
尽管 DreamBooth 在生成高质量图像方面表现出色, 但其计算成本较高, 且容易受到背景和姿态等无关因素的影
响. Textual Inversion [14] 则通过微调提示词的嵌入表示来实现主体驱动生成. 与 DreamBooth 不同, Textual Inversion
不修改生成模型的参数, 而是通过学习一个新的提示词嵌入来表示主体. 这种方法在保持主体身份的同时, 减少了
计算开销, 但在生成复杂场景或多主体图像时, 容易出现主体特征丢失或文本描述不一致的问题.

