Page 414 - 《软件学报》2026年第4期
P. 414
何子健 等: 基于扩散模型的个性化图像生成方法综述 1855
Key words: diffusion model; personalized generation; feature representation; image generation; concept preservation
近年来, 生成模型在图像生成领域取得了突破性进展, 从早期的生成对抗网络 (generative adversarial network,
[2]
[1]
GAN) 到如今的扩散模型 (diffusion model, DM) , 这些模型展示了生成高质量、多样化图像的强大能力. 特别是
基于文本到图像的生成模型, 通过大规模预训练和文本输入的灵活控制, 能够生成与文本描述高度一致的高质量
图像. 这些技术进步不仅推动了图像生成领域的发展, 还为条件生成、图像编辑、艺术创作等下游任务提供了强
大的工具. 其中, 个性化图像生成作为生成模型的一个重要分支, 其目标是根据用户提供的特定概念或主体 (通常
是 1–5 张图片) 生成定制化的图像, 满足用户对个性化视觉内容的多样化需求. 早期研究主要采用 GAN Inversion
技术 [3−6] , 通过将用户提供的图像映射到 GAN 的隐空间, 进而通过隐空间属性编辑实现个性化图像生成. 然而, 这
类方法在多个关键维度存在明显局限: 首先, 训练稳定性方面存在模式崩溃问题, 导致模型仅能复现训练数据而缺
乏泛化能力, 且生成器与判别器之间的对抗平衡难以维持; 其次, 生成质量方面, 在纹理还原和细粒度细节 (如毛发、
复杂背景等) 表现欠佳; 最后, 其有限的生成多样性和可控性也严重制约了实际应用潜力. 这些固有缺陷使得 GAN
Inversion 方法 [3−6] 难以满足更广泛的应用需求. 由于扩散模型在生成质量和多样性方面都取得了很大进步, GAN-
based 的方法逐步被 Diffusion-based 的方法取代, 并且研究者开始对扩散模型的条件可控生成进行更深入的研究.
本文将重点综述基于扩散模型的个性化图像生成.
本文在公开的期刊以及会议论文中检索了自 2022 年起基于扩散模型的个性化图像生成相关的新方法, 检索
途径主要选用在 IEEE Xplore、ACM Digital Library、Google 学术、arXiv 等文献数据集和搜索引擎进行相应关
键词和主题进行检索. 结果如图 1 所示, 自 2022 年起基于扩散模型的个性化生成相关论文方法增长迅速, 至 2025
年 3 月已经达到 670 篇论文. 其中, 发表在 CCF 评级 A 类期刊或会议的文献共 326 篇, 发表在其他非 CCF 评级
A 类期刊或会议的文献共 344 篇. 这些数据都表明基于扩散模型的发展, 个性化生成已经成为当下计算机视觉的
研究热点, 图 1 列出了上述 670 篇论文当中有代表性的 35 篇.
700
600
500
400
论文数量
300
200
100
0
时间线 2022 2023 2024 2025
Textual Inversion [14] DreamBooth [13] Custom Diffusion [99] ELITE [18] InstantBooth [21] DisenBooth [15] FastComposer [34] Mix-of-Show [63] Break-A-Scene [55] Subject-Diffusion [22] TryOnDiffusion [79] AnyDoor [67] IP-Adapter [20] Animate Anyone [38] DragonDiffusion [69] PhotoMaker [27] InstantID [30] CameraCtrl [51] FlashFace [26] IDM-VTON [81] MM-Diff [32] MS-Diffusion [73] MimicMotion [39] MotionCtrl [50] Story
方法 ZipLoRA [65]
单主体 物体驱动学习
个性化 人像驱动学习
生成 个性化视频生成
多概念生成与组合
多概念
个性化 多概念属性可控编辑
生成 多概念服装组合试衣
图 1 基于扩散模型的个性化图像生成论文自 2022 年起快速增长
个性化图像生成的核心任务是根据用户提供的少量图像 (通常包含特定主体、风格或概念) 和文本描述, 生
成既符合用户需求又保持视觉一致性的图像. 这一任务在广告设计、虚拟现实、艺术创作等领域具有广泛的应用
前景. 例如, 用户可以通过提供几张包含特定宠物、人物或艺术风格的图像, 生成该主体在不同场景或风格下的定
制化图像. 现有的个性化图像生成方法可以从任务上分为两大类: 单主体个性化生成和多概念组合生成. 单主体个

