Page 414 - 《软件学报》2026年第4期
P. 414

何子健 等: 基于扩散模型的个性化图像生成方法综述                                                       1855


                 Key words:  diffusion model; personalized generation; feature representation; image generation; concept preservation

                    近年来, 生成模型在图像生成领域取得了突破性进展, 从早期的生成对抗网络                         (generative adversarial network,
                                                      [2]
                     [1]
                 GAN) 到如今的扩散模型        (diffusion model, DM) , 这些模型展示了生成高质量、多样化图像的强大能力. 特别是
                 基于文本到图像的生成模型, 通过大规模预训练和文本输入的灵活控制, 能够生成与文本描述高度一致的高质量
                 图像. 这些技术进步不仅推动了图像生成领域的发展, 还为条件生成、图像编辑、艺术创作等下游任务提供了强
                 大的工具. 其中, 个性化图像生成作为生成模型的一个重要分支, 其目标是根据用户提供的特定概念或主体                                 (通常
                 是  1–5  张图片) 生成定制化的图像, 满足用户对个性化视觉内容的多样化需求. 早期研究主要采用                         GAN Inversion
                 技术  [3−6] , 通过将用户提供的图像映射到      GAN  的隐空间, 进而通过隐空间属性编辑实现个性化图像生成. 然而, 这
                 类方法在多个关键维度存在明显局限: 首先, 训练稳定性方面存在模式崩溃问题, 导致模型仅能复现训练数据而缺
                 乏泛化能力, 且生成器与判别器之间的对抗平衡难以维持; 其次, 生成质量方面, 在纹理还原和细粒度细节                             (如毛发、
                 复杂背景等) 表现欠佳; 最后, 其有限的生成多样性和可控性也严重制约了实际应用潜力. 这些固有缺陷使得                               GAN
                 Inversion  方法  [3−6] 难以满足更广泛的应用需求. 由于扩散模型在生成质量和多样性方面都取得了很大进步, GAN-
                 based  的方法逐步被   Diffusion-based  的方法取代, 并且研究者开始对扩散模型的条件可控生成进行更深入的研究.
                 本文将重点综述基于扩散模型的个性化图像生成.
                    本文在公开的期刊以及会议论文中检索了自                2022  年起基于扩散模型的个性化图像生成相关的新方法, 检索
                 途径主要选用在      IEEE Xplore、ACM Digital Library、Google 学术、arXiv  等文献数据集和搜索引擎进行相应关
                 键词和主题进行检索. 结果如图          1  所示, 自  2022  年起基于扩散模型的个性化生成相关论文方法增长迅速, 至                2025
                 年  3  月已经达到  670  篇论文. 其中, 发表在   CCF  评级  A  类期刊或会议的文献共       326  篇, 发表在其他非    CCF  评级
                 A  类期刊或会议的文献共       344  篇. 这些数据都表明基于扩散模型的发展, 个性化生成已经成为当下计算机视觉的
                 研究热点, 图   1  列出了上述   670  篇论文当中有代表性的      35  篇.

                             700
                             600
                             500
                             400
                     论文数量
                             300
                             200
                             100
                              0
                      时间线        2022              2023                         2024               2025

                                 Textual Inversion [14]  DreamBooth [13]  Custom Diffusion [99]  ELITE [18]  InstantBooth [21]  DisenBooth [15]  FastComposer [34]  Mix-of-Show [63]  Break-A-Scene [55]  Subject-Diffusion [22]  TryOnDiffusion [79]  AnyDoor [67]  IP-Adapter [20]  Animate Anyone [38]  DragonDiffusion [69]  PhotoMaker [27]  InstantID [30]  CameraCtrl [51]  FlashFace [26]  IDM-VTON [81]  MM-Diff  [32]  MS-Diffusion [73]  MimicMotion [39]  MotionCtrl [50]  Story
                       方法                                   ZipLoRA [65]



                 单主体  物体驱动学习
                 个性化 人像驱动学习
                  生成  个性化视频生成
                      多概念生成与组合
                 多概念
                 个性化 多概念属性可控编辑
                  生成  多概念服装组合试衣
                                   图 1 基于扩散模型的个性化图像生成论文自               2022  年起快速增长

                    个性化图像生成的核心任务是根据用户提供的少量图像                     (通常包含特定主体、风格或概念) 和文本描述, 生
                 成既符合用户需求又保持视觉一致性的图像. 这一任务在广告设计、虚拟现实、艺术创作等领域具有广泛的应用
                 前景. 例如, 用户可以通过提供几张包含特定宠物、人物或艺术风格的图像, 生成该主体在不同场景或风格下的定
                 制化图像. 现有的个性化图像生成方法可以从任务上分为两大类: 单主体个性化生成和多概念组合生成. 单主体个
   409   410   411   412   413   414   415   416   417   418   419