Page 415 - 《软件学报》2026年第4期
P. 415

1856                                                       软件学报  2026  年第  37  卷第  4  期


                 性化生成侧重于根据用户提供的单一主体               (如特定物体、人物或风格) 生成定制化图像, 重点在于如何精确捕捉
                 和重建主体的视觉特征. 例如, 用户可以通过提供几张包含特定宠物的图像, 生成该宠物在不同场景下的图像. 而
                 多概念组合生成则专注于将多个概念或主体融合到同一图像中, 解决跨概念的语义对齐和视觉一致性问题. 例如,
                 用户可以通过提供多个主体的图像, 生成这些主体在同一场景下的组合图像. 图                         2  列出个性化生成方法的分类, 大
                 致可以分为单主体个性化生成和多概念个性化生成. 目前研究有逐步从单主体到多概念的发展趋势. 基于这些研
                 究成果, 企业发布了基于大数据训练的个性化内容生成模型, 以                   OpenAI 发布的   ChatGPT4o、谷歌的   Gemini、快
                 手的可灵以及字节跳动的豆包为代表, 这类模型展现出强大的多模态理解和生成能力, 能够根据用户输入的文本
                 描述以及参考图像生成高质量、高保真度的个性化内容                    (如图  3  所示). 这些大模型通常采用扩散模型或混合自回
                 归架构, 通过海量多模态数据预训练获得强大的跨模态对齐能力. 相比传统工具, 它们不仅能实现更精细的风格控
                 制和内容定制, 还能处理复杂的时空动态生成任务.

                                                     基于优化:
                                                     基于学习:
                                        物体驱动学习


                              单主体个性     人像驱动学习
                               化生成


                                                     基于人体运动:
                                         图像驱动个性
                                         化视频生成
                        基于扩散模                        基于相机轨迹:
                        型的个性化
                         图像生成
                                                     自定义单词组合:
                                        多概念生成与
                                           组合        适配器组合:


                              多概念个性     多概念属性可
                               化生成         控编辑

                                         多概念服装
                                          组合试衣

                                                图 2 个性化图像生成方法分类

                    本文旨在系统性地综述基于扩散的个性化图像生成方法, 为研究者对该领域的研究提供全面的参考. 本文从
                 个性化生成的相关任务出发, 从物体驱动学习、人像驱动学习以及图像驱动个性化视频生成共                               3  个任务综述单主
                 体个性化生成的方法; 并从多概念生成与组合、多概念属性可控编辑以及多概念服装组合试衣共                                3  个任务综述多
                 概念个性化生成. 这些任务的可视化如图             4  所示. 本文第  1  节给出扩散模型的数学背景以及个性化生成的定义, 并
                 对个性化生成给出统一的框架, 将个性化生成过程标准化为概念反演和个性化生成两个主要阶段. 第                                 2  节归纳梳
                 理单主体个性化生成的方法, 并从研究对象将这些方法分为物体驱动学习, 人像驱动学习以及图像驱动的个性化
                 视频生成这    3  部分. 第  3  节则从单主体拓展到多概念, 归纳梳理多概念组合生成的方法, 包括多概念组合和生成,
                 多概念属性可控编辑和针对虚拟试衣的多概念组合. 第                  4  节列出相关评估指标和方法, 总结常用的数据集, 并对个
                 性化生成方法的实验结果进行分析. 第            5  节梳理当前基于扩散模型的个性化生成仍存在的问题和挑战, 并基于此
                 展开对未来的研究方向. 最后第         6  节进行本文的总结.
   410   411   412   413   414   415   416   417   418   419   420