Page 415 - 《软件学报》2026年第4期
P. 415
1856 软件学报 2026 年第 37 卷第 4 期
性化生成侧重于根据用户提供的单一主体 (如特定物体、人物或风格) 生成定制化图像, 重点在于如何精确捕捉
和重建主体的视觉特征. 例如, 用户可以通过提供几张包含特定宠物的图像, 生成该宠物在不同场景下的图像. 而
多概念组合生成则专注于将多个概念或主体融合到同一图像中, 解决跨概念的语义对齐和视觉一致性问题. 例如,
用户可以通过提供多个主体的图像, 生成这些主体在同一场景下的组合图像. 图 2 列出个性化生成方法的分类, 大
致可以分为单主体个性化生成和多概念个性化生成. 目前研究有逐步从单主体到多概念的发展趋势. 基于这些研
究成果, 企业发布了基于大数据训练的个性化内容生成模型, 以 OpenAI 发布的 ChatGPT4o、谷歌的 Gemini、快
手的可灵以及字节跳动的豆包为代表, 这类模型展现出强大的多模态理解和生成能力, 能够根据用户输入的文本
描述以及参考图像生成高质量、高保真度的个性化内容 (如图 3 所示). 这些大模型通常采用扩散模型或混合自回
归架构, 通过海量多模态数据预训练获得强大的跨模态对齐能力. 相比传统工具, 它们不仅能实现更精细的风格控
制和内容定制, 还能处理复杂的时空动态生成任务.
基于优化:
基于学习:
物体驱动学习
单主体个性 人像驱动学习
化生成
基于人体运动:
图像驱动个性
化视频生成
基于扩散模 基于相机轨迹:
型的个性化
图像生成
自定义单词组合:
多概念生成与
组合 适配器组合:
多概念个性 多概念属性可
化生成 控编辑
多概念服装
组合试衣
图 2 个性化图像生成方法分类
本文旨在系统性地综述基于扩散的个性化图像生成方法, 为研究者对该领域的研究提供全面的参考. 本文从
个性化生成的相关任务出发, 从物体驱动学习、人像驱动学习以及图像驱动个性化视频生成共 3 个任务综述单主
体个性化生成的方法; 并从多概念生成与组合、多概念属性可控编辑以及多概念服装组合试衣共 3 个任务综述多
概念个性化生成. 这些任务的可视化如图 4 所示. 本文第 1 节给出扩散模型的数学背景以及个性化生成的定义, 并
对个性化生成给出统一的框架, 将个性化生成过程标准化为概念反演和个性化生成两个主要阶段. 第 2 节归纳梳
理单主体个性化生成的方法, 并从研究对象将这些方法分为物体驱动学习, 人像驱动学习以及图像驱动的个性化
视频生成这 3 部分. 第 3 节则从单主体拓展到多概念, 归纳梳理多概念组合生成的方法, 包括多概念组合和生成,
多概念属性可控编辑和针对虚拟试衣的多概念组合. 第 4 节列出相关评估指标和方法, 总结常用的数据集, 并对个
性化生成方法的实验结果进行分析. 第 5 节梳理当前基于扩散模型的个性化生成仍存在的问题和挑战, 并基于此
展开对未来的研究方向. 最后第 6 节进行本文的总结.

