Page 420 - 《软件学报》2026年第4期
P. 420
何子健 等: 基于扩散模型的个性化图像生成方法综述 1861
为突破预训练图像特征提取模型的能力限制, 后续的方法设计了基于参考图像的条件网络架构并将其融合到
扩散模型生成的骨干网络之中. 例如 IP-Adapter [20] 训练了一个轻量级的解耦跨注意力模块, 其中图像特征和文本
特征分别作为注意力的查询特征. IP-Adapter 无需像 ELITE 或 BLIP-Diffusion 设计可学习的空白 token. Instant-
Booth [21] 则采用不同的策略, 通过将主体图像的特征直接注入生成模型的中间层以及引入一些适配器层来学习丰
富的视觉特征表示, 能够在不修改模型参数的情况下生成个性化图像. 进一步地, Subject-Diffusion [22] 融合了可学
习空白 token 和基于参考图像的条件网络架构做法, 综合两者的优势提高了个性化生成的效果. 此外, 针对主体身
份无关因素不可避免会对生成结果的影响, Jia 等人 [23] 通过引入分割掩码或用户标注的掩码来排除背景对生成结
果的影响. 这种设计使得模型在生成过程中专注于主体特征, 提高生成图像的准确性, 且无需微调生成模型, 计算
效率较高.
最近还有研究者采用 diffusion Transformer (DiT) 网络结构实现基于学习的个性化生成 [24,25] . DiT 网络架构比
起 U-Net 的一大优势是无须再额外训练一个图像编码器, 仅需把图像 token 输入到 DiT 中, 然后微调预训练好的
DiT 网络或者采用 LoRA 等轻量级模型进行适配. OmniGen [24] 将 Flux (一个预训练 DiT 模型) 应用到物体的个性
化生成, 大幅增强了个性化生成的性能. UniReal [25] 引入了图像索引嵌入机制, 将多张图像与其对应的提示词项进
行关联映射, 将框架拓展到多主体的个性化生成.
2.2 人像驱动学习
身份保持的人像生成是主体驱动生成的一个重要分支, 在虚拟形象设计、影视制作、广告创意及社交媒体内
容生成等实际应用场景中展现出重要价值. 这类方法的核心挑战在于保持生成图像中人物身份特征的一致性. 如
图 7 所示, 参考人像也可以被视为一个特殊主体, 其典型处理流程包括: 首先通过人脸编码器提取参考人像的关键
面部特征, 经特征投影后输入图像编码器; 随后将文本特征与图像特征融合并注入扩散模型, 最终实现个性化人像
生成. FlashFace [26] 、IP-Adapter-FaceID [20] 和 PhotoMaker [27] 等方法是人像驱动学习的代表方法. 这些方法通常利用
ArcFace [28] 提取的 ID 嵌入作为条件, 确保生成图像中面部的高保真度. ArcFace 是一种基于深度学习的面部识别模
型, 能够提取高维特征向量来表征面部身份信息. 通过将这些特征向量作为生成模型的输入条件, 可以在生成图像
中保留目标人物的身份特征. IP-Adapter-FaceID [20] 是一种基于 LoRA [29] 的 AI 绘画工具, 支持多张参考图像和多种
特征提取, 能够根据人脸输入通过快速微调网络, 从而根据提示生成身份一致的图像. FlashFace [26] 将人脸身份编码
通过 ArcFace 编码为一系列特征图, 这使得模型能关注更多的脸部细节 (例如疤痕、文身和脸部形状). FlashFace
还设计了一种解耦集成策略, 在文本和图像引导生成过程中取得一个良好的平衡, 缓解人脸和文本提示间的冲突.
PhotoMaker [27] 则通过将任意数量的输入 ID 图像编码为堆叠 ID 嵌入, 保留了身份信息, 从而生成高质量的人像图
像. 这些方法在保持身份一致性的同时, 各具特色地解决了人像生成中的关键问题.
特
征
人脸编码器 投 图像编码器 文本编码器 文本描述
影
特征融合
扩散模型
噪声图像
参考人像 个性化人像
图 7 人像驱动学习示意图
在面部特征控制方面, 除使用 ArcFace 引入面部特征外, 现有研究已发展出多种创新方法. InstantID [30] 提出
的 IdentityNet 通过引入 5 个面部关键点 (包括眼睛、鼻子和嘴巴等关键部位的位置信息) 来精确控制面部结构,
该方法不仅实现了优异的面部相似性, 还能在复杂场景下保持稳定的身份一致性. PortraitBooth [31] 利用一个无需

