Page 436 - 《软件学报》2026年第4期
P. 436
何子健 等: 基于扩散模型的个性化图像生成方法综述 1877
优化模型能力, 先建立强大的特征重建基础, 再培养创造性适应能力. 3) 多模态对比学习: 构建联合嵌入空间, 使模
型能自然理解文本修改与视觉特征间的映射关系.
这些创新方向未来有望推动个性化内容合成系统突破现有瓶颈, 在个性化创作的众多领域实现更广泛的应
用. 当前研究虽已取得进展, 但在处理复杂语义修改, 同时需要模型保真的创意能力时仍面临挑战 (例如“保持人物
身份的同时改变年龄特征”), 这将成为未来研究的一个热点.
(2) 通用的个性化生成
当前个性化生成方法主要集中于特定领域, 如前文提及物体主体、人脸、服装的定制化生成. 然而在实际应
用中, 用户往往需要将多个定制化概念融合至单张图像中. 虽然已有部分研究 [58,62,65,73,109] , 但其生成能力仍存在明
显局限. 因此, 亟需发展支持通用类别的个性化生成方法, 以提供更灵活多样的生成能力. 除了现有的对象级别控
制外, 还需要实现属性级别、部件级别更细粒度的个性化控制, 使用户能够精确调控生成图像的各个细节特征. 这
种细粒度的控制能力将大幅提升个性化生成系统的实用价值, 满足专业创作场景中对细节把控的严苛要求. 要实
现这一目标, 需要突破现有方法在跨概念兼容性和组合稳定性方面的技术瓶颈, 开发新型的特征解耦与重组机制,
这也是未来通用人工智能的发展方向.
(3) 视频和三维方向的个性化生成
近年来, 视频与三维内容生成技术发展迅猛, 一系列研究方法 [110−118] 已开始探索个性化技术在这些领域的应
用. 这些技术为内容创作开辟了新途径, 同时也带来了新的技术挑战. 在个性化视频生成方面, 需要解决跨帧外观
与结构一致性的维护问题, 其复杂度远超单帧图像生成; 而在三维内容生成领域, 则需确保多视角一致性, 这就要
求生成模型必须具备准确理解和表现三维结构的能力. 未来研究的一大趋势相信会是着力推动个性化生成技术从
静态图像向动态内容和空间复杂内容的拓展, 这不仅能丰富现有创作手段, 也将为虚拟现实、影视特效等行业带
来新的技术突破. 值得注意的是, 动态内容的时序连贯性与三维场景的空间一致性将成为技术突破的关键所在, 需
要开发新型的神经网络架构和训练范式来应对这些挑战.
(4) 生成与检索的协同演进
传统个性化内容分发系统主要依赖于基于检索的方法 (如推荐系统), 但现有内容库往往难以完全满足用户的
个性化需求. 将个性化生成技术与检索式方法相结合, 有望构建更强大的内容分发体系. 这种融合架构既能利用检
索系统对用户偏好的精准把握, 又能通过生成技术突破内容库的局限性, 实现“检索-生成”的闭环优化. 具体而言,
系统可以先通过检索确定用户的内容偏好模式, 再基于这些模式动态生成符合用户期待的新内容; 同时, 生成内容
的质量反馈又可反哺检索模型的优化. 这种协同机制不仅能显著提升内容分发的精准度, 还能创造传统检索系统
无法提供的新型个性化体验, 为数字内容产业带来范式变革. 要实现这种协同效应, 需要解决生成内容的质量控制、
风格一致性保持以及实时响应等技术挑战.
(5) 更多模态的个性化提示
除文本和图像外, 个性化图像生成的提示模态正朝着多元化方向发展, 涵盖语音、脑电信号及触觉等新兴引
导提示. 在语音到图像生成领域, Sung-Bin 等人 [119] 通过跨模态潜在空间对齐方法, 利用视觉信息增强音频特征表
达, 有效缓解了视听模态间的语义鸿沟问题. 进一步地, Petermann 等人 [120] 提出基于视觉-语言模型的推理框架, 通
过检索高质量音频-图像配对数据构建可扩展的声学-视觉关联体系. 其生成的模型支持隐式语义混合与插值, 例
如仅输入火焰燃烧声与马匹奔跑声, 即可生成“烈焰战场中奔腾的骏马”这一复杂场景, 证明了音频模态对图像生
成的细粒度控制能力. 在脑电信号 (EEG) 引导生成方向, 研究者关注如何通过解码脑信号中的视觉编码信息推动
脑机接口应用. 代表性工作“Guess what I think” [121] 将扩散模型引入该领域, 基于 ControlNet 轻量化框架实现 EEG
信号对潜在扩散模型 (LDM) 的调控, 为高精度脑控图像生成提供了可行方案. 触觉引导生成的研究尚处探索阶
段, 但已显现潜力. Yang 等人 [122] 开发的触觉-视觉双向转换模型, 实现了触觉信号与图像的端到端合成, 并在多项
跨模态任务中验证了其有效性, 为触觉在交互式生成中的应用奠定了基础.
(6) 自回归与非自回归范式的统一
近年来, 生成模型的发展趋势逐渐向自回归与非自回归方法的统一方向演进. 传统自回归模型 (如 GPT) 逐元

