Page 417 - 《软件学报》2026年第4期
P. 417
1858 软件学报 2026 年第 37 卷第 4 期
1 问题定义
1.1 扩散模型基础
扩散模型的发展经历了从理论构建到大规模应用的完整演进过程. 早期的理论基础可追溯至 Sohl-Dickstein
等人 [7] 提出的非平衡热力学框架, 将扩散过程与生成建模相结合. 2020 年 Ho 等人 [8] 提出的去噪扩散概率模型
(DDPM) 通过固定方差和逐步去噪的策略显著提升了生成质量, 成为该领域的重要里程碑. 随后在 2021 年, 研究
者们通过 Song 等人 [9] 的 DDIM 加速采样、Rombach 等人 [2] 的潜在扩散模型 (LDM) 降低计算成本, 大幅提升了模
型的实用性和生成能力. 2022 年成为扩散模型爆发式发展的关键年份, 开源的 Stable Diffusion 推动了技术普及,
同年 OpenAI 发布的 DALL·E 2 和谷歌的 Imagen 展示了强大的多模态生成能力. 直至目前, 绝大部分基于扩散模
型的图像生成依然采用潜在扩散模型的架构, DDIM 也是最常用的采样器之一.
具体来说, 扩散模型 [2] 是一种通过迭代去噪过程去学习目标分布的生成模型. 扩散模型包含了一个马尔可夫
链前向传播以及反向传播的过程. 在前向传播的过程中, 数据样本 x 经过 T 次加噪成噪声样本 z T ; 而在反向传播过
程中, 我们需要将噪声样本 z T 恢复成原样本 x, 这一过程也是样本生成的过程. 扩散模型能够在反向传播过程中加
ˆ x θ 能够通过加权去噪的得分匹
入各种信号, 例如文本和图像, 从而去引导样本的生成. 一个条件可控的扩散模型
配损失函数:
2
E x,c,ε,t [w t ||ˆx θ (α t x+α t ε)− x|| ] (1)
2
c
t
其中, x 是目标样本, 是条件输入, ε ∼ N(0,I) 表示高斯噪声. 、 σ t 以及 w t 是扩散模型中与时间步数 相关的函
α t
数变量. 目标样本通过马尔可夫链前向传播被污染为 z T ≡ α t x+σ t ε, 而 ˆ x θ 则是噪声预测函数, 将 z T 还原为原样本 x.
[9]
z T ∼ N(0,I) 开始并通过 DDIM 采样器进行去噪生成. 为减少训练和推
在推理生成阶段, 数据样本能够从高斯噪声
理所需的计算资源并且尽量不降低图像的生成质量, 一般使用预训练的自编码器将数据样本 x 压缩到潜在空间中.
图 5 给出扩散模型去噪进行图像生成的过程.
个性化主体图像 X c
图像编码器
特征融合
文本指令 y t
文本编码器 a doll riding rocking
horse in the garden
图像生成器
噪声预测 噪声预测 噪声预测
1 2 T
Z T−1
高斯噪声 Z T ···
核心挑战
自解码器 1. 要求保持个性化主体
图像的高保真度
去噪后的图 2. 要求和文本指令匹配
像编码 x
生成图像 x c
图 5 基于扩散模型的个性化图像生成过程及挑战

