Page 417 - 《软件学报》2026年第4期
P. 417

1858                                                       软件学报  2026  年第  37  卷第  4  期


                  1   问题定义

                  1.1   扩散模型基础

                    扩散模型的发展经历了从理论构建到大规模应用的完整演进过程. 早期的理论基础可追溯至                                Sohl-Dickstein
                 等人  [7] 提出的非平衡热力学框架, 将扩散过程与生成建模相结合. 2020                年  Ho  等人  [8] 提出的去噪扩散概率模型
                 (DDPM) 通过固定方差和逐步去噪的策略显著提升了生成质量, 成为该领域的重要里程碑. 随后在                             2021  年, 研究
                 者们通过   Song  等人  [9] 的  DDIM  加速采样、Rombach  等人  [2] 的潜在扩散模型  (LDM) 降低计算成本, 大幅提升了模
                 型的实用性和生成能力. 2022       年成为扩散模型爆发式发展的关键年份, 开源的                Stable Diffusion  推动了技术普及,
                 同年  OpenAI 发布的  DALL·E 2  和谷歌的  Imagen  展示了强大的多模态生成能力. 直至目前, 绝大部分基于扩散模
                 型的图像生成依然采用潜在扩散模型的架构, DDIM               也是最常用的采样器之一.
                    具体来说, 扩散模型      [2] 是一种通过迭代去噪过程去学习目标分布的生成模型. 扩散模型包含了一个马尔可夫

                 链前向传播以及反向传播的过程. 在前向传播的过程中, 数据样本                    x 经过  T  次加噪成噪声样本    z T ; 而在反向传播过
                 程中, 我们需要将噪声样本        z T  恢复成原样本  x, 这一过程也是样本生成的过程. 扩散模型能够在反向传播过程中加
                                                                                 ˆ x θ  能够通过加权去噪的得分匹
                 入各种信号, 例如文本和图像, 从而去引导样本的生成. 一个条件可控的扩散模型
                 配损失函数:

                                                                     2
                                                  E x,c,ε,t [w t ||ˆx θ (α t x+α t ε)− x|| ]          (1)
                                                                     2
                                 c
                                                                                                t
                 其中,  x 是目标样本,   是条件输入,     ε ∼ N(0,I) 表示高斯噪声.  、   σ t  以及  w t  是扩散模型中与时间步数   相关的函
                                                                α t
                 数变量. 目标样本通过马尔可夫链前向传播被污染为                 z T ≡ α t x+σ t ε, 而   ˆ x θ  则是噪声预测函数, 将  z T  还原为原样本  x.
                                                                         [9]
                                                  z T ∼ N(0,I) 开始并通过  DDIM 采样器进行去噪生成. 为减少训练和推
                 在推理生成阶段, 数据样本能够从高斯噪声
                 理所需的计算资源并且尽量不降低图像的生成质量, 一般使用预训练的自编码器将数据样本                              x 压缩到潜在空间中.
                 图  5  给出扩散模型去噪进行图像生成的过程.

                                                                    个性化主体图像 X c
                                                    图像编码器

                                       特征融合
                                                                   文本指令 y t
                                                    文本编码器        a doll riding rocking
                                                                 horse in the garden
                                     图像生成器
                                       噪声预测                 噪声预测                      噪声预测

                                          1                   2                          T

                                                   Z T−1
                         高斯噪声 Z T                                          ···



                                                                                  核心挑战
                                              自解码器                                1. 要求保持个性化主体
                                                                                  图像的高保真度
                         去噪后的图                                                    2. 要求和文本指令匹配
                         像编码 x
                                                                    生成图像 x c
                                         图 5 基于扩散模型的个性化图像生成过程及挑战
   412   413   414   415   416   417   418   419   420   421   422