Page 360 - 《软件学报》2026年第6期
P. 360

陈真 等: 可信数据增强的      QoS  感知云  API 推荐系统投毒攻击持续防御                                   2679


                 散模型的可信用户生成算法. 该算法通过迭代去噪的方式, 充分利用历史交互数据, 逐步恢复用户的个性化偏好,
                 从而生成高质量的可信用户. 图         4  展示了利用扩散模型生成可信用户的基本过程.


                                  1. 正向扩散

                                                     =           +

                                                     x t =  α t x 0  +  1−  α t  ε
                                  2. 反向生成
                                                          重复T次


                                                              ...


                                    ˆ x 0  ε θ  ˆ (x 1 ,1)  ˆ x 1  ˆ x T−1  ε θ  ˆ (x T ,T)
                                                                                     ˆ x T
                                                t=1                          t=T
                                                       1     1−α t      ~
                                                   ˆ x t−1 =  ˆ (x t −  ε θ  ˆ (x 1 ,t))  +  β t z
                                                       α t   1−α t
                                   3. 神经网络训练

                                           x t
                                                                           L t
                                           t

                                                          = E x 0 , ε [|| ε − ε θ (x 1 ,t) || ]
                                                                      2
                                                        L t
                                             图 4 基于扩散模型的可信用户生成过程

                    (1) 正向扩散. 随机采样高斯噪声, 获得不同时间步长的加噪数据, 模拟真实世界中由于用户反馈不准确等原
                 因造成的噪声交互, 并为后续神经网络训练提供数据支持.
                    (2) 反向生成. 通过迭代去噪恢复被噪声污染的交互信息, 推断用户未来的交互行为, 最后生成可信用户数据.
                    (3) 神经网络训练. 由于反向生成过程无法通过数学推理直接得出, 需要设计一个去噪神经网络来拟合并逼近
                 反向生成过程.
                  3.1   正向扩散过程

                    给定真实用户向量       x 0 ∼ q(x 0 ) 作为初始数据, 正向扩散过程经过     T  步迭代将较小的噪声逐渐地加入初始数据
                 中得到被噪声污染的数据         {x 1 , x 2 ,..., x T }. 每一步加噪过程表示如下:

                                                       √         √
                                                    x t =  1−β t x t−1 +  β t ε t                     (8)
                 其中, t∈{1, 2,…, T}表示前向扩散过程中的步骤,        ε t ∈ N(0, I) 表示  t 时刻随机采样的高斯噪声向量, 加入每一步的
                                            T                                                x t−1  有关, 所以
                 噪声的大小是由超参数        {β t ∈ (0, 1)}  控制的. 正向扩散过程中当前时刻的数据       x t  只与前一时刻数据
                                            1
                       x T  是一个马尔可夫链过程, 满足公式       (9):
                 从   x 0  到

                                                                         T ∏
                                                    √
                                        q(x t |x t−1 ) = N(x t ;  1−β t x t−1 ,β t I),q(x 1:T |x 0 ) =  q(x t |x t−1 )  (9)
                                                                         t=1
                    在每一步的噪声添加过程中, 噪声是从一个已知的分布中独立采样的. 这意味着噪声项与模型的参数无关, 因
                 此在正向扩散过程中, 每一步都是可以根据公式                (8) 精确计算的. 利用重参数化技巧和两个独立高斯噪声的可加
   355   356   357   358   359   360   361   362   363   364   365