Page 360 - 《软件学报》2026年第6期
P. 360
陈真 等: 可信数据增强的 QoS 感知云 API 推荐系统投毒攻击持续防御 2679
散模型的可信用户生成算法. 该算法通过迭代去噪的方式, 充分利用历史交互数据, 逐步恢复用户的个性化偏好,
从而生成高质量的可信用户. 图 4 展示了利用扩散模型生成可信用户的基本过程.
1. 正向扩散
= +
x t = α t x 0 + 1− α t ε
2. 反向生成
重复T次
...
ˆ x 0 ε θ ˆ (x 1 ,1) ˆ x 1 ˆ x T−1 ε θ ˆ (x T ,T)
ˆ x T
t=1 t=T
1 1−α t ~
ˆ x t−1 = ˆ (x t − ε θ ˆ (x 1 ,t)) + β t z
α t 1−α t
3. 神经网络训练
x t
L t
t
= E x 0 , ε [|| ε − ε θ (x 1 ,t) || ]
2
L t
图 4 基于扩散模型的可信用户生成过程
(1) 正向扩散. 随机采样高斯噪声, 获得不同时间步长的加噪数据, 模拟真实世界中由于用户反馈不准确等原
因造成的噪声交互, 并为后续神经网络训练提供数据支持.
(2) 反向生成. 通过迭代去噪恢复被噪声污染的交互信息, 推断用户未来的交互行为, 最后生成可信用户数据.
(3) 神经网络训练. 由于反向生成过程无法通过数学推理直接得出, 需要设计一个去噪神经网络来拟合并逼近
反向生成过程.
3.1 正向扩散过程
给定真实用户向量 x 0 ∼ q(x 0 ) 作为初始数据, 正向扩散过程经过 T 步迭代将较小的噪声逐渐地加入初始数据
中得到被噪声污染的数据 {x 1 , x 2 ,..., x T }. 每一步加噪过程表示如下:
√ √
x t = 1−β t x t−1 + β t ε t (8)
其中, t∈{1, 2,…, T}表示前向扩散过程中的步骤, ε t ∈ N(0, I) 表示 t 时刻随机采样的高斯噪声向量, 加入每一步的
T x t−1 有关, 所以
噪声的大小是由超参数 {β t ∈ (0, 1)} 控制的. 正向扩散过程中当前时刻的数据 x t 只与前一时刻数据
1
x T 是一个马尔可夫链过程, 满足公式 (9):
从 x 0 到
T ∏
√
q(x t |x t−1 ) = N(x t ; 1−β t x t−1 ,β t I),q(x 1:T |x 0 ) = q(x t |x t−1 ) (9)
t=1
在每一步的噪声添加过程中, 噪声是从一个已知的分布中独立采样的. 这意味着噪声项与模型的参数无关, 因
此在正向扩散过程中, 每一步都是可以根据公式 (8) 精确计算的. 利用重参数化技巧和两个独立高斯噪声的可加

