Page 359 - 《软件学报》2026年第6期
P. 359
2678 软件学报 2026 年第 37 卷第 6 期
r random ∼ N(µ,σ) 为随机填充云 API 生成 QoS σ 分别是数据集中
(1) 随机防御根据正态分布 反馈值, 其中 µ 和
所有 QoS 反馈值的均值和方差.
r average ∼ N(µ m ,σ m ) 为随机填充云 API m 生成 QoS σ m 是云 API
(2) 均值防御根据正态分布 反馈值, 其中 µ m 和
m QoS 反馈值的均值和方差.
(3) 潮流防御选择流行云 API 作为选择填充云 API, 以此来增强推荐的多样性. r max/min 表示数据集中的最高或
者最低的 QoS 反馈值.
(4) 变分自编码防御采用变分自编码器为填充云 API 生成 QoS 反馈值.
(5) 生成对抗防御采用生成对抗网络为填充云 API 生成 QoS 反馈值.
(6) 扩散防御利用扩散模型为填充云 API 生成 QoS 反馈值.
2.2.3 持续防御
已有研究表明, 投毒攻击效果与恶意用户的数量呈正相关关系, 即数据集中恶意用户越多, 推荐系统学习到的
特征表示越偏离正常表示 [12] . 类似地, 本文通过注入可信用户, 为推荐系统提供更多可靠的用户与云 API 交互数
据, 帮助推荐系统学习到更准确的真实用户和云 API 的特征表示, 从而提升推荐的性能. 在形式上, 基于可信数据
增强的持续防御可以表示为:
R(U,V)⊕R( ˜ A) ⇒ R(U,V, ˜ A) (4)
其中, ˜ A 表示可信用户集合, R( ˜ A) 表示可信用户与云 API 交互数据集. R(U,V, ˜ A) 表示注入可信用户后的数据集.
推荐系统 M 利用不同数据集 R(·) 训练后, 对目标用户 u 和目标云 API a 的服务质量预测表示如下:
(5)
M(u,a|R(·)) = ˆy u,a
根据预测值与实际值的偏差即可评估针对投毒攻击与防御方法的有效性. 此外, 还可以利用不同推荐模型、
单一与混合攻击以及不同防御方法等多个维度评估攻击与防御的效果.
为了灵活应对不同方式的数据投毒攻击, 以及全面评估基于可信用户增强的持续防御方法, 引入防御强度和
防御规模两种防御策略进一步提升防御效果.
定义 2. 防御强度. 防御强度 γ 是可信用户调用过的云 API 数量与云 API 总数的比率. 利用防御强度 γ 生成可
信用户的过程如下:
f(R(U),γ) = R γ ( ˜ A) (6)
防御强度越大, 意味着可信用户与更多的云 API 发生交互, 丰富的交互数据能够提供更全面的用户偏好和行
为模式, 有利于推荐系统学到更好的特征表示, 进而提升推荐的准确性.
定义 3. 防御规模. 防御规模 η 是注入的可信用户的数量与用户总数的比率. 利用生成不同防御规模 η 可信用
户过程如下:
ξ( f(R(U),γ),η) ⇒ R γ,η ( ˜ A) (7)
其中, ξ(·) 控制注入的可信用户的数量. 防御规模越大意味着更多的可信用户被注入训练集中, 对 QoS 感知云 API
推荐系统产生更大的影响. 由于大多数云 API 调用都是付费的, 调用更多的云 API 意味着更多的成本. 因此, 在构
建基于不同防御规模的可信用户数据集时, 需要平衡防御效果与防御成本之间的关系.
3 基于扩散模型的可信用户生成算法
基于可信数据增强的投毒攻击持续防御的核心是高质量的可信用户. 尽管基于启发式防御的方法利用数据统
计特征生成可信用户数据易于理解, 但其生成的可信用户可能过于模式化, 无法充分反映真实用户的个性化偏好.
相比之下, 深度生成式方法在数据生成质量和自动化效率等方面展现出显著优势. 其中, 扩散模型凭借其卓越的生
成能力、坚实的理论基础以及广泛的应用前景, 已成为该领域的重要研究方向 [35,36] . 与变分自编码器和对抗生成
网络等相比, 扩散模型在生成数据的真实性和多样性以及训练稳定性等方面表现更优 [37] . 因此本文提出了基于扩

