Page 366 - 《软件学报》2026年第6期
P. 366
陈真 等: 可信数据增强的 QoS 感知云 API 推荐系统投毒攻击持续防御 2685
4.3 可信用户数据产生防御效果的解释
第 4.2 节的实验结果显示, 基于可信数据增强的持续防御方法可以有效抵御投毒攻击. 为了进一步探究原因,
本文采用可视化方法来分析不同方法生成的可信用户数据. 本节实验使用 T-SNE (T-distributed stochastic neighbor
embedding) 对可信用户进行可视化分析, 结果如图 5 所示.
3 真实用户 3 真实用户 3 真实用户
可信用户 (Avg_D) 可信用户 可信用户 (Rnd_D)
2 2 (Bdg_D) 2
1 1 1
0 0 0
−1 −1 −1
−2 −2 −2
−3 −3 −3
−3 −2 −1 0 1 2 3 −3 −2 −1 0 1 2 3 −3 −2 −1 0 1 2 3
3 真实用户 3 真实用户 可信用户 (Gan_D) 3 真实用户
可信用户 (Vae_D) 可信用户 (Diff_D)
2 2 2
1 1 1
0 0 0
−1 −1 −1
−2 −2 −2
−3 −3 −3
−3 −2 −1 0 1 2 3 −3 −2 −1 0 1 2 3 −3 −2 −1 0 1 2 3
图 5 不同方法生成的可信用户可视分析
根据图 5 可以得出以下结论.
(1) 利用启发式防御、深度防御、扩散防御生成的可信用户数据, 其分布与真实用户数据分布整体十分相似,
证明生成的可信用户质量能够满足防御要求. 将可信用户数据注入推荐系统中可以带来更多的交互数据, 有助于
推荐系统学习到更加准确的特征表示, 从而显著提升系统的鲁棒性. 这一结果从数据分布角度验证了可信用户数
据的质量并从实际应用效果方面解释可信用户的防御有效性.
(2) 扩散模型可以生成更高质量的可信用户. 因为扩散模型更好地捕捉到真实用户的数据分布, 使得生成的可
信用户与真实用户的数据分布紧密相连, 而且两者之间的界限变得更为模糊, 难以区分. 相比之下, 启发式算法和
变分自编码器在数据稀疏区域时, 会有部分生成数据出现偏离真实数据分布的情况; 而生成对抗网络会出现模式
崩溃问题, 即部分可信用户特征高度相似. 因此, 扩散模型在可信用户生成领域更具应用潜力.
4.4 混合投毒攻击对防御效果的影响
传统检测算法通常被设计用于有效地识别特定类型的恶意用户, 或是基于一种假设, 即投毒攻击的形式是单
一的. 为了验证基于可信数据增强的持续防御方法是普遍有效的, 设计了混合投毒攻击实验. 利用 3 种数据投毒攻
击方式各自生成占用户总数 5% 的恶意用户, 并将这些恶意用户两两混合后注入数据集, 以模拟混合攻击情况. 在
混合攻击中, 恶意用户数量仍占用户总数的 10%, 确保与单一攻击的参数保持一致. 在 APCC、FunkSVD、MLP
这 3 种推荐算法上分别进行实验, 表 6 展示了面对混合攻击时推荐系统 MAE 和 RMSE 的变化.
观察表 6 可知, 在应对混合投毒攻击时, 防御方法的表现与面对单一攻击类型时的实验结果 (如第 4.2 节所
述) 相似. 在不同的混合攻击下, 3 种推荐算法利用有防御的数据集进行训练后性能都有所提高. 本文提出的基于
可信数据增强的持续防御方法通过向数据集中注入可信用户数据来帮助推荐系统学习到更准确的特征表示, 减弱
恶意用户数据对推荐系统性能的影响. 因此, 持续防御方法不再局限于保护特定推荐算法或抵御单一投毒攻击方
式, 而是能够有效应对复杂多变的混合数据投毒攻击.

