Page 356 - 《软件学报》2026年第6期
P. 356
陈真 等: 可信数据增强的 QoS 感知云 API 推荐系统投毒攻击持续防御 2675
基于深度学习的推荐方法以用户和云 API 静态属性和交互数据作为输入特征, 借助深度学习模型强大的特征
表示学习和交互关系挖掘能力, 能有效对用户与云 API 间复杂的非线性交互关系进行建模, 进而实现精准的云
API 推荐. 因子分解机 (factorization machine, FM) 模型 [24] 将云 API 服务质量预测问题转化为回归任务, 其核心原
理是将特征映射至向量空间, 并利用特征向量间的内积来表征特征间的相互影响. 随着深度学习技术的不断进步,
特征提取方式已经变得日益多样化. Zhang 等人 [25] 提出了一种基于深度学习的 QoS 预测模型, 该模型通过多阶段
多尺度特征融合和个体评估来提高预测准确性. 模型首先利用非负矩阵分解提取全局和个体特征, 即使是在冷启
动情况下, 也可以通过这些特征来进行一定程度的预测. 然后通过计算用户与服务间的距离相似性获得局部特征.
最终, 模型通过融合这些多尺度特征并结合个体评估, 实现更精准的 QoS 预测.
综上所述, 当前 QoS 感知的云 API 推荐算法研究主要集中于通过解决数据稀疏性、冷启动及特征表示和交
互学习等挑战提升推荐精度, 忽视了推荐算法自身的鲁棒性. OWASP 2023 年度报告揭示了云 API 面临的 10 大安
全问题, 这些问题可能导致账户控制权丢失、数据泄露等严重后果 [26] . 这也让针对云 API 推荐系统的投毒攻击引
起广泛关注. 一旦将存在安全隐患的云 API 推荐给开发者, 将会给其实际应用带来严重风险, 进而阻碍云 API 经
济的健康发展.
1.2 数据投毒攻击与检测
投毒攻击是指攻击者向推荐系统的训练集中注入恶意用户数据, 影响特定目标云 API 的 QoS 数据分布, 导致
推荐系统学习到的特征表示发生偏离, 进而产生有偏的云 API 推荐 [27] . 在推荐系统领域, 现有针对投毒攻击的防
御方法主要采用“检测防御”策略, 过滤恶意用户数据来降低数据投毒攻击对推荐系统的影响. 现有投毒攻击检测
防御方法通常可以分为有监督的检测算法、无监督的检测算法、半监督检测算法.
有监督检测算法的效果高度依赖于数据特征, 这促使研究者关注数据投毒攻击的特征与行为模式. Chirita 等
人 [28] 引入了平均评分偏离度 (RDMA) 特征量化用户向量的差异性. RDMA 通过计算用户属性值, 并与预设阈值比
较, 以识别恶意用户. Zhou 等人 [29] 提出 DL-DRA 算法, 采用双三次插值降低评级矩阵的稀疏性, 并应用结构化深
度学习网络进行检测. 充分依托无监督学习无需大量标签数据的优势, 研究者提出了多种无监督检测算法. 例如,
Mehta 等人 [30] 深入分析恶意用户, 并提出了基于 PLSA 软聚类和 PSA 变量选择的无监督算法. 尽管这些算法性能
良好, 但需预知部分攻击者信息, 限制了其实用性. 为此, Zhang 等人 [31] 提出了结合主成分分析 (principal components
analysis, PCA) 和数据复杂性的无监督检测方法, 首先利用 PCA 算法筛选可疑用户, 再通过数据复杂性进一步区
分真实用户与攻击用户. 该方法相较于单独使用 PCA 算法, 性能更优, 且无需事先确定攻击者数量. 此外, 半监督
检测算法因为能利用少量带标签数据提高检测准确度而受到关注. Wu 等人 [32] 提出了一种半监督检测算法, 该算
法融合了朴素贝叶斯分类器和基于选定度量的增强期望最大化方法. Chen 等人 [33] 利用对抗生成网络实现半监督
检测算法. 首先使用干净数据生成合成数据, 以扩充训练数据集; 然后使用带梯度惩罚的条件 Wasserstein 生成对
抗网络 (conditional Wasserstein generative adversarial network with gradient penalty, cWGAN-GP) 来训练模仿模型;
最后通过设置检测阈值来识别恶意数据. 目前, 针对服务质量感知云 API 推荐系统的投毒攻击防御研究处于初始
阶段, 但研究思路仍采用“检测防御”策略. 例如, 陈真等人 [34] 提出 NQI-Detector 算法, 从邻域特征、服务质量深度
特征及解释特征等多个维度提取用户行为特征, 并结合网格搜索优化恶意用户检测器, 以提升高维稀疏环境下恶
意用户的检测效果.
当前, 针对推荐系统的投毒攻击防御方法研究大多聚焦于优化用户数据特征提取, 以提升检测算法精度. 但由
于检测算法自身性能的限制, 恶意用户数据漏检是难以避免的, 从而使投毒攻击问题尚未有效解决. 本文从“以攻
学防”视角提出基于可信数据增强的持续防御方法, 在投毒攻击已成功的情况下, 通过注入可信数据来降低攻击的
影响和增强推荐系统的鲁棒性.
2 基于可信数据增强的持续防御框架
图 2 所示为基于可信数据增强的云 API 推荐系统数据投毒攻击持续防御框架, 包括以下 3 个阶段.

