Page 354 - 《软件学报》2026年第6期
P. 354

陈真 等: 可信数据增强的      QoS  感知云  API 推荐系统投毒攻击持续防御                                   2673


                 交互矩阵中可用的交互数据来学习用户与云                API 的潜在特征表示, 然后利用简单的点积运算进行预测                [10] . 基于深
                 度学习的预测方法利用训练数据学习用户与云                 API 的潜在特征, 并对用户和云        API 之间的非线性关系进行建模
                 来学习用户的个性化偏好         [11] . 尽管现有云  API 服务质量预测方法利用情境信息增强、正则化技术和嵌入特征的
                 交互学习缓解了困扰研究人员已久的数据稀疏性和冷启动问题, 有效提升了推荐结果的准确性和多样性, 但尚未
                 注意到来自恶意用户的数据投毒攻击对服务质量感知云                   API 推荐系统的影响.
                    目前, 服务质量感知云        API 推荐系统面临严峻的数据投毒攻击威胁. 这主要基于以下                   3  个基本事实. (1) 云
                 API 的货币属性. 随着云     API 货币化技术的日趋成熟, 云        API 逐渐被赋予货币属性. 更多的云          API 调用意味着可
                 以给服务提供商带来更高的经济效益, 因此云               API 的货币属性使得广泛使用的服务质量感知云                API 推荐系统成
                 为攻击者重点关注的目标. (2) 网络环境的开放性. 在开放的网络环境中, 攻击者很容易雇佣一些用户作为攻击者,
                 提供虚假的云     API QoS  反馈数据注入推荐系统的训练集中           (见图  1(b)), 使推荐结果遵循攻击者的意愿, 生成有偏
                 差的云   API 推荐结果. (3) 推荐系统的脆弱性. 已有实验数据表明, 在推荐系统训练数据中注入小规模的恶意用户
                 数据就能使推荐结果产生偏差, 提高目标云              API 的可见性和利用率       [12] . 例如, 研究人员在实验环境中发现, 诸如
                 YouTube、Amazon  和  LinkedIn  等平台推荐系统的性能易受投毒攻击的影响            [13] . 因此, 针对服务质量感知云    API
                 推荐系统设计有效的数据投毒攻击防御方法, 构建可信的云                    API 推荐系统成为     API 经济健康发展中亟需解决的
                 现实问题.

                               (a) 云API生态      (b) 数据投毒攻击     (c) 恶意用户检测防御     (d) 数据增强持续防御
                              QoS数据预处理          恶意用户生成           投毒攻击检测           可信用户生成





                                投毒攻击前           投毒攻击后             检测防御后           持续防御后
                                         正常用户             恶意用户             可信用户
                                                   服务质量感知云API推荐系统
                                     图 1 服务质量感知云       API 推荐系统投毒攻击与防御示意图

                    现有针对推荐系统的投毒攻击防御方法主要采用“检测防御”策略, 即在模型训练之前利用检测算法检测并滤
                 除恶意用户    (见图  1(c)). 其基本假设是: 恶意用户通常带有特定目的, 恶意用户行为与正常用户行为存在显著差异.
                 据此, 研究人员提出了基于监督学习的恶意用户检测算法, 例如利用                     DegSim  和  RDMA  等人工设计的特征, 在大
                 量有标记的数据集上训练分类器, 以区分正常用户和恶意用户                     [14] . 然而, 鉴于实际应用中仅有少量有标记数据可
                 用, 而大部分数据未标记, 基于无监督学习的检测算法逐渐成为研究焦点. 这类算法通过聚类、关联规则等方法自
                 主分析数据特征, 以检测恶意用户          [15] . 随后, 研究者提出基于半监督学习的检测算法, 旨在利用有限的有标记数据
                 提升检测准确性      [16] .
                    尽管基于检测防御策略的方法可以过滤掉部分恶意用户, 降低投毒攻击对推荐系统的影响, 但仍然存在以下
                 不足. (1) 天然的数据稀疏性限制了恶意用户检测的准确率. 现有投毒攻击检测算法都是基于用户与云                              API 交互数
                 据来提取用户特征, 并将其视为一个二分类问题来处理. 但目前的攻击方法在保证攻击有效性的同时也会学习真
                 实用户的数据分布来隐藏恶意用户的身份               [17] . 因此, 在用户-云  API 交互数据天然高度稀疏的情况下, 传统检测算
                 法很难通过少量的交互数据来准确提取用户特征, 进而导致恶意用户检测的准确率下降. (2) 难以回避的漏检恶意
                 用户使得投毒攻击仍未消除. 相关研究表明, 即使仅注入占用户总量                     1%  的恶意用户, 也能对推荐系统的性能产生
                 显著影响   [12] . 因此, 即便是小比例的漏检恶意用户, 也依旧能对推荐系统产生攻击效果. 此外, 现有检测算法不仅
                 可能漏检部分恶意用户, 还可能误将正常用户误判为恶意用户, 进一步加剧数据稀疏性问题. 因此, 针对现有检测
                 防御方法难以完全滤除恶意用户这一挑战, 有必要探究不同于传统基于“检测防御”思想的“持续防御”方法, 进一
                 步解决恶意用户投毒攻击的影响           (见图  1(d)).
   349   350   351   352   353   354   355   356   357   358   359