Page 310 - 《软件学报》2026年第6期
P. 310

陈毅飞 等: 安全可信的数据要素流通综述                                                            2629


                  4.4   数据处理阶段
                    数据处理阶段的可信性问题包括算法可信性和参与方行为可信性. 前者关注算法在偏见、干扰或不透明情况
                 下的稳定性与可解释性, 后者关注多方协作中如何防止恶意方行为. 如果这些问题无法有效解决, 不仅会影响处理
                 结果的正确性, 还会削弱用户对系统的信任. 目前, 研究主要通过算法可解释性、零知识证明和区块链等方法应
                 对, 但在实际应用中仍面临性能开销大和实现复杂等难题.
                  4.4.1    算法可信性
                    数据处理算法, 尤其是复杂的机器学习模型, 其可信性主要面临两大挑战. 一是黑盒问题, 即模型决策过程不
                 透明, 难以获得信任; 二是脆弱性问题, 模型在特定输入下可能输出严重错误. 例如, Hendrycks 等人                     [125] 提出了一种
                 对抗性过滤技术, 通过筛选真实样本, 揭示了计算机视觉模型在自然场景中的脆弱性, 这种脆弱性导致模型在特定
                 输入下输出错误结果. 为此, 研究者从可解释性与鲁棒性两个角度出发, 提出多种可信性增强方案.
                    在提升可解释性方面, 相关技术致力于揭示算法的决策依据, 增强模型的透明度. 例如, Nohara 等人                          [126] 提出
                 了一种基于公平利益分配理论的            Shapley  加性解释方法, 解释了梯度提升决策树模型, 揭示了特征与结果之间的
                 潜在关系, 提高算法可信性. 针对模型脆弱性, 研究者聚焦于提升算法的鲁棒性, 即抵御对抗性攻击的能力. 例如,
                 Levi 等人  [127] 提出了一种通用方法, 能够在分类器自然精度几乎不受影响的情况下大幅提升鲁棒性.
                    虽然相关理论和工具不断进步, 但在实际应用中, 可解释性、鲁棒性和性能三者往往难以兼顾. 提升可解释性
                 通常需要更简单但性能较低的模型, 而增强鲁棒性的方法往往也会增加计算开销, 还可能会降低正常情况下的模
                 型性能, 未来, 如何根据不同场景需求按需平衡, 构建可信的数据处理框架, 将是算法可信性研究的重要方向.
                  4.4.2    参与方行为可信性
                    ● 在数据处理的协作场景中, 参与方之间可能存在恶意行为, 威胁数据处理的正确性和公平性. 例如, 恶意的
                 计算方可能通过篡改计算逻辑或伪造计算结果, 直接干扰协作结果的正确性, 从而损害其他参与方的利益. 为应对
                 这一挑战, 现有研究提出并应用了多种先进技术. 根据其核心验证目标的不同, 这些技术方案主要分为针对计算结
                 果正确性、计算环境可信性以及协作历史不可篡改性的不同方向, 其对比如表                         7  所示.

                                           表 7 多方协作中处理行为可信保障技术对比

                 技术类型 验证目标 信任根         隐私保护能力         性能与成本           优势          核心挑战         适用场景
                                       高, 可在不泄露 计算和通信开销高, 强隐私保护, 数 适用范围受限、性 复杂计算外包、
                  零知识 计算结果     数学难题 输入的前提下验 生成与验证耗时, 难 学可证明, 适用 能瓶颈、复杂电路 隐私计算、深度
                   证明    正确性
                                       证结果         以满足高频实时场景 多种计算验证            难表达           学习等
                                       中, 依赖硬件隔 需专用硬件, 硬件成 支 持 实 时 处 理 , 依赖硬件、受侧信 云计算、边缘计
                 可信执行 计算环境     硬件厂商 离, 明文计算, 外 本高, 计算性能较好 易于集成, 适用 道攻击威胁、部署 算、数据处理服
                   环境    完整性
                                       部不可见        但受内存等资源限制 多用户云环境            复杂            务
                                       低, 仅记录操作 共识延迟高, 链上存 全流程透明、不 性能瓶颈、隐私保
                        协作历史 分布式                                                             过程审计、多方
                  区块链                  流程, 需结合额 储成本大, 吞吐有限, 可篡改、支持审 护依赖外部机制、
                        不可篡改     共识                                                          协作等
                                       外隐私技术       难适应高频操作         计与追责        可扩展性受限

                    ● 针对计算结果的正确性验证, ZKP          和可验证计算     (verifiable computation, VC) 技术被广泛使用, 它们允许数
                 据持有方在不泄露隐私数据的情况下, 向其他方证明计算结果的正确性. 例如, Sun                       等人  [128] 利用  ZKP  验证深度学
                 习训练的正确性, 实现在保护数据和模型隐私的同时, 证明神经网络训练过程的合法性. 然而                            ZKP  的计算和通信
                 开销较大, 生成和验证证明耗时较长, 且通用性受限于电路表达能力, 难以满足高频或实时场景需求. VC                               进一步
                 扩展了   ZKP  的能力, 允许数据持有方验证计算方是否按照约定的逻辑正确执行了计算. 例如, Fiore 等人                       [129] 通过
                 引入支持非确定性计算的同态签名, 实现了在流式认证数据上的隐私保护可验证计算, 其性能在滑动窗口统计等
                 场景下显著优于现有方法. 相比          ZKP, 该方法在数据更新频繁的场景下表现更加高效. 但                VC  也存在局限, 如预处
                 理步骤带来额外开销, 同时在处理动态参与方和复杂协作逻辑时的灵活性有待提升.
                    ● 针对计算环境的可信性问题, TEE         技术为保障计算环境可信提供了根本手段. 例如, Chen               等人  [130] 提出了一
                 种机密计算即服务       (confidential computing as a service, CCaaS) 方案, 通过硬件隔离机制确保计算逻辑未被篡改, 并
   305   306   307   308   309   310   311   312   313   314   315