Page 313 - 《软件学报》2026年第6期
P. 313

2632                                                       软件学报  2026  年第  37  卷第  6  期


                 追责, 又要保护敏感信息. 本节围绕这          3  方面综述研究进展, 并探讨未来方向.
                  4.6.1    元数据真实性保障
                    作为描述数据属性和操作历史的关键载体, 元数据的真实性是数据溯源可信性的基础. 在数据流通中, 攻击者
                 可通过伪造操作者身份、篡改时间戳或解耦元数据与数据实体的关联, 导致溯源记录失效. 因此, 如何确保元数据
                 与实体操作行为的强关联性成为关键挑战. 现有研究主要采用两种技术路线来实现元数据真实性保障.
                    一种技术路线是基于密码学协议构建逻辑可信路径, 通过数学可验证方式保障元数据的生成和关联安全. 例
                 如, Yang  等人  [139] 提出  Dasein  验证框架, 利用改进的默克尔树进行内容验证、可信时间戳保证时间、多层签名实
                 现主体认证, 支持全流程可信溯源. 但该方法依赖多层签名和时间戳协调, 计算与管理开销大, 跨平台扩展性较差.
                 在数据交易场景中, Liu     等人  [140] 基于  ZKP  构建数据可用性验证体系, 允许买方在交易前验证数据真实性. 但                ZKP
                 的生成和验证成本较高, 尤其在数据结构复杂或频繁更新时, 系统响应能力成为瓶颈. 此外, 这类密码学方案还面
                 临高计算开销、量子威胁和跨系统互操作性差等局限.
                    另一种技术路线是基于可信硬件的环境可信路径, 侧重于通过物理隔离和硬件安全特性, 保证元数据生成环
                 境的可信性. 例如     Weng  等人  [141] 针对机器学习中的被遗忘权问题, 在       SGX  可信执行环境中用认证数据结构追踪
                 数据并生成可验证证明, 但部署成本高且存在侧信道攻击风险. Aman                    等人  [142] 采用  PUF  作为可信根构建认证协
                 议, 实现可信溯源, 该方法硬件开销低、唯一性强, 但长期稳定性易受噪声干扰, 存在工程化难题.
                    综上, 基于密码学的逻辑可信和基于            TEE  的环境可信从不同层面提供支持. 前者灵活但计算开销大, 后者高
                 效但依赖硬件, 未来可进一步协同设计密码学与硬件机制, 提升真实性验证的安全性、性能与适应性.
                  4.6.2    数据血缘完整性验证
                    数据血缘记录了数据全生命周期的变换轨迹, 是追溯数据问题的重要依据. 但在数据流通过程中, 聚合、脱敏、
                 特征提取等非线性操作会导致传统哈希或水印技术难以追踪变换后的血缘关系. 例如, 在                            AI 训练中, 若无法验证
                 训练数据与模型的关联, 就难以溯源模型偏见. 因此, 如何验证复杂流通场景下的血缘完整性, 成为数据溯源可信
                 性的关键难题. 目前主流数据血缘技术分为两类: 侵入式追溯技术和非侵入式分析技术, 对比如表                             8  所示.


                                                 表 8 数据血缘追踪技术对比

                 技术类型       核心原理        对原始数据影响       应用部署依赖           优势         核心挑战         适用场景
                                        有损, 对原始数据                                            数据外包、社交
                  侵入式   直接修改数据本身,       进行微小修改, 可    部署灵活, 无需依 鲁棒性强, 支持 数据效用损失与              网络、AI训练数
                   追溯   植入难以察觉的标识                    赖特定平台或代码 可验证追溯            溯源强度需权衡
                                        能影响效用                                                据溯源
                        观测系统行为、静态                    依赖中心化平台或                  依赖中心化平台、
                 非侵入式   分析或运行时监控推       无损, 并不改变原    完整代码访问, 需     无损、部署成本     难适应跨域分布       分布式计算、云
                   分析                   始数据                        低、适应性强                    数据平台等
                        断数据关系                        要系统支持                     式环境

                    ● 侵入式追溯技术: 对数据本身进行微小且难以察觉的修改, 实现可追溯性. 与发布阶段利用水印追踪泄露不
                 同, 此处的水印具有更复杂的语义, 旨在携带数据变换历史或逻辑证明, 以验证数据在多跳流转后的血缘完整性.
                 例如, Backes 等人  [143] 提出的  LIME  框架, 利用鲁棒水印来保证数据即使经过非线性变换仍可提取标识, 并结合不
                 经意传输和签名协议, 实现在恶意环境下接收方的不可抵赖性, 适用于数据外包和社交网络等场景. Sablayrolles
                 等人  [144] 提出的放射性数据技术, 通过对训练样本进行不可感知的修改, 使模型在训练后携带可识别特征, 即使只
                 标记少量训练数据, 也能高置信度检测模型是否使用过目标数据, 对数据增强和模型变化具有鲁棒性. 这类方法的
                 共同挑战是对数据修改可能影响数据效用, 因此, 如何平衡溯源鲁棒性与数据价值是其核心难题.
                    ● 非侵入式分析技术: 不修改数据本身, 通过观测和分析系统行为间接推断数据血缘. 例如, Chen                          等人  [130] 在
                 机密计算服务框架中, 利用        Rust 静态分析工具    MIRAI 分析数据标签, 追踪机密数据在系统内的流通, 无需修改数
                 据, 但依赖控制流分析, 可能遗漏部分路径. Tang           等人  [145] 通过监听分布式平台的运行时事件, 粗粒度捕获数据与
                 处理过程的关联, 基于系统行为构建血缘图谱, 追踪数据流通路径, 具有部署成本低、适应性强的优点. 这类方法
                 的主要局限在于对中心化平台或特定环境的依赖. 静态分析需要完整源代码, 运行时监听通常要求中心化、可观
   308   309   310   311   312   313   314   315   316   317   318