Page 301 - 《软件学报》2026年第6期
P. 301

2620                                                       软件学报  2026  年第  37  卷第  6  期


                 成本的限制, 难以在所有发布场景中推广. 总体来说, 事前预防机制能限制数据访问, 防止非法访问, 但无法防止合
                 法用户复制或分发数据, 因此还需配合其他后续防护措施.
                    ● 事中防护聚焦于防止合法访问后的数据滥用. 例如, 数据防泄露                    (data leakage prevention, DLP) [83] 技术通过
                 分析数据内容及其上下文, 结合通知、审计、阻止、加密和隔离等手段保护数据的安全性. 优势在于能够覆盖数
                 据的多种状态, 但其部署和维护成本较高, 且难以防止物理泄露方式                     (拍屏、录像等). 一旦数据被非法扩散, 这些
                 机制难以阻止其继续传播, 因此还需要事后追责, 以便追查责任、震慑恶意行为.
                    ● 当泄露发生后, 事后追责成为最后一道防线, 主要包括可证明删除、数字水印和区块链取证这                               3  种技术路
                 径. 可证明删除旨在确保数据被有效销毁并提供可验证性. 例如, Hao                  等人  [84] 提出一种基于信任但验证       (trust-but-
                 verify) 机制的可证明删除方案, 利用受信平台模块           (trusted platform module, TPM), 在不完全可信环境中实现数据
                 删除. 该机制的优点是删除操作可被第三方验证, 并作为审计证据, 但它依赖硬件平台和大量加密运算, 可能导致
                 计算延迟, 影响用户体验. 数字水印通过在数据中嵌入可识别标识来溯源泄露者. 值得注意的是, 虽然数字水印在
                 第  3.6  节数据溯源中也扮演重要角色, 但在发布安全阶段, 其核心目标侧重于所有权锚定与泄露源定位, 即作为一
                 种防御性机制, 确保数据流出后的责任可追溯. 例如, Hu              等人  [85] 提出了一种基于保序加密的可逆水印方案, 通过在
                 密文中嵌入鲁棒性的水印实现了数据追踪与版权保护. 相比可证明删除, 水印技术更适用于防止数据扩散, 但其鲁
                 棒性有限, 易受篡改攻击, 且在频繁交互时嵌入会带来开销. 区块链则通过构建不可篡改的操作日志来实现审计与
                 取证, 例如, Li 等人  [86] 设计了一种隐私保护的车联网数组取证系统, 结合区块链和数字水印对泄密者追踪. 针对部
                 分泄露数据问题, Li 等人     [87] 提出了一种匿名且安全的去中心化取证方案             Themis, 兼具可追溯匿名性、隐私访问控
                 制以及高效搜索能力, 能够有效追踪泄密者. 区块链的优势在于其透明性与不可篡改性, 但引入的性能开销、链上
                 存储限制及共识机制复杂性也带来了推广的阻碍.
                    总体来看, 数据可控性维护技术分为事前预防、事中隔离和事后追责这                        3  层. 权限管理和  TEE  侧重事前防护;
                 DLP  关注事中操作; 可证明删除、数字水印和区块链则用于事后审计. 但这些技术各自独立, 缺乏协同, 且整体上
                 偏向被动补救, 难以主动防止数据泄露.
                  3.5.2    隐私保护
                    除了可控性维护, 数据发布还面临隐私保护挑战, 尤其在对外开放场景下, 发布方难以掌控数据流向, 因此必
                 须对数据内容实施隐私保护. 目前已有多种策略, 主要分为两类技术路线, 如表                      5  所示.

                                             表 5 数据发布阶段隐私保护技术对比

                 技术类型          核心思想              保护强度            优势             核心挑战           适用场景
                         基于规则的启发式处理, 对敏 较弱, 易受关联分 部署灵活、计算开销 依赖敏感信息明确定 结构化数据共享、
                 数据脱敏
                         感信息进行替换、屏蔽等          析与背景知识攻击 小、适合结构化数据 义, 难以防止推断攻击 常规数据发布
                         基于数学可证明的隐私保护, 强, 可量化, 具备严 保护强度高、可量化、噪声影响数据精度, 保 统计分析、机器
                 差分隐私
                         通过添加噪声控制泄露上界         格的数学保障        适合统计与机器学习 护强度与可用性需权衡 学习、分布式场景

                    (1) 基于规则的启发式脱敏
                    数据脱敏通过屏蔽、模糊化、伪造或合成等方式对数据进行处理, 其核心思想是根据预先定义的规则, 对数
                 据中的敏感标识符       (如姓名、身份证号) 进行修改或替换. 例如, Yoon           等人  [88] 提出一种基于生成对抗网络的数据
                 合成方法   ADS-GAN, 用于生成电子健康记录, 在提升数据可用性的同时减少泄露患者隐私的风险. Zhu                         等人  [89] 在
                 私人停车点共享场景下, 提出隐私保护智能停车方案                 ASAP, 通过脱敏技术将其真实位置转换为较大的区域范围,
                 从而实现位置隐私保护. 数据脱敏方法部署灵活、计算开销小, 适用于结构化数据和常规共享. 但其隐私保护依赖
                 于敏感信息的界定, 难以防止关联分析等推测攻击.
                    (2) 基于数学的可证明隐私
                    差分隐私通过在数据或查询结果中添加噪声, 在保护隐私的同时保留数据的统计特性和分析价值                                 [90] , 其核心
                 思想是通过在查询结果中添加经过精确计算的噪声, 使得攻击者无法判断特定个体是否在该数据集中. 其优点是
                 隐私保障严格, 但引入噪声可能降低数据准确性, 尤其在高敏感的分析任务中. 在分布式场景中, 本地差分隐私
   296   297   298   299   300   301   302   303   304   305   306