Page 301 - 《软件学报》2026年第6期
P. 301
2620 软件学报 2026 年第 37 卷第 6 期
成本的限制, 难以在所有发布场景中推广. 总体来说, 事前预防机制能限制数据访问, 防止非法访问, 但无法防止合
法用户复制或分发数据, 因此还需配合其他后续防护措施.
● 事中防护聚焦于防止合法访问后的数据滥用. 例如, 数据防泄露 (data leakage prevention, DLP) [83] 技术通过
分析数据内容及其上下文, 结合通知、审计、阻止、加密和隔离等手段保护数据的安全性. 优势在于能够覆盖数
据的多种状态, 但其部署和维护成本较高, 且难以防止物理泄露方式 (拍屏、录像等). 一旦数据被非法扩散, 这些
机制难以阻止其继续传播, 因此还需要事后追责, 以便追查责任、震慑恶意行为.
● 当泄露发生后, 事后追责成为最后一道防线, 主要包括可证明删除、数字水印和区块链取证这 3 种技术路
径. 可证明删除旨在确保数据被有效销毁并提供可验证性. 例如, Hao 等人 [84] 提出一种基于信任但验证 (trust-but-
verify) 机制的可证明删除方案, 利用受信平台模块 (trusted platform module, TPM), 在不完全可信环境中实现数据
删除. 该机制的优点是删除操作可被第三方验证, 并作为审计证据, 但它依赖硬件平台和大量加密运算, 可能导致
计算延迟, 影响用户体验. 数字水印通过在数据中嵌入可识别标识来溯源泄露者. 值得注意的是, 虽然数字水印在
第 3.6 节数据溯源中也扮演重要角色, 但在发布安全阶段, 其核心目标侧重于所有权锚定与泄露源定位, 即作为一
种防御性机制, 确保数据流出后的责任可追溯. 例如, Hu 等人 [85] 提出了一种基于保序加密的可逆水印方案, 通过在
密文中嵌入鲁棒性的水印实现了数据追踪与版权保护. 相比可证明删除, 水印技术更适用于防止数据扩散, 但其鲁
棒性有限, 易受篡改攻击, 且在频繁交互时嵌入会带来开销. 区块链则通过构建不可篡改的操作日志来实现审计与
取证, 例如, Li 等人 [86] 设计了一种隐私保护的车联网数组取证系统, 结合区块链和数字水印对泄密者追踪. 针对部
分泄露数据问题, Li 等人 [87] 提出了一种匿名且安全的去中心化取证方案 Themis, 兼具可追溯匿名性、隐私访问控
制以及高效搜索能力, 能够有效追踪泄密者. 区块链的优势在于其透明性与不可篡改性, 但引入的性能开销、链上
存储限制及共识机制复杂性也带来了推广的阻碍.
总体来看, 数据可控性维护技术分为事前预防、事中隔离和事后追责这 3 层. 权限管理和 TEE 侧重事前防护;
DLP 关注事中操作; 可证明删除、数字水印和区块链则用于事后审计. 但这些技术各自独立, 缺乏协同, 且整体上
偏向被动补救, 难以主动防止数据泄露.
3.5.2 隐私保护
除了可控性维护, 数据发布还面临隐私保护挑战, 尤其在对外开放场景下, 发布方难以掌控数据流向, 因此必
须对数据内容实施隐私保护. 目前已有多种策略, 主要分为两类技术路线, 如表 5 所示.
表 5 数据发布阶段隐私保护技术对比
技术类型 核心思想 保护强度 优势 核心挑战 适用场景
基于规则的启发式处理, 对敏 较弱, 易受关联分 部署灵活、计算开销 依赖敏感信息明确定 结构化数据共享、
数据脱敏
感信息进行替换、屏蔽等 析与背景知识攻击 小、适合结构化数据 义, 难以防止推断攻击 常规数据发布
基于数学可证明的隐私保护, 强, 可量化, 具备严 保护强度高、可量化、噪声影响数据精度, 保 统计分析、机器
差分隐私
通过添加噪声控制泄露上界 格的数学保障 适合统计与机器学习 护强度与可用性需权衡 学习、分布式场景
(1) 基于规则的启发式脱敏
数据脱敏通过屏蔽、模糊化、伪造或合成等方式对数据进行处理, 其核心思想是根据预先定义的规则, 对数
据中的敏感标识符 (如姓名、身份证号) 进行修改或替换. 例如, Yoon 等人 [88] 提出一种基于生成对抗网络的数据
合成方法 ADS-GAN, 用于生成电子健康记录, 在提升数据可用性的同时减少泄露患者隐私的风险. Zhu 等人 [89] 在
私人停车点共享场景下, 提出隐私保护智能停车方案 ASAP, 通过脱敏技术将其真实位置转换为较大的区域范围,
从而实现位置隐私保护. 数据脱敏方法部署灵活、计算开销小, 适用于结构化数据和常规共享. 但其隐私保护依赖
于敏感信息的界定, 难以防止关联分析等推测攻击.
(2) 基于数学的可证明隐私
差分隐私通过在数据或查询结果中添加噪声, 在保护隐私的同时保留数据的统计特性和分析价值 [90] , 其核心
思想是通过在查询结果中添加经过精确计算的噪声, 使得攻击者无法判断特定个体是否在该数据集中. 其优点是
隐私保障严格, 但引入噪声可能降低数据准确性, 尤其在高敏感的分析任务中. 在分布式场景中, 本地差分隐私

