Page 307 - 《软件学报》2026年第6期
P. 307
2626 软件学报 2026 年第 37 卷第 6 期
提出了一种适用于医疗场景的数据自动化清洗方法, 能够以高度自动化的方式处理大规模数据. 该方法具备较高
自动化程度, 但其依赖专家经验和领域规则, 难以适应跨领域场景, 且对恶意伪造数据缺乏鲁棒性.
外部治理侧重于记录和追踪数据录入行为, 如“谁在何时何地提交了数据”, 而不仅关注数据内容本身. 例如,
Li 等人 [86] 针对车联网场景, 通过区块链记录数据提供者的元数据以确保数据变动可追溯, 防止虚假数据上传和篡
改. 但这种方法在写入性能和隐私保护方面存在挑战, 一是在高频交互场景下易出现性能瓶颈, 二是在涉及敏感身
份信息时, 链上记录可能导致隐私泄露.
综上, 自动清洗与行为追踪构成了保障数据可信的双重体系, 前者提升数据质量, 后者明确责任归属. 针对自
动清洗依赖领域知识、泛化能力不足的问题, 未来可引入跨领域迁移学习等方法提升适应性. 针对区块链方案, 可
采用链下索引、ZKP 等机制, 在保障可审计性的同时降低链上负载与隐私风险.
4.1.3 第三方接口调用与网络爬虫
当数据来自不可控的第三方时, 可信性风险显著增加. 若未充分验证数据源, 容易引入不可靠数据, 甚至遭遇
投毒攻击, 进一步降低数据可信性 [110,111] . 相关研究主要有面向采集过程和面向数据内容两种思路.
● 面向采集过程的方法通过提升采集流程的安全性来增强数据可信性. 例如, Zhang 等人 [112] 提出的 Town
Crier 系统, 通过多数据源比对和 SGX 硬件隔离, 确保数据在采集和验证过程中的完整性, 并为智能合约提供可验
证的数据来源. 该方法保障了采集过程的可信, 但无法验证数据内容的真实性. 如果所有数据源被同一攻击者控
制, TEE 也无法防御. 此外, 对硬件的依赖限制了其应用范围.
● 面向数据内容的方法侧重识别外来数据中的异常或恶意部分. 例如, Tran 等人 [113] 发现中毒样本在特征空间
中具有谱特征的规律, 并据此利用统计工具识别并剔除异常数据, 以减轻数据投毒攻击的影响. 但相关研究 [114] 指
出, 对于经过对抗性构造的数据, 该类方法易出现误判与漏检, 难以提供稳定的防御保障.
总体来看, TEE 方案和异常检测分别针对采集过程和数据内容提供防御. TEE 适合对数据链路完整性要求高
的场景, 可信性强; 异常检测适合作为动态防御机制嵌入采集流程. 现有研究缺乏对外部数据源质量的系统建模,
未来可引入数据源声誉管理和历史行为建模等方法, 以提升外部数据可信性评估的可解释性和动态适应性.
4.1.4 小 结
本节围绕 3 类典型数据采集场景, 分析了其可信性挑战与应对策略. 总体来看, 不同场景下的数据采集可信保
障有不同的技术路径和治理重点. 自动化设备采集主要依赖两类信任根: 一是以 PUF 为代表的硬件可信根, 实现
静态身份认证; 二是基于区块链的分布式共识机制, 实现对设备动态行为的持续评估. 从可信演进的视角来看, 这
代表了数据采集阶段正从单一的身份可验证向初步的行为可验证层级跨越.
在人工录入和第三方数据源场景, 治理逻辑从内容质量延展至行为责任和过程可验证性. 人工录入数据既要
依靠自动化清洗等内容保障, 也需结合行为记录完善责任追溯. 第三方数据源则通过异常检测提升内容可信度, 同
时加强过程完整性保护, 实现内容与过程的双重防护. 这种从源头建立的信任机制, 不仅是组织内部流通进行数据
质量治理的基础, 也常被用于在数据交易场景以生成可验证的数据资产凭证.
综上, 数据采集阶段的可信保障, 本质是在数据流通起点建立可靠门槛. 未来应整合各类静态与动态技术, 构
建覆盖设备、行为、内容等多维度的协同可信评估体系, 为数据流通和共享提供坚实基础.
4.2 数据传输阶段
在数据传输阶段, 核心问题包括传输路径的可追踪性和中转节点行为的可审计性. 前者要求能够还原数据流
向, 后者需验证各节点操作, 防止篡改、丢弃或恶意转发. 现有方案多采用区块链、TEE 和 ZKP 等技术, 但在性能、
开销及复杂环境适应性等方面仍有挑战. 同时, 提升传输透明性和可验证性虽然增加了信息记录, 但会带来用户隐
私风险. 因此, 如何在保障系统可信性的同时保护用户隐私, 成为当前研究的关键, 本节围绕这些问题进行讨论.
4.2.1 传输路径追踪与行为审计
数据在传输时会经过多个中转节点, 其可信性不仅依赖于传输路径记录, 还取决于中转节点是否按协议正确
操作. 这对于金融交易、医疗等高敏感场景尤为重要, 有助于审计、溯源和责任追溯. 然而传统网络协议缺乏对路

