Page 61 - 《软件学报》2026年第6期
P. 61
2380 软件学报 2026 年第 37 卷第 6 期
自动化、可验证的步骤, 不仅提升了每个单一任务的质量, 更通过流水线式的协同工作, 实现更为可靠的硬件安全
缺陷早期检测能力.
4 实验分析
本节旨在通过一系列量化实验, 对本文提出的 MARC 方法进行系统性的性能评估与分析.
4.1 研究问题
为了验证 MARC 相较于现有技术的优越性, 并具体衡量其在应对上述核心挑战方面的能力, 本文设计了以
下 3 个核心研究问题.
RQ1. MARC 在硬件安全缺陷早期检测方面的整体效果如何?
RQ2. 针对挑战 1, MARC 通过融入设计知识的机制在降低漏报率方面的效果如何?
RQ3. 针对挑战 2, MARC 通过深度代码语义分析在精准识别真实缺陷方面的效果如何?
4.2 实验准备
(1) 实验环境
本文所提出的 MARC 方法基于 Python 语言实现, 并选用 LangChain 作为其多智能体系统的核心构建与调度
框架. 在底层工具链方面, 我们采用 Google 开源的 Verible 工具对 RTL 源代码进行解析, 以构建精确的抽象语法
树. 同时, 框架内的检索增强生成功能亦基于 LangChain 实现. MARC 的整体工作流程被设计为高度自动化, 并且
其核心逻辑不依赖具体的大语言模型, 从而保证框架的灵活性与可扩展性, 便于未来集成更多先进模型. 在实验
中, 我们选用当前性能领先的 DeepSeek-Chat、Google Gemini-2.5-Pro 和 GPT-5 作为驱动各个智能体的基础模型.
本文所有实验均在同一台高性能工作站上执行, 其硬件配置为 Intel Core i9-12900H 处理器, 核心数为 20 核,
主频 5.00 GHz, 配备 32 GB 系统内存. 软件环境为 Arch Linux 操作系统, 内核版本为 6.16.4-4.
(2) 数据集
为了系统性地评估 MARC 方法在真实工业级 RTL 设计中的有效性, 并验证其应对核心挑战 1 和 2 的能力,
本文选取 HACK@DATE 2025 竞赛作为基准测试数据集. HACK@DATE 2025 是一项顶级硬件安全竞赛, 其赛题
采用了 Google 开源的 RISC-V 架构 OpenTitan SoC 作为基础, 由 RISC-V 架构的 Ibex CPU 核心及相关 IP 模块共
同组成, 具备端到端数据完整性校验、安全启动以及侧信道掩码等安全特性. OpenTitan 采用 Ibex RISC-V 处理器
作为主核心, 并集成了多种 IP 模块作为外设, 其中包括加密算法加速计算模块、系统管理模块和各类输入输出模
块等. 本文使用 MARC 进行分析的 IP 模块汇总于表 2, 表中统计了每个 IP 的设计文件数、代码行数、文档文件
数量以及文档字符数. 其中, 设计文件仅包含用于实现 IP 的 RTL 源码文件, 而设计代码行数则为这些源码文件中
剔除注释和空白行后的代码行总数.
本文选择该基准测试数据集的核心优势在于, 其各项特征能够全面且精准地回应本研究的 3 个核心问题. 首
先, 比赛主办方委托硬件安全专家, 在测试数据集中手动植入了与真实产品漏洞相仿的代表性安全缺陷, 其真实性
与代表性为评估 MARC 的整体有效性 (RQ1) 提供了高标准的测试基准. 其次, OpenTitan 项目丰富的开源且非结
构化的设计文档, 能够有效检验 MARC 能否融入设计知识以降低漏报率 (RQ2). 最后, 该 SoC 的功能模块涵盖了
密码学、系统管理和通信协议等多个领域, 其包含复杂的功能逻辑所导致的上下文相关缺陷, 则为验证 MARC 能
否通过深度语义分析以精准识别缺陷 (RQ3) 提供了验证条件.
(3) 评价指标
为对 MARC 框架的检测性能进行客观且量化的评估, 本文采用了一系列缺陷检测领域的标准评价指标. 评估
的核心在于比较检测方法 f 所输出的缺陷集 D found 与数据集中预先定义的真实缺陷集 D true 之间的一致性. 根据本
l、类型 和描述 desc 构成. 在进行结果比对时, 我们采用严
t
文对安全缺陷的定义, 每一个缺陷 d 均由其代码位置
l
格的匹配标准: 当且仅当 D found 中某个被报告的缺陷 d found 与 D true 中的某个真实缺陷 d true 在代码位置 上存在重叠,
且缺陷类型 t 完全一致时, 本文才判定该缺陷被成功检出.

