Page 61 - 《软件学报》2026年第6期
P. 61

2380                                                       软件学报  2026  年第  37  卷第  6  期


                 自动化、可验证的步骤, 不仅提升了每个单一任务的质量, 更通过流水线式的协同工作, 实现更为可靠的硬件安全
                 缺陷早期检测能力.

                  4   实验分析

                    本节旨在通过一系列量化实验, 对本文提出的               MARC  方法进行系统性的性能评估与分析.
                  4.1   研究问题
                    为了验证    MARC  相较于现有技术的优越性, 并具体衡量其在应对上述核心挑战方面的能力, 本文设计了以
                 下  3  个核心研究问题.
                    RQ1. MARC  在硬件安全缺陷早期检测方面的整体效果如何?
                    RQ2. 针对挑战   1, MARC  通过融入设计知识的机制在降低漏报率方面的效果如何?
                    RQ3. 针对挑战   2, MARC  通过深度代码语义分析在精准识别真实缺陷方面的效果如何?
                  4.2   实验准备
                    (1) 实验环境
                    本文所提出的      MARC  方法基于   Python  语言实现, 并选用   LangChain  作为其多智能体系统的核心构建与调度
                 框架. 在底层工具链方面, 我们采用          Google 开源的  Verible 工具对  RTL  源代码进行解析, 以构建精确的抽象语法
                 树. 同时, 框架内的检索增强生成功能亦基于             LangChain  实现. MARC  的整体工作流程被设计为高度自动化, 并且
                 其核心逻辑不依赖具体的大语言模型, 从而保证框架的灵活性与可扩展性, 便于未来集成更多先进模型. 在实验
                 中, 我们选用当前性能领先的         DeepSeek-Chat、Google Gemini-2.5-Pro  和  GPT-5  作为驱动各个智能体的基础模型.
                    本文所有实验均在同一台高性能工作站上执行, 其硬件配置为                     Intel Core i9-12900H  处理器, 核心数为  20  核,
                 主频  5.00 GHz, 配备  32 GB  系统内存. 软件环境为  Arch Linux  操作系统, 内核版本为    6.16.4-4.
                    (2) 数据集
                    为了系统性地评估        MARC  方法在真实工业级       RTL  设计中的有效性, 并验证其应对核心挑战            1  和  2  的能力,
                 本文选取   HACK@DATE 2025   竞赛作为基准测试数据集. HACK@DATE 2025          是一项顶级硬件安全竞赛, 其赛题
                 采用了   Google 开源的  RISC-V  架构  OpenTitan SoC  作为基础, 由  RISC-V  架构的  Ibex CPU  核心及相关  IP  模块共
                 同组成, 具备端到端数据完整性校验、安全启动以及侧信道掩码等安全特性. OpenTitan                       采用  Ibex RISC-V  处理器
                 作为主核心, 并集成了多种        IP  模块作为外设, 其中包括加密算法加速计算模块、系统管理模块和各类输入输出模
                 块等. 本文使用    MARC  进行分析的    IP  模块汇总于表    2, 表中统计了每个     IP  的设计文件数、代码行数、文档文件
                 数量以及文档字符数. 其中, 设计文件仅包含用于实现                IP  的  RTL  源码文件, 而设计代码行数则为这些源码文件中
                 剔除注释和空白行后的代码行总数.
                    本文选择该基准测试数据集的核心优势在于, 其各项特征能够全面且精准地回应本研究的                               3  个核心问题. 首
                 先, 比赛主办方委托硬件安全专家, 在测试数据集中手动植入了与真实产品漏洞相仿的代表性安全缺陷, 其真实性
                 与代表性为评估      MARC  的整体有效性     (RQ1) 提供了高标准的测试基准. 其次, OpenTitan       项目丰富的开源且非结
                 构化的设计文档, 能够有效检验          MARC  能否融入设计知识以降低漏报率            (RQ2). 最后, 该  SoC  的功能模块涵盖了
                 密码学、系统管理和通信协议等多个领域, 其包含复杂的功能逻辑所导致的上下文相关缺陷, 则为验证                                 MARC  能
                 否通过深度语义分析以精准识别缺陷             (RQ3) 提供了验证条件.
                    (3) 评价指标
                    为对  MARC  框架的检测性能进行客观且量化的评估, 本文采用了一系列缺陷检测领域的标准评价指标. 评估
                 的核心在于比较检测方法         f  所输出的缺陷集     D found  与数据集中预先定义的真实缺陷集       D true  之间的一致性. 根据本
                                                          l、类型   和描述   desc 构成. 在进行结果比对时, 我们采用严
                                                                t
                 文对安全缺陷的定义, 每一个缺陷           d  均由其代码位置
                                                                                              l
                 格的匹配标准: 当且仅当       D found  中某个被报告的缺陷   d found  与  D true  中的某个真实缺陷  d true  在代码位置   上存在重叠,
                 且缺陷类型    t 完全一致时, 本文才判定该缺陷被成功检出.
   56   57   58   59   60   61   62   63   64   65   66