Page 64 - 《软件学报》2026年第6期
P. 64
芮志清 等: MARC: 基于多智能体协同的硬件安全缺陷早期检测方法 2383
存在显著差异, MARC 框架的性能在不同模块间表现出明显的差异性, 这反映了不同硬件设计的内在复杂性和缺
陷的隐蔽程度. 在如 gpio、aes、keymgr 等模块上, 先进模型能够取得非常高的 F1 分数, 表明这些模块的缺陷模
式或设计意图相对更容易被模型所捕获. 而在 csrng 模块上, 所有模型均未能成功检出任何缺陷, 这是由于 LLM
缺乏对 RTL 代码物理综合语义的因果推理能力, 使得在面对特定类型漏洞时分析效果不佳, 具体将在第 4.4.2 节
进行详细分析. 综上, 该细分结果表明, MARC 方法的有效性虽已得到证实, 但其在具体模块上的表现并非完全均
衡, 而是同时受到底层模型能力和目标模块自身复杂性的双重影响.
1.0
adc_ctrl 0 0.50 0.67
aes 0.17 0.70 0.71
csrng 0 0 0 0.8
entropy_src 0.67 1.00 0.67
gpio 0 0.33 1.00 0.6
hmac
模块 keymgr 0.27 0.40 0.75
0.17
0.80
0.40
lc_ctrl 0.29 0.75 0.75 0.4
lowrisc_ibex 0.17 0.71 0.62
otbn 0.21 0.57 0.60
otp_ctrl 0.09 0.22 0.33 0.2
prim 0.46 0.25 0.57
spi_device 0.29 0 0.67 0
hat -5
C GPT
eek- Gemini-2.5-Pro
S
Deep
模型
图 2 MARC 基于不同模型在不同 IP 模块下检测效果的 F1 分数热力图
为了验证 MARC 方法中各个核心组件的实际贡献, 并针对性地回答研究问题 RQ2 与 RQ3, 我们设计了消融
实验. 该实验通过在完整的 MARC 方法基础上, 系统性地移除特定功能模块, 以评估其对最终检测性能的影响. 我
们构建了两个 MARC 的降级版本, 分别对应: 1) 去除文档分析智能体, 移除完整的安全设计规范图谱和 CWE 安
全规范, 旨在评估将非结构化设计知识融入检测流程对降低漏报率 (RQ2) 的整体效果; 2) 去除缺陷确认智能体,
旨在评估基于断言的精准验证对深度代码语义理解 (RQ3) 的贡献. 本文将这些降级版本的性能与完整版 MARC
进行对比, 实验结果如表 4 所示.
表 4 MARC 消融实验结果
Analyzer Model Precision Recall F1 FNR FDR
DeepSeek-Chat 0.404 8 0.361 7 0.382 0 0.638 3 0.595 2
MARC Gemini-2.5-Pro 0.590 9 0.553 2 0.571 4 0.446 8 0.409 1
GPT-5 0.611 1 0.702 1 0.653 5 0.297 9 0.388 9
DeepSeek-Chat 0.365 9 0.319 2 0.340 9 0.680 9 0.634 2
MARC
Gemini-2.5-Pro 0.547 6 0.489 4 0.516 9 0.510 6 0.452 4
(去除文档分析智能体)
GPT-5 0.634 6 0.702 1 0.666 7 0.297 9 0.365 4
DeepSeek-Chat 0.466 7 0.446 8 0.456 5 0.553 2 0.533 3
MARC
Gemini-2.5-Pro 0.547 6 0.489 4 0.516 9 0.510 6 0.452 4
(去除缺陷确认智能体)
GPT-5 0.588 2 0.638 3 0.612 2 0.361 7 0.411 8
研究问题 RQ2 的核心是验证融入安全设计知识的有效性. 在 MARC 中, CWE 安全规范和最终生成的安全设
计规范图谱是安全设计知识的主要载体. 从实验结果来看, 对于 DeepSeek-Chat 和 Gemini-2.5-Pro 等模型, 去除文
档分析智能体导致了 F1 分数的明显下降, 例如 Gemini-2.5-Pro 从 0.571 4 降至 0.516 9, 这表明对于这些模型, 外部
注入的结构化设计知识是其准确理解设计意图、降低漏报的关键. 值得注意的是, 当使用最先进的 GPT-5 模型时,
去除文档分析智能体后, F1 分数并未下降, 反而从 0.653 5 微弱提升至 0.666 7. 我们分析认为, 这是因为 GPT-5 这
样的顶级模型已在其海量预训练数据中内化了极其丰富的通用安全知识. 因此, 由文档分析智能体从外部再次注
入这部分通用知识时, 其边际效益递减, 甚至可能产生信息冗余或注意力噪声, 对模型的推理产生轻微干扰, 并导

