Page 63 - 《软件学报》2026年第6期
P. 63
2382 软件学报 2026 年第 37 卷第 6 期
统方法的基准.
整体实验结果如表 3 所示. 可以看出, 本文提出的 MARC 在所有测试模型上的综合性能显著优于 LLMOnly
基准方法, 并且全面超越了传统的 Verilator 工具. 其中, 当使用 GPT-5 模型时, MARC 取得了最佳的检测效果, F1
分数达到了 0.623 6, 相较于同等模型下的 LLMOnly (0.537 6) 提升了约 16%. 同时, MARC 也实现了最低的漏报率
(FNR=0.3829) 与最低的误报率 (FDR=0.3695), 这表明其在缺陷检出率与结果精确率之间取得了最优的平衡.
表 3 MARC 整体实验结果
Analyzer Model TP FP FN TP+FP F1 FNR FDR Token消耗 Cost ($) Time (s)
DeepSeek-Chat 17 108 30 125 0.197 6 0.638 3 0.864 0 517 347 0.144 176.16
MARC Gemini-2.5-Pro 28 43 19 71 0.474 5 0.404 2 0.605 6 686 678 1.781 247.54
GPT-5 29 17 18 46 0.623 6 0.382 9 0.369 5 640 764 2.346 515.81
DeepSeek-Chat 16 87 31 103 0.213 3 0.659 5 0.844 6 434 475 0.125 309.14
LLMOnly Gemini-2.5-Pro 18 46 29 64 0.324 3 0.617 0 0.718 7 610 659 1.184 313.05
GPT-5 25 21 22 46 0.537 6 0.468 0 0.456 5 574 696 2.401 419.17
Verilator - 7 8 40 15 0.225 8 0.851 1 0.533 3 - 0 136.81
注: 加粗数据表示最优结果
从结果对比中可以观察到两个核心趋势. 首先, 多智能体协同方法的优越性得到了充分验证. 在任意一款模型
的驱动下, MARC 的 F1 分数均高于 LLMOnly. 以 GPT-5 为例, MARC 不仅多找出了 4 个真实缺陷 (TP=29 vs.
TP=25), 还减少了 4 个误报 (FP=17 vs. FP=21), 证明了本文所设计的融合设计知识与验证流程的多智能体协同方
法能够有效引导大语言模型进行更精准、更全面的分析, 从而系统性地降低了漏报与误报. 其次, 引入 Verilator 作
为传统工具基准, 进一步凸显了 MARC 的先进性. 实验数据显示, Verilator 的漏报率高达 0.851 1, 仅能识别出 7 个
真实缺陷, 表明传统 Linter 工具在发现复杂安全缺陷方面存在显著不足. 再次, 框架整体性能与底层大语言模型的
能力正相关. 无论是 MARC 还是 LLMOnly, 其检测效果都随着模型从 DeepSeek-Chat 向 GPT-5 的升级而稳步提
升. 这表明, 一个更强大的基础模型能够更好地执行框架赋予的复杂指令, 而 MARC 则能有效地放大这种能力优
势, 将其转化为实际的检测精度提升. 综上所述, 本实验有力地回答了研究问题 RQ1, 证实了 MARC 方法在硬件安
全缺陷早期检测任务上的能力.
在分析检测性能的同时, 本研究亦对不同方法的计算开销进行了量化, 涵盖 Token 消耗、经济成本 (Cost) 与
执行时间 (Time), 如表 3 最后 3 列所示. 数据显示, MARC 在 Token 消耗量上普遍高于 LLMOnly, 这是由于其提示
词更为复杂. 在经济成本方面, MARC 的开销通常高于 LLMOnly. 然而, 当使用 GPT-5 模型时, MARC 的成本反而
略低于 LLMOnly. 这是由于 MARC 框架针对 Token 成本的优化. 由于 GPT-5 输出 Token 价格是输入价格的 8 倍,
因此 MARC 通过优化的提示词策略, 使其输出 Token 数显著低于 LLMOnly, 从而实现了经济成本的有效压缩. 在
执行时间方面, Verilator 由于其不依赖 LLM, 耗时最短. 对于基于 LLM 的方法, 同一分析器下基于 DeepSeek-Chat
模型的实验轮次耗时最短, 反映出执行时间与模型能力呈正相关. 值得注意的是, 尽管 MARC 方法的框架结构更
为复杂, 其执行时间反而低于 LLMOnly. 这是由于 LLM 的响应时间与输出 Token 数量有着强相关, LLMOnly 的
提示词策略未经妥善优化, 消耗了更多的输出 Token 数量, 也导致了更长的执行时间.
为进一步深入分析 MARC 方法的性能, 本文还统计了其在不同硬件 IP 模块上的细分检测效果, 以实现 MARC
方法在不同功能模块上的性能一致性与差异性分析, 并评估底层模型能力对具体检测任务的影响. 本文把数据集
中的 13 个 IP 模块的缺陷检测所取得的 F1 分数, 以热力图的形式进行可视化呈现, 如图 2 所示. 其中纵轴代表不
同的 IP 模块, 横轴代表所使用的模型, 单元格的颜色深浅表示 F1 分数的高低, 即颜色越深, 代表检测效果越好. 从
统计结果来看, 检测性能与模型能力普遍存在强正相关性, 对于绝大多数 IP 模块, 检测效果随着模型能力的提升
而显著增强. 例如, 在 aes 模块上, F1 分数从 0.17 提升至 0.71; 在 keymgr 模块上, 更是从 0.17 大幅提升至 0.80. 在
gpio 模块上的效果尤为突出, F1 分数从 0 提升至 1.00, 实现了最优. 这一趋势有力地印证了更强大的基础模型能
够更精准地理解复杂硬件逻辑, 从而在 MARC 方法的引导下取得更优的检测成果. 另外, 不同 IP 模块的检测难度

