Page 63 - 《软件学报》2026年第6期
P. 63

2382                                                       软件学报  2026  年第  37  卷第  6  期


                 统方法的基准.
                    整体实验结果如表       3  所示. 可以看出, 本文提出的      MARC  在所有测试模型上的综合性能显著优于               LLMOnly
                 基准方法, 并且全面超越了传统的           Verilator 工具. 其中, 当使用  GPT-5  模型时, MARC  取得了最佳的检测效果, F1
                 分数达到了    0.623 6, 相较于同等模型下的     LLMOnly (0.537 6) 提升了约  16%. 同时, MARC  也实现了最低的漏报率
                 (FNR=0.3829) 与最低的误报率    (FDR=0.3695), 这表明其在缺陷检出率与结果精确率之间取得了最优的平衡.


                                                  表 3 MARC  整体实验结果

                  Analyzer    Model    TP   FP  FN   TP+FP   F1    FNR    FDR   Token消耗   Cost ($)  Time (s)
                           DeepSeek-Chat  17  108  30  125  0.197 6  0.638 3  0.864 0  517 347  0.144  176.16
                   MARC    Gemini-2.5-Pro  28  43  19  71   0.474 5  0.404 2  0.605 6  686 678  1.781  247.54
                              GPT-5    29   17  18    46    0.623 6  0.382 9  0.369 5  640 764  2.346  515.81
                           DeepSeek-Chat  16  87  31  103   0.213 3  0.659 5  0.844 6  434 475  0.125  309.14
                  LLMOnly  Gemini-2.5-Pro  18  46  29  64   0.324 3  0.617 0  0.718 7  610 659  1.184  313.05
                              GPT-5    25   21  22    46    0.537 6  0.468 0  0.456 5  574 696  2.401  419.17
                  Verilator    -        7   8   40    15    0.225 8  0.851 1  0.533 3  -    0     136.81
                 注: 加粗数据表示最优结果

                    从结果对比中可以观察到两个核心趋势. 首先, 多智能体协同方法的优越性得到了充分验证. 在任意一款模型
                 的驱动下, MARC    的  F1  分数均高于   LLMOnly. 以  GPT-5  为例, MARC  不仅多找出了    4  个真实缺陷   (TP=29 vs.
                 TP=25), 还减少了  4  个误报  (FP=17 vs. FP=21), 证明了本文所设计的融合设计知识与验证流程的多智能体协同方
                 法能够有效引导大语言模型进行更精准、更全面的分析, 从而系统性地降低了漏报与误报. 其次, 引入                               Verilator 作
                 为传统工具基准, 进一步凸显了          MARC  的先进性. 实验数据显示, Verilator 的漏报率高达        0.851 1, 仅能识别出  7  个
                 真实缺陷, 表明传统      Linter 工具在发现复杂安全缺陷方面存在显著不足. 再次, 框架整体性能与底层大语言模型的
                 能力正相关. 无论是      MARC  还是  LLMOnly, 其检测效果都随着模型从         DeepSeek-Chat 向  GPT-5  的升级而稳步提
                 升. 这表明, 一个更强大的基础模型能够更好地执行框架赋予的复杂指令, 而                       MARC  则能有效地放大这种能力优
                 势, 将其转化为实际的检测精度提升. 综上所述, 本实验有力地回答了研究问题                       RQ1, 证实了  MARC  方法在硬件安
                 全缺陷早期检测任务上的能力.
                    在分析检测性能的同时, 本研究亦对不同方法的计算开销进行了量化, 涵盖                        Token  消耗、经济成本    (Cost) 与
                 执行时间   (Time), 如表  3  最后  3  列所示. 数据显示, MARC  在  Token  消耗量上普遍高于  LLMOnly, 这是由于其提示
                 词更为复杂. 在经济成本方面, MARC         的开销通常高于      LLMOnly. 然而, 当使用   GPT-5  模型时, MARC  的成本反而
                 略低于   LLMOnly. 这是由于   MARC  框架针对   Token  成本的优化. 由于   GPT-5  输出  Token  价格是输入价格的    8  倍,
                 因此  MARC  通过优化的提示词策略, 使其输出          Token  数显著低于   LLMOnly, 从而实现了经济成本的有效压缩. 在
                 执行时间方面, Verilator 由于其不依赖      LLM, 耗时最短. 对于基于     LLM  的方法, 同一分析器下基于        DeepSeek-Chat
                 模型的实验轮次耗时最短, 反映出执行时间与模型能力呈正相关. 值得注意的是, 尽管                          MARC  方法的框架结构更
                 为复杂, 其执行时间反而低于         LLMOnly. 这是由于   LLM  的响应时间与输出       Token  数量有着强相关, LLMOnly   的
                 提示词策略未经妥善优化, 消耗了更多的输出              Token  数量, 也导致了更长的执行时间.
                    为进一步深入分析       MARC  方法的性能, 本文还统计了其在不同硬件            IP  模块上的细分检测效果, 以实现        MARC
                 方法在不同功能模块上的性能一致性与差异性分析, 并评估底层模型能力对具体检测任务的影响. 本文把数据集
                 中的  13  个  IP  模块的缺陷检测所取得的     F1  分数, 以热力图的形式进行可视化呈现, 如图            2  所示. 其中纵轴代表不
                 同的  IP  模块, 横轴代表所使用的模型, 单元格的颜色深浅表示              F1  分数的高低, 即颜色越深, 代表检测效果越好. 从
                 统计结果来看, 检测性能与模型能力普遍存在强正相关性, 对于绝大多数                       IP  模块, 检测效果随着模型能力的提升
                 而显著增强. 例如, 在     aes 模块上, F1  分数从  0.17  提升至  0.71; 在  keymgr 模块上, 更是从  0.17  大幅提升至  0.80. 在
                 gpio  模块上的效果尤为突出, F1     分数从   0  提升至  1.00, 实现了最优. 这一趋势有力地印证了更强大的基础模型能
                 够更精准地理解复杂硬件逻辑, 从而在            MARC  方法的引导下取得更优的检测成果. 另外, 不同              IP  模块的检测难度
   58   59   60   61   62   63   64   65   66   67   68