Page 67 - 《软件学报》2026年第6期
P. 67

2386                                                       软件学报  2026  年第  37  卷第  6  期


                    LLMOnly 方法本质上是一种零上下文的概率预测, 其效果完全依赖于模型在预训练中内化的知识, 面对特定、
                 复杂的设计意图时容易产生幻觉. 而           MARC  框架通过关注点分离原则构建多智能体范式协同架构, 系统性地将硬
                 件领域特有的设计知识与验证手段相融合, 为大模型的强大推理能力构建了一个结构化的工作流程. 文档分析智
                 能体将非结构化的设计规约和安全知识系统性地转化为高密度的结构化上下文, 从根本上解决了单一模型因缺乏
                 设计意图理解而导致的漏报问题. 缺陷确认智能体扮演了验证过滤器的角色, 通过生成                            SVA  断言进行二次验证,
                 有效抑制了大模型的幻觉, 实现误报的过滤. 这一点在成功发现                   CVE-2025-50418  的案例中可以体现, 正是通过融
                 合  CWE  安全规约与代码的深度时序逻辑分析, MARC            才得以识别出传统静态工具无法覆盖的、与设计意图紧密
                 相关的逻辑漏洞.
                  5.2   性能影响因素分析
                    实验数据揭示了影响        MARC  框架性能的两个核心因素, 分别是底层大语言模型的推理能力和目标                       IP  模块自
                 身的复杂性. 首先, 检测性能与模型推理能力强正相关. 无论是整体结果还是细分的                        IP  模块热力图, 都清晰地显示
                 出检测效果随着模型从        DeepSeek  向  GPT-5  的升级而稳步提升. 这表明, 一个更强大的基础模型能够更精准地理
                 解硬件描述语言的复杂语义、遵循框架赋予的复杂指令, 从而在                     MARC  的引导下取得更优的检测成果. 其次, 不
                 同  IP  模块的检测难度存在显著差异. 根据热力图统计结果, MARC               在  gpio、aes 等模块上表现优异, 但在     csrng  等
                 模块上则表现不佳. 这反映了         MARC  的设计模式和不同缺陷的检出率有较强对应关系. MARC                 的核心优势在于解
                 决设计规约与代码实现不一致的核心挑战, 因此, 对于第                 4.4.1  节中描述的  gpio  模块的缺陷, MARC  能通过融合文
                 档规约与代码语义来精准识别此类设计逻辑缺陷. 然而, 对于第                    4.4.2  节中描述的  csrng  模块缺陷, 其缺陷根源于
                 物理综合语义问题, 并非高层设计意图的违背, 已经超出了                  MARC  希望解决的硬件安全缺陷早期检测核心挑战.
                 但本文仍然为该问题的解决提供了思路, 即通过构建与                  EDA  工具结合的   Agent 架构, 有希望提升设计阶段中隐蔽
                 硬件缺陷的检测覆盖率, 在硬件安全领域依然具有广阔的应用前景.
                  6   总 结

                    硬件安全是信息技术体系的信任根基, 在设计早期阶段高效、精准地发现并修复                           RTL  级安全缺陷, 对于降低
                 研发成本、保障系统安全至关重要. 然而, 现有的              RTL  早期检测技术, 特别是静态分析工具, 普遍受困于设计知识
                 鸿沟与代码语义理解缺失两大核心挑战, 导致高漏报率与高误报率问题并存, 难以满足工业界对高质量伴随式代
                 码审计的需求. 为应对上述挑战, 本文提出了一种基于大语言模型多智能体协同的硬件安全缺陷早期检测方法
                 MARC. 该方法通过构建一个模拟硬件安全专家团队工作模式的协同框架, 系统性地解决了传统方法的瓶颈. 该框
                 架包含   4  类职能明确的智能体: 依赖分析智能体负责构建系统级上下文; 文档分析智能体利用检索增强生成技术,
                 将非结构化的设计文档与安全规范转化为结构化的模块安全设计规范图谱, 以解决高漏报问题; 缺陷检测智能体
                 利用该图谱进行上下文感知的深度代码审计; 缺陷确认智能体则通过自动生成并验证                            SVA  断言, 对潜在缺陷进行
                 精准过滤, 以解决高误报问题. 为了验证           MARC  的有效性, 本文在开源工业级         SoC  数据集上进行了一系列量化实
                 验. 实验结果表明, MARC     方法的性能显著优于基线方法, 其漏报率降低至                0.382 9, 降幅约  18.2%, 误报率降低至
                 0.369 5, 降幅约  19.1%, 证明了多智能体协同框架在融合设计意图与代码语义方面的优越性. 这些量化优势进一步
                 转化为实际成果, 作者团队凭借本方法不仅成功挖掘了一个已获官方                      CVE  编号的真实硬件漏洞, 还获得了国际顶
                 级硬件安全赛事      HACK@DATE 2025  的全球冠军, 充分展示了其在实际工程中的应用潜力.
                    未来的研究工作可从以下几个方面展开: 首先, 可以将                 MARC  生成的   SVA  断言与形式化验证工具链进行深
                 度集成, 实现从缺陷初筛到完备性证明的自动化流程. 其次, 可以进一步扩展框架以支持更多硬件描述语言, 并探
                 索更复杂的智能体协作与自主学习机制, 以应对更大规模、更复杂的                       SoC  设计. 我们相信, 随着大语言模型与多
                 智能体技术的不断发展, MARC        方法将为构建更智能、更可靠的硬件安全自动化验证体系提供有力的技术支撑.


                 References
                  [1]   The  SHD  Group.  RISC-V  market  report:  Application  forecasts  in  a  heterogeneous  world.  2024.  https://theshdgroup.com/wp-content/
   62   63   64   65   66   67   68   69   70   71   72