Page 52 - 《软件学报》2026年第6期
P. 52

芮志清 等: MARC: 基于多智能体协同的硬件安全缺陷早期检测方法                                              2371


                 existing  methods  suffer  from  high  false  negative  rate  (FNR)  and  false  discovery  rate  (FDR)  due  to  insufficient  utilization  of  specification
                 knowledge  and  an  inadequate  semantic  understanding  of  code  context.  To  address  these  challenges,  this  study  proposes  MARC,  an  early
                 detection  method  for  hardware  security  vulnerabilities  based  on  collaborative  multi-agent  systems  powered  by  large  language  models
                 (LLMs).  The  proposed  method  constructs  a  collaborative  framework  consisting  of  four  specialized  agents:  design  dependency  analysis,
                 documentation  analysis,  security  vulnerability  detection,  and  security  vulnerability  confirmation.  Through  multi-dimensional  collaboration,
                 including  cross-module  context  augmentation,  structured  utilization  of  module  documentation  knowledge,  rapid  preliminary  screening  of
                 potential  vulnerabilities,  and  deep  reasoning-based  risk  analysis.  Experiments  conducted  on  an  industrial-grade  dataset  demonstrate  that  the
                 MARC  framework  achieves  an  FNR  of  0.382 9  and  an  FDR  of  0.369 5,  representing  reductions  of  approximately  18.2%  and  19.1%,
                 respectively,  compared  to  the  baseline  method.  The  proposed  framework  effectively  reduces  false  positives  and  improves  detection
                 accuracy  in  early-stage  hardware  design.  Furthermore,  its  real-world  effectiveness  is  validated  by  the  discovery  of  a  hardware  vulnerability
                 that  has  been  assigned  a  CVE  identifier.  By  its  successful  application,  the  authors’  team  won  the  global  championship  in  the
                 HACK@DATE 2025 hardware security competition.
                 Key words:  hardware security; register transfer level (RTL); security vulnerability detection; large language model (LLM); multi-agent system
                    随着开源指令集      RISC-V  架构的迅猛发展, 其开放与模块化的特性催生了空前繁荣的硬件生态. 据                     SHD Group
                 预测, RISC-V SoC  的出货量将以近     47%  的年复合增长率增长, 至      2030  年占据全球近   35%  的市场份额    [1] . 由于这
                 种爆炸性的增长与广泛应用, 构建在            RISC-V  之上的硬件电路的安全性与可靠性, 已然成为整个信息安全体系的
                 信任根基. 然而, 与易于迭代更新的软件漏洞不同, 源于设计阶段的硬件安全缺陷, 一旦经过流片制造便被永久性
                 地固化在物理实体之中, 后期修复成本极其高昂甚至无法被修复. 更为严重的是, 这些硬件层面的缺陷能够轻易绕
                 过上层的软件安全防护机制, 使得构建于其上的操作系统、加密算法等所有安全措施失效                              [2] . 然而, 现有安全体系
                 对硬件缺陷的防御能力严重不足. 一方面, 主流安全机制多以缓解软件漏洞攻击为核心目标, 难以抵御跨层攻击对
                                                                                              [3]
                 硬件层面的渗透; 另一方面, 即便是针对硬件设计的安全扩展                    (如  SGX (software guard extension) 、Penglai-
                       [4]
                 Enclave ), 也并非为应对硬件自身安全缺陷而设计. 因此, 其实现过程中仍易受设计阶段遗留的未检测缺陷影响,
                                                        [7]
                                                                      [8]
                                                                                [9]
                 已多次成为跨层攻击的成功目标           [5,6] . 即便 Sanctum 、SANCTUARY 、Keystone  等安全研究项目, 也未将硬件
                 实现层面的安全性保障纳入核心设计目标. 进一步分析表明, 硬件安全缺陷的成因具有多元性与隐蔽性. 其安全缺
                 陷既可能源于安全规范的不明确或错误、设计阶段的逻辑缺陷, 也可能是设计方案在门级综合过程中因人为失误
                 或转换故障导致的实现偏差. 由于这些缺陷的普遍存在与防御体系的滞后性相互叠加, 硬件安全危机愈发突出, 已
                 成为威胁整个计算系统安全的核心风险点.
                    由于在硬件设计中, 缺陷的发现与修复成本会随着设计流程的推进呈指数级增长, 因此在设计的早期阶段检
                 测并修复潜在缺陷至关重要. 寄存器传输级              (register transfer level, RTL) 作为设计意图的首次代码化实现, 是在缺
                 陷固化于下游的逻辑综合与物理版图前、以最小代价进行拦截和修正的关键环节. 现有的主流硬件缺陷检测技
                 术, 如仿真、形式化断言、硬件模糊测试以及信息流追踪等, 其共同点在于均需对一个功能完备的                               RTL  模块进行
                 事后验证, 故无法满足在编码过程中进行即时反馈的伴随式检查需求. 伴随式检查中的常见方法是                                Linter 静态代
                 码检查工具, 其工作原理是通过数据流分析、控制流分析, 实现对源代码中风格、语法、结构、设计问题的自动
                 化检查, 以及对特定缺陷模式的启发式识别. 然而, 由于               Linter 的本质是一种语法和浅层语义层面的分析器, 其分
                 析范式高度依赖于一个预设的、基于语法与结构模式匹配的静态规则库, 此范式无法对代码设计意图及上下文逻
                 辑进行有效建模与理解.
                    现有硬件安全缺陷早期检测技术存在以下挑战.
                    挑战  1: 缺乏设计安全知识导致的高漏报率. 当前早期               RTL  检测技术在安全缺陷方面的高漏报率, 根本上源
                 于设计规约中的安全知识与自动化工具所能处理的规则库之间的巨大鸿沟. 关键的安全属性、资产定义与信任边
                 界等规约, 通常散布于非结构化的自然语言文档中, 或是在快速迭代的开发流程中缺失不全. 将这些非结构化的知
                 识手动转化为精确的       Linter 规则过程, 不仅效率低下、极易出错, 且难以随设计的演进进行同步维护, 在工程上不
                 具备可扩展性. 由于将设计安全知识有效结构化存在困境, 现有方法只能局限于通用的、与设计意图无关的缺陷
                 模式匹配, 因而无法检测出与特定设计语义和安全需求紧密耦合的深层次漏洞.
   47   48   49   50   51   52   53   54   55   56   57