Page 52 - 《软件学报》2026年第6期
P. 52
芮志清 等: MARC: 基于多智能体协同的硬件安全缺陷早期检测方法 2371
existing methods suffer from high false negative rate (FNR) and false discovery rate (FDR) due to insufficient utilization of specification
knowledge and an inadequate semantic understanding of code context. To address these challenges, this study proposes MARC, an early
detection method for hardware security vulnerabilities based on collaborative multi-agent systems powered by large language models
(LLMs). The proposed method constructs a collaborative framework consisting of four specialized agents: design dependency analysis,
documentation analysis, security vulnerability detection, and security vulnerability confirmation. Through multi-dimensional collaboration,
including cross-module context augmentation, structured utilization of module documentation knowledge, rapid preliminary screening of
potential vulnerabilities, and deep reasoning-based risk analysis. Experiments conducted on an industrial-grade dataset demonstrate that the
MARC framework achieves an FNR of 0.382 9 and an FDR of 0.369 5, representing reductions of approximately 18.2% and 19.1%,
respectively, compared to the baseline method. The proposed framework effectively reduces false positives and improves detection
accuracy in early-stage hardware design. Furthermore, its real-world effectiveness is validated by the discovery of a hardware vulnerability
that has been assigned a CVE identifier. By its successful application, the authors’ team won the global championship in the
HACK@DATE 2025 hardware security competition.
Key words: hardware security; register transfer level (RTL); security vulnerability detection; large language model (LLM); multi-agent system
随着开源指令集 RISC-V 架构的迅猛发展, 其开放与模块化的特性催生了空前繁荣的硬件生态. 据 SHD Group
预测, RISC-V SoC 的出货量将以近 47% 的年复合增长率增长, 至 2030 年占据全球近 35% 的市场份额 [1] . 由于这
种爆炸性的增长与广泛应用, 构建在 RISC-V 之上的硬件电路的安全性与可靠性, 已然成为整个信息安全体系的
信任根基. 然而, 与易于迭代更新的软件漏洞不同, 源于设计阶段的硬件安全缺陷, 一旦经过流片制造便被永久性
地固化在物理实体之中, 后期修复成本极其高昂甚至无法被修复. 更为严重的是, 这些硬件层面的缺陷能够轻易绕
过上层的软件安全防护机制, 使得构建于其上的操作系统、加密算法等所有安全措施失效 [2] . 然而, 现有安全体系
对硬件缺陷的防御能力严重不足. 一方面, 主流安全机制多以缓解软件漏洞攻击为核心目标, 难以抵御跨层攻击对
[3]
硬件层面的渗透; 另一方面, 即便是针对硬件设计的安全扩展 (如 SGX (software guard extension) 、Penglai-
[4]
Enclave ), 也并非为应对硬件自身安全缺陷而设计. 因此, 其实现过程中仍易受设计阶段遗留的未检测缺陷影响,
[7]
[8]
[9]
已多次成为跨层攻击的成功目标 [5,6] . 即便 Sanctum 、SANCTUARY 、Keystone 等安全研究项目, 也未将硬件
实现层面的安全性保障纳入核心设计目标. 进一步分析表明, 硬件安全缺陷的成因具有多元性与隐蔽性. 其安全缺
陷既可能源于安全规范的不明确或错误、设计阶段的逻辑缺陷, 也可能是设计方案在门级综合过程中因人为失误
或转换故障导致的实现偏差. 由于这些缺陷的普遍存在与防御体系的滞后性相互叠加, 硬件安全危机愈发突出, 已
成为威胁整个计算系统安全的核心风险点.
由于在硬件设计中, 缺陷的发现与修复成本会随着设计流程的推进呈指数级增长, 因此在设计的早期阶段检
测并修复潜在缺陷至关重要. 寄存器传输级 (register transfer level, RTL) 作为设计意图的首次代码化实现, 是在缺
陷固化于下游的逻辑综合与物理版图前、以最小代价进行拦截和修正的关键环节. 现有的主流硬件缺陷检测技
术, 如仿真、形式化断言、硬件模糊测试以及信息流追踪等, 其共同点在于均需对一个功能完备的 RTL 模块进行
事后验证, 故无法满足在编码过程中进行即时反馈的伴随式检查需求. 伴随式检查中的常见方法是 Linter 静态代
码检查工具, 其工作原理是通过数据流分析、控制流分析, 实现对源代码中风格、语法、结构、设计问题的自动
化检查, 以及对特定缺陷模式的启发式识别. 然而, 由于 Linter 的本质是一种语法和浅层语义层面的分析器, 其分
析范式高度依赖于一个预设的、基于语法与结构模式匹配的静态规则库, 此范式无法对代码设计意图及上下文逻
辑进行有效建模与理解.
现有硬件安全缺陷早期检测技术存在以下挑战.
挑战 1: 缺乏设计安全知识导致的高漏报率. 当前早期 RTL 检测技术在安全缺陷方面的高漏报率, 根本上源
于设计规约中的安全知识与自动化工具所能处理的规则库之间的巨大鸿沟. 关键的安全属性、资产定义与信任边
界等规约, 通常散布于非结构化的自然语言文档中, 或是在快速迭代的开发流程中缺失不全. 将这些非结构化的知
识手动转化为精确的 Linter 规则过程, 不仅效率低下、极易出错, 且难以随设计的演进进行同步维护, 在工程上不
具备可扩展性. 由于将设计安全知识有效结构化存在困境, 现有方法只能局限于通用的、与设计意图无关的缺陷
模式匹配, 因而无法检测出与特定设计语义和安全需求紧密耦合的深层次漏洞.

