该论文针对大语言模型(LLM)生成的寄存器传输级(RTL)代码的安全性展开研究。与软件代码不同,RTL 代码一旦流片(tape-out)到硅片上便无法修补安全漏洞,因此其安全性至关重要。现有研究主要关注 LLM 生成软件代码的安全问题,而 RTL 领域尚缺乏系统性的安全评估与改进方法。作者构建了 SECRTL-GEN,一个基于真实 SoC IP 的多语言资源访问安全基准,包含 392 个任务,覆盖 5 个 CWE 家族和 4 种硬件描述语言(Verilog、SystemVerilog、VHDL 和 Python),并为每个任务提供黑盒功能测试台和安全测试台。该基准的关键设计是:功能规格说明中刻意省略安全义务,以模拟工业实践中安全需求常被排除在功能文档之外的情况。作者对五个前沿 LLM 进行实证研究,发现显著的安全差距:在普通提示词下,模型通过功能测试的比例为 73%-79%,但通过安全测试的比例仅为 14%-35%,且功能性更强的模型并不更安全。向提示词中加入 CWE 知识可提升安全性,而单纯依靠模型自我思考效果有限,且两种安全导向的提示方式都会降低功能通过率,表明瓶颈在于规格说明中缺乏弱点意识,而非模型不具备编写防御性 RTL 的能力。为此,作者提出 RTL-Obliger,一个神经符号框架,用于推断这些隐式安全义务。该框架首先由 LLM 从规格说明中提取功能语义图,然后由符号引擎将图与 CWE 模式本体进行匹配,以发现缓解证据缺口和信号级义务,最后 LLM 根据这些义务进行保留功能的两阶段生成。在五个模型和四种语言上,RTL-Obliger 将平均全通过率从 49.6%-51.4% 提升至 61.6%,安全通过率和功能通过率均优于现有的安全生成基线(SecV 和 RESCUE)。该研究为硬件安全代码生成提供了首个系统性基准和可行的改进框架,适合硬件安全研究人员、LLM 安全研究者和 EDA 工具开发者阅读。
💡 推荐理由: LLM 生成硬件代码的安全问题被长期忽视,本文填补了这一空白,揭示功能正确不等于安全,并提供了首个多语言 RTL 安全基准和神经符号修复框架,对芯片安全设计具有直接参考价值。
🎯 建议动作: 研究跟进