#rtl

共收录 6 条相关安全情报。

← 返回所有主题
👥 作者: Guang Yang, Xing Hu, Xiang Chen, Xin Xia

该论文针对大语言模型(LLM)生成的寄存器传输级(RTL)代码的安全性展开研究。与软件代码不同,RTL 代码一旦流片(tape-out)到硅片上便无法修补安全漏洞,因此其安全性至关重要。现有研究主要关注 LLM 生成软件代码的安全问题,而 RTL 领域尚缺乏系统性的安全评估与改进方法。作者构建了 SECRTL-GEN,一个基于真实 SoC IP 的多语言资源访问安全基准,包含 392 个任务,覆盖 5 个 CWE 家族和 4 种硬件描述语言(Verilog、SystemVerilog、VHDL 和 Python),并为每个任务提供黑盒功能测试台和安全测试台。该基准的关键设计是:功能规格说明中刻意省略安全义务,以模拟工业实践中安全需求常被排除在功能文档之外的情况。作者对五个前沿 LLM 进行实证研究,发现显著的安全差距:在普通提示词下,模型通过功能测试的比例为 73%-79%,但通过安全测试的比例仅为 14%-35%,且功能性更强的模型并不更安全。向提示词中加入 CWE 知识可提升安全性,而单纯依靠模型自我思考效果有限,且两种安全导向的提示方式都会降低功能通过率,表明瓶颈在于规格说明中缺乏弱点意识,而非模型不具备编写防御性 RTL 的能力。为此,作者提出 RTL-Obliger,一个神经符号框架,用于推断这些隐式安全义务。该框架首先由 LLM 从规格说明中提取功能语义图,然后由符号引擎将图与 CWE 模式本体进行匹配,以发现缓解证据缺口和信号级义务,最后 LLM 根据这些义务进行保留功能的两阶段生成。在五个模型和四种语言上,RTL-Obliger 将平均全通过率从 49.6%-51.4% 提升至 61.6%,安全通过率和功能通过率均优于现有的安全生成基线(SecV 和 RESCUE)。该研究为硬件安全代码生成提供了首个系统性基准和可行的改进框架,适合硬件安全研究人员、LLM 安全研究者和 EDA 工具开发者阅读。

💡 推荐理由: LLM 生成硬件代码的安全问题被长期忽视,本文填补了这一空白,揭示功能正确不等于安全,并提供了首个多语言 RTL 安全基准和神经符号修复框架,对芯片安全设计具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Mahshid Rezakhani, Kimia Azar, Hadi Kamali

随着大语言模型(LLM)在硬件设计领域的应用,寄存器传输级(RTL)代码的自动化生成成为趋势,设计者可以利用LLM将高层级规范转换为可综合的硬件描述。然而,这类模型通常基于第三方预训练模型进行微调,其训练数据和适配过程不透明,导致供应链中存在严重信任问题。恶意攻击者甚至模型供应商可能在微调阶段植入隐藏后门,使得用户在推理时看似无害的提示词触发恶意行为(如硬件木马)。针对这一AI驱动的集成电路供应链安全挑战,本文提出了RTLGuard,一种轻量级的防御框架。RTLGuard采用教师-学生(teacher-student)架构,通过三个步骤净化被污染的RTL生成模型:(1)在有限的受信任RTL数据集上微调一个小规模的“干净”教师模型;(2)通过复合的教师-学生目标函数引导被污染的生成模型;(3)引入特征对齐和知识蒸馏技术以抑制恶意行为。该方法避免了全参数重训练的高昂计算成本。作者在多种LLM架构上进行了实验,结果表明RTLGuard能显著降低攻击成功率(ASR),同时保持生成RTL代码的功能正确性和可综合性。该研究为硬件设计流程中的LLM安全提供了可行的防御思路,尤其适用于第三方模型集成场景。

💡 推荐理由: 硬件设计自动化引入LLM后,模型后门可能导致芯片被植入硬件木马,影响国家安全和关键基础设施。RTLGuard提供了一种低成本的模型净化方案,对保障AI供应链安全具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Alenkruth Krishnan Murali, Raghul Saravanan, Sai Manoj P D, Ashish Venkat

本文是一篇关于硬件模糊测试(Hardware Fuzzing)的系统性综述(SoK),旨在系统化梳理当前硬件模糊测试技术在三个主要抽象层次上的研究现状与挑战,这三个层次分别是指令集架构(ISA)、微架构(Microarchitecture)以及寄存器传输级(RTL)。研究从输入刺激质量、变异策略、反馈机制、目标平台、参考模型以及覆盖率等多个关键维度,对现有硬件模糊测试方法进行了全面分析和横向比较。作者发现,不同抽象层次在挑战、目标和设计权衡上存在显著差异:ISA 层更关注指令序列的合法性与语义覆盖;微架构层侧重于触发深层流水线竞争或缓存行为;而 RTL 层则需要在门级或寄存器传输级上快速生成能触发设计缺陷的激励。文中进一步指出现有硬件模糊测试实践中存在的若干尚未满足的需求,包括智能输入生成、可靠且可扩展的黄金参考模型、表达力更强的反馈通道,以及跨层集成能力。基于这些洞察,作者提出了未来研究方向,涵盖混合模糊测试框架、AI 辅助测试生成、可扩展参考模型、标准化评估指标与基准测试,以及将人工引入循环的自动化引导探索与分析。整体目标是为了实现高效、可靠且全面的硬件验证解决方案。本文适合硬件安全研究人员、EDA 工具开发者、芯片验证工程师以及关注硬件供应链安全的蓝队成员阅读,有助于理解硬件模糊测试的技术边界和演进方向。

💡 推荐理由: 硬件漏洞是软件安全的基础,硬件模糊测试是发现芯片设计缺陷的关键手段。本文系统梳理了不同抽象层次的技术差距和未满足需求,为安全工程师选择或开发硬件验证工具提供了清晰的路线图,有助于提前发现底层安全隐患。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bryan Kwan, Benjamin Tan

随着硬件层成为攻击者的重点目标,硬件安全验证技术的改进需求日益迫切。现有最先进的安全验证技术通常需要具备安全专业知识的人员投入大量手动工作,且缺乏标准方法来定位寄存器传输级(RTL)代码中缺陷的具体位置。本文提出 CWEEP,一种用于检测 RTL 中安全弱点的静态分析框架。CWEEP 无需详细的安全规范,因此可在属性仍处于构建阶段的 RTL 开发早期使用。此外,CWEEP 能够定位 RTL 中潜在漏洞的确切位置,并在适用时提供自动代码修复建议。作者利用文献中的数据集,在两组 SoC 设计(包含手动插入的漏洞)以及一个包含 3874 个带缺陷模块的大语言模型生成数据集上评估了 CWEEP 的性能。结果表明,CWEEP 发出正确警告的比例高达 60.8%,而此前工作中的工具在同一数据集上仅有 17.5% 的正确警告率。该研究为硬件安全验证提供了自动化程度更高、定位更精确的静态分析方案,有助于在开发早期发现安全弱点并降低修复成本。

💡 推荐理由: 硬件安全验证传统上依赖人工且缺乏定位手段,CWEEP 可在无需安全规范的情况下自动检测 RTL 漏洞并给出修复建议,显著提升早期发现效率,对芯片设计安全实践具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiao Tan, Cynthia Sturton

本文提出 CHARGE,一个面向硬件安全验证的自动化框架,利用 CWE(Common Weakness Enumeration)层次结构和大型语言模型(LLM)为未经验证的 RTL(寄存器传输级)模块自动生成安全属性(SystemVerilog Assertions, SVA)。其核心创新在于利用 CWE 条目的层次化语义进行推理,从而在未验证的 RTL 模块中更准确地识别安全关键资产(security-critical assets),并基于识别出的资产与 CWE 语义推断期望的安全行为,生成对应的安全属性。该方法避免了对受信任设计规格说明的依赖,显著减少了人工工程投入。作者在 Hack@DAC18、19 和 21 三个开源 SoC 设计上使用 OpenAI 的 GPT-4.1 进行评估,结果显示 CHARGE 成功检测出这些设计中 42 个已知漏洞中的 27 个。对于 Hack@DAC21 的 OpenPiton SoC,89% 的生成断言能够在 Cadence JasperGold FPV 中运行,且 92.2% 的断言非空(non-vacuous)。与现有开源手工编写的属性集相比,CHARGE 能针对其中 3 个手工属性写错的漏洞正确生成属性;此外,CHARGE 生成的属性还在 Hack@DAC21 OpenPiton SoC 中发现了一个先前未被识别的新漏洞。该研究展示了 LLM 和 CWE 知识在硬件安全验证中的潜力,为自动生成安全属性提供了新的思路,适合硬件安全研究人员、SoC 设计验证工程师以及关注 LLM 在安全自动化中应用的从业者阅读。

💡 推荐理由: 硬件漏洞难以发现且修复成本高,传统属性生成依赖设计规格或人工经验。CHARGE 利用 CWE 层次结构和 LLM 自动从 RTL 中生成安全断言,并能在真实 SoC 中发现新漏洞,为自动化硬件安全验证提供了可落地的新方法。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Mahshid Rezakhani, Nowfel Mashnoor, Kimia Azar, Hadi Kamali

随着大语言模型(LLM)越来越多地被微调用于硬件任务(如寄存器传输级(RTL)代码生成),高质量数据集的稀缺性常常导致使用快速组装或生成的数据。这些数据集缺乏安全验证,极易受到数据投毒攻击,使得模型生成语法正确但存在安全漏洞的硬件模块,绕过标准功能检查。为此,本文提出SafeTune框架,旨在增强基于LLM的RTL代码生成对投毒攻击的鲁棒性,特别关注硬件木马(HT)插入。SafeTune包含两个核心组件:(1)图神经网络(GNN),通过建模结构属性在微调过程中识别异常电路模式;(2)语义验证模块,利用文本嵌入和XGBoost分类器评估提示词的安全性。通过结合结构知识和语义知识,SafeTune有效过滤投毒输入而不牺牲合法数据。实验结果表明,SafeTune在无需修改底层模型架构的情况下,显著提升了LLM微调的鲁棒性和可靠性。

💡 推荐理由: 硬件安全中RTL生成是新兴方向,数据投毒攻击可导致芯片级别后门,SafeTune提供了实际可用的防御框架。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)