本文提出 AttackGNN,这是首个针对硬件安全领域基于图神经网络(GNN)技术的红队攻击框架。近年来,GNN 被广泛用于集成电路硬件安全任务,如检测知识产权盗版、硬件木马检测与定位、电路逆向工程和硬件混淆等,并取得了很高的准确率。然而,这些技术本身可能被对抗样本所欺骗,从而在安全关键场景中引入严重风险。为了系统评估其鲁棒性,作者设计了一个基于强化学习(RL)的智能体,用于生成对抗性电路样本,以诱骗目标 GNN 模型。研究中解决了三个核心挑战:有效性(攻击成功率)、可扩展性(适用于大规模电路)和通用性(跨不同问题类别)。作者针对四类硬件安全问题的五种 GNN 防御技术进行了攻击测试,包括 IP 盗版检测、硬件木马定位、逆向工程和硬件混淆。实验结果表明,生成的对抗性电路能够以 100% 的成功率欺骗所有被测试的 GNN 模型,例如让防御系统将盗版电路误判为正常,或将植入木马的电路误判为安全。这项工作揭示了当前 GNN 硬件安全防御的脆弱性,并强调了在部署前进行对抗性评估的必要性。适合硬件安全研究人员、AI 安全工程师和集成电路设计者阅读,以理解 GNN 模型的潜在弱点并开发更鲁棒的防御机制。
💡 推荐理由: 首次证明强化学习可生成对抗电路,使硬件安全 GNN 全面失效,对依赖 AI 的集成电路防护构成警示,需重新审视模型鲁棒性。
🎯 建议动作: 研究跟进