本文介绍了SingGuard-NSFA,一个面向Agentic AI系统的安全护栏框架,旨在防御提示注入、敏感信息提取、恶意代码请求、危险工具滥用和资源耗尽等操作威胁。首先,作者提出了NSFA分类法,将185种风险变体组织成基于CIA三元组(机密性、完整性、可用性)的层次结构,并与三个成熟的OWASP指南进行了交叉验证。基于该分类法,他们构建了一个覆盖133种语言的基准测试套件,包含超过93K个针对用户查询和代理响应的专门样本,以及从五个公开的代理安全数据集中改编的3,435个跨来源样本。为了实际检测这些操作威胁,他们开发了双模式方法:基于SFT的生成式推理用于可解释的离线审计,以及在冻结骨干网络上使用判别式分类头用于实时检测(约50毫秒)。他们发布了四个模型(0.8B、2B、4B和9B参数),在专门基准测试上均达到≥94%的F1分数,比最强的竞争护栏高出6到12个绝对百分点。在跨来源评估中,9B模型达到了91.29%的F1分数,且精确率-召回率权衡更平衡。此外,消融实验表明,分类头可以使护栏获得超出其原始范围的风险检测能力,并达到最先进的性能。这些结果证明了方法的可扩展性以及作为即插即用增强的通用性。
💡 推荐理由: 随着Agentic AI在自动化决策中的广泛应用,操作威胁如提示注入和工具滥用日益突出。本工作提供了系统化的威胁分类、大规模多语言基准以及高效的混合检测方法,显著提升了护栏的准确性和可解释性,对AI安全运营具有直接实用价值。
🎯 建议动作: 研究跟进