#semantic-firewall

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Puji Wang, Yingchen Zhang, Ruqing Zhang, Jiafeng Guo, Xueqi Cheng

该论文针对持久化AI代理(Persistent AI Agents)的安全性提出了一种新的运行时防御框架。与传统单轮对话助手不同,持久化AI代理通过长期运行的软件系统与用户交互,其不安全内容可通过持久化状态、可复用技能和工具中介交互传播,形成更大的语义攻击面。作者观察到,此类代理中大多数安全关键交互通过自然语言令牌流(Token Flows)传输,包括内存更新、工具参数、检索文件及组件间通信。基于此,他们提出TokenWall,一种作为语义防火墙的运行时防御框架,对代理令牌流进行边界感知的语义审计,构建结构化的源-汇审计记录,在执行前应用轻量级局部检查,并将模糊的高风险案例升级到更强的仲裁模块。与依赖稀疏审计或远程大模型监督的先前方法不同,TokenWall实现了全覆盖的执行前调解,同时减少了远程仲裁和延迟。在CIK-Bench上的实验表明,TokenWall将攻击成功率降至12.5%,同时保持97.4%的良性可执行通过率,且无需人工确认。在良性案例上仅引入0.69秒的额外延迟,证明语义运行时控制可以在持久化AI代理中实现实用的安全-效用平衡。

💡 推荐理由: 该论文提出的TokenWall为持久化AI代理提供了首个实用的运行时语义防火墙,能在不显著影响用户体验的前提下大幅降低攻击成功率,对保障LLM驱动的长期代理系统安全具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)