#persistent-semantic-entities

共收录 1 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Zhaohui Wang

该论文研究了工具增强型大语言模型(LLM)智能体系统中一种隐蔽的状态污染现象,作者将其形式化为“持久语义实体”(Persistent Semantic Entities, PSEs)。PSEs 指那些通过名称绑定、事件触发和跨边界传播在会话间持续存在、可被事件激活并在不同智能体之间扩散的隐式状态,常规调试手段难以察觉。研究在 11 个模型家族的 24 个模型(参数量 1.5B 至 1T)上进行了系统评估。主要发现包括:第一,所有被测模型均存在不同程度的易感性(在 20 模型易感面板上为 20%–100%),其中名称绑定是必要且主要的机制——去掉名称绑定后污染率降为 0%。第二,持久性取决于污染类型而非模型规模或部署方式:偏好污染在所有模型上均不衰减(t=10 时为 100%);指令污染一旦被采纳便持续存在;人物角色式注入会部分衰减(90% 降至 10%);事实注入的持久性则依赖具体模型——在 Llama-3.1-8B 和 GPT-4o-mini 上能自我纠正,但在两种 Qwen2.5-coder 变体上保持高位,因此论文不宣称其普遍可自我纠正。在受控环境中,偏好和指令污染的结果跨供应商保持一致。第三,上下文隔离的自我验证方法在没有参考标准的情况下可实现 20%–79% 的污染降低(中位数 36.5%),而基于关键词的检测会产生系统性误报;同时,污染在四阶段智能体流水线中会以 1.9 倍累积(从 40% 升至 75%)。论文指出,偏好污染和指令污染具有持久、缺乏自我纠正、且标准监控难以捕捉的特点,构成了已部署智能体系统特别值得关注的攻击面。适合 LLM 安全研究人员、智能体框架开发者及部署 LLM 应用的安全运维团队阅读。

💡 推荐理由: 揭示了 LLM 智能体中隐式状态污染的普遍性与持久性,尤其是偏好/指令污染难以被标准监控发现,且可在多智能体之间传播,为蓝队评估和防护此类新型攻击面提供了实证依据。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)