推荐 5.6
Conf: 50%
本文研究了大语言模型(LLM)智能体在集成外部资源后所面临的安全威胁。由于智能体依赖统一的自然语言上下文通道进行推理,不可信的外部数据(如网页内容、工具返回结果)可能被动态解析为行为引导指令,从而劫持智能体的决策过程,实现间接提示注入或工具投毒攻击。现有防御手段主要停留在输入/输出层面的静态检测或恶意内容隔离,难以应对模型推理过程中动态产生的诱导行为。针对这一问题,作者提出了一种名为 Attnlocate 的运行时框架,能够对真正影响工具调用决策的上下文片段(即行为引导指令)进行细粒度定位。该框架将定位问题建模为目标检测任务,通过设计多头、多层的注意力聚合方案,构建面向目标检测的 token 级特征空间,并采用带无锚框检测头的一维 U-Net 网络来识别这些片段。最后,根据检测到的行为引导片段来源方的权限级别,Attnlocate 动态裁决恶意调用尝试。作者在来自五个 LLM 家族的十种智能体配置上进行了评估,覆盖间接提示注入和工具投毒场景,取得了 0.743 的平均 IoU、0.956 的平均 AUROC,以及在 0.067 假阳性率下 0.934 的真阳性率。该方法还能有效迁移到未见过的模型,并支持无需重新训练的权限策略自适应。本文的核心贡献在于首次将注意力矩阵中的激活痕迹用于行为引导指令的定位,为智能体运行时防御提供了新思路。适合 LLM 安全研究者、智能体框架开发者及蓝队安全工程师阅读。
💡 推荐理由: LLM 智能体正被广泛集成到业务中,但其统一上下文通道可被注入攻击利用。Attnlocate 提供了一种运行时细粒度定位行为引导指令的新方法,有助于检测动态诱导攻击,为智能体安全防御提供了可落地的技术路径。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)