#trajectory-detection

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Asif Pinjari, Mithun Paul Saint-Germain

该论文关注 LLM 智能体(Agent)面临的间接提示注入(indirect prompt injection)检测难题。作者指出,当注入攻击成功时,攻击痕迹会体现在 Agent 自身的行为轨迹上:一段正常的工具调用前缀、一个被投毒的观测结果(observation),以及紧随其后为攻击者服务的动作后缀。对安全运营人员而言,需要回答三个问题:攻击从哪里进入、哪些步骤被污染、以及看似是投毒的内容是否实际被模型抵抗住了。现有检测系统要么只给出整条轨迹是否安全的二分类结论,要么只返回一个不安全步骤的下标,无法同时支撑这三个问题。为此作者提出 DriftNet——一个双头(dual-head)轨迹 Transformer:输入是已记录的工具调用轨迹日志,一次前向传播即可同时完成两项任务,一个头输出整条轨迹是否被攻陷,另一个头为每一步打上四类标签(正常 benign、注入点 injection point、被劫持 hijacked、注入失败 failed injection)。据作者所称,这是首个产生此类联合输出的有监督检测器。方法上,每一步由冻结的句子编码器和四个与身份无关的世界特征(identity-free world features)嵌入表示,主干网络参数量不足两百万,使用针对两个头联合的类别加权目标函数训练,且无需访问被测 Agent 的模型本身,因此可作为旁路检测器部署。实验在 AgentDrift 基准的任务不相交划分(task-disjoint split,共 12,536 条轨迹、71,024 个带标签步骤)上进行,通过 20 组配置的扫描将超参数敏感性限制在 0.011 F1 以内,测试集仅评估一次。结果显示 DriftNet 的轨迹级 F1 达 0.983,在 98.7% 的被攻击轨迹上精确恢复注入点,被劫持片段 IoU 为 0.979,对 218 个被成功抵抗的攻击样本零误报,对困难负样本误报率仅 2.9%。相较之下,在同一划分上重训练的表面特征基线仅能恢复 11.1% 的部分劫持与 17.1% 的延迟执行,DriftNet 分别达到 98.6% 和 93.2%,且各项误报率均更低。作者还分析了全部 26 个残差错误,发现多数漏检来自被标注的注入观测本身不包含可读指令的轨迹,并一并报告了该基准上测得的世界身份规律性(world-identity regularity)。

💡 推荐理由: 提示注入是 LLM Agent 落地的核心风险,而现有检测多停留在整条轨迹的粗粒度判定。把“轨迹是否被攻陷、注入点在哪、哪些步骤被劫持、投毒是否被抵抗”统一到一次前向推理,且不依赖 Agent 内部模型,正好契合 SOC 对可解释告警与低成本旁路检测的需求。

🎯 建议动作: 研究跟进:复现其在自有 Agent 轨迹日志上的迁移效果,评估是否可作为运行时旁路检测组件纳入内部评估

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)