#activation-analysis

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Xue Tan, Changhui Wang, Sanrui Yang, Hao Luan, Zhuyang Yu, Jin Wei, Ping Chen, Xiaoyan Sun, Jun Dai

该论文研究的是多源 LLM Agent 输入场景下的"片段级投毒"(segment-level poisoning)检测与定位问题。现代 LLM Agent 通常把检索到的文段、用户评论、外部文档等多来源内容聚合成一个 prompt,攻击者只要控制其中少量来源,就能注入恶意片段来操纵模型输出。作者指出,现有防御主要依赖文本模式匹配、外部嵌入模型或额外的辅助检测器,面对措辞流畅、语义上也说得通的投毒片段时容易失效,而且基本无法指出到底是哪一段被污染,缺少溯源能力。论文的核心观察是:成功的 corrupted-evidence(污染证据)与 adversarial-instruction(对抗指令)攻击会在 LLM 内部激活中造成结构化的偏移,形成一种一致的激活空间模式,作者称之为 poison direction(投毒方向)。基于此提出 ActProbe 框架:把 MLP 激活投影到学习得到的 poison direction 上,并用在一个小型校准集上训练的轻量线性 SVM 来判定整个 prompt 是否被污染;随后用 BinRoL 完成片段定位,它结合了递归替换消融、基于 Mahalanobis 距离的分支剪枝以及基于 MAD 的鲁棒叶子检测三种手段。ActProbe 不需要修改后端模型,并把定位开销从 O(n) 的穷举探测降到 O(k log n) 次前向传播。实验覆盖三个数据集、两种攻击和四个开放权重 LLM,达到 0.01 的误报率、0.05 的漏报率、0.94 的定位召回率和 0.90 的定位 F1 值;对防御感知的自适应攻击仍然有效,并可通过代理模型(surrogate)迁移,为黑盒 API 场景提供投毒片段移除能力。总体上,这是一篇把可解释性/内部状态分析用于 Agent 输入完整性防护的工作,适合 RAG 与 Agent 安全方向的研究者和防御工程师阅读。

💡 推荐理由: RAG 与多源 Agent 的输入链路是当前最现实的投毒面:攻击者只需污染少量来源即可影响输出。该工作用内部激活而非文本特征做检测,对流畅语义投毒更鲁棒,且能定位到具体片段,为来源隔离、信誉降权和证据移除提供了可操作的抓手。

🎯 建议动作: 研究跟进:评估在自有 RAG/Agent 流水线中复现激活探针方案的可行性,并纳入内部评估

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)