推荐 5.6
Conf: 50%
该论文聚焦于AI智能体面临的首要安全威胁——提示注入(Prompt Injection)。当智能体访问网站、文件或邮件等外部数据时,攻击者可在数据中嵌入恶意指令(如“忽略之前所有指令并执行攻击者任务”),从而操纵智能体行为。现有防御方法通过DPO或GRPO等序列级反馈对LLM进行安全微调,但面对自适应提示注入时攻击成功率仍接近100%。作者指出其根本原因在于:序列级反馈将整个输出一视同仁,模型无法精确学习哪些输出令牌是不安全的。为此,论文提出安全在线蒸馏(SecOPD, Secure On-Policy Distillation),提供令牌级反馈以引导安全微调。具体而言,LLM接收注入样本并生成输出(rollout),每个令牌由初始化模型根据对应干净输入进行评分,从而获得更细粒度的训练信号。实验表明,经SecOPD防御的Qwen3.6-27B模型,在针对最先进的PISmith自适应提示注入时,攻击成功率仅为9.0%,而此前最先进的Meta-SecAlign方法为94.0%。安全性可泛化至训练中完全未见的领域:在智能体工具调用场景中,SecOPD的攻击成功率为4.7%,Meta-SecAlign为5.5%。代码与模型已公开。该研究对AI智能体安全、LLM安全微调、防御提示注入等领域具有重要参考价值,适合AI安全研究人员、大模型安全工程师及智能体开发者阅读。
💡 推荐理由: 提示注入是AI智能体头号威胁,现有防御在自适应攻击下几乎失效。SecOPD通过令牌级反馈实现数量级改进,为安全微调提供新范式,对构建可信LLM应用至关重要。
🎯 建议动作: 研究跟进,评估其方法在自身LLM安全微调流程中的适用性。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)