推荐 5.5
Conf: 50%
本文提出 LongPIBench,一个专门面向长上下文场景的提示注入攻击基准。当前已有的提示注入基准大多只覆盖短输入,无法反映真实应用中长上下文条件下的安全风险,导致对现有防御方案有效性的高估。为弥补这一空白,作者设计了覆盖四种真实应用场景的基准,包括论文评审、简历筛选、代码审查和邮件摘要。每个场景都同时构建了合成数据集和真实世界数据集,上下文长度从几千 token 到数万 token 不等。通过在 LongPIBench 上的系统评估,作者发现现有提示注入防御在长上下文场景下存在明显脆弱性:即使是简单的启发式提示注入攻击也能获得较高攻击成功率,并频繁绕过当前最先进的防御机制。该工作为长上下文提示注入攻击与防御研究提供了可复现的评估平台,有助于推动相关安全机制的发展。论文适合 LLM 安全研究人员、红蓝队成员以及构建基于大模型应用的工程团队阅读。
💡 推荐理由: 长上下文已成为主流 LLM 应用常态,但现有安全评估仍以短上下文为主。该基准揭示防御在长场景下失效,提醒蓝队需重新验证安全假设。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)