提示注入(prompt injection)检测器目前普遍以分布内测试集上的聚合 F1 作为主要评价指标,这种做法掩盖了模型在分布偏移下的真实行为,尤其是决策边界的良性一侧:误报会直接产生运维成本(告警疲劳、正常业务被拦截),却往往没有被单独测量。为此作者提出 PIDS-Bench,一个冻结的、多维度的评测基准,在固定阈值下同时衡量攻击检出与良性误报行为,覆盖四类输入:分布内样本、'hard-benign'(结构上模仿注入但无恶意意图的提示)、经过混淆处理的注入攻击,以及领域与结构层面的分布偏移。评测对象共 7 个检测器,包括学习型基线、外部提示注入分类器以及更宽泛的安全对齐类对比器,并加入一个基于规则的方法作为性能下界参考。结果显示,多轴评测揭示出聚合 F1 完全掩盖的失效模式:某个在留出集上 F1 超过 0.98 的检测器,对来自公开语料、仅限定为安全相邻内容的良性子集仍有约三分之一的误分类。在完整阈值扫描与 5 个随机训练种子下,没有任何内部检测器能同时满足 F1≥0.95 且 hard-benign FPR≤0.10。按提示来源拆解后发现:困难负样本增强几乎消除了人工策展压力输入上的过度防御(over-defense),但在外部来源提示上基本无效,作者将这一现象称为'来源敏感的过度防御'(provenance-sensitive over-defense);该不对称在两种微调架构上均成立,且不随增强池扩大而减弱,外部来源的误报率仍远高于 0.10 的目标线。作者明确指出,与外部来源分布相匹配的增强能否弥合这一差距尚未经过验证,仅靠阈值校准与策展式增强并不足够。该工作适合红队/蓝队、LLM 网关与内容安全评测人员阅读。
💡 推荐理由: 安全团队常以 F1 选型提示注入检测器;本工作证明高 F1 会掩盖对良性安全文本的大规模误报,直接影响 SOC 告警质量与 LLM 网关可用性,并给出可复用的多轴评测思路。
🎯 建议动作: 纳入内部评估