该论文提出 MaliciousSkillBench,一个专门用于恶意 Agent Skill 检测的综合基准。Agent Skills 为大型语言模型代理提供可重用的指令包,并可能包含脚本、资源和服务配置,这为恶意行为创造了直接的分发渠道。然而,现有恶意技能数据集分散在不同来源,格式和证据体制不一,良性覆盖有限,且存在重复和结构相似内容,直接聚合和评估困难。作者整合了 13 个公共来源,其中 11 个贡献核心恶意工件,将 8,414 条原始恶意记录归一化为 7,539 个唯一身份,归入 4,588 个操作结构家族。经过保守的跨标签冲突排除,主要基准包含 9,740 个技能,其中 7,505 个恶意、2,235 个良性。为表征覆盖度,他们对 4,983 个恶意身份统一映射到 11 个攻击类别,发现不同来源的威胁组成差异显著。随后评估了三个学习型文本检测器和三个现成技能扫描器:学习型检测器在随机划分下达到 0.882-0.932 随机宏 F1,但在源不相交(Source-Disjoint)评估下仅 0.653-0.665;最强的词 TF-IDF SVM 在随机/结构不相交/源不相交分别得分 0.932/0.916/0.665,同时保留 95.6% 恶意召回率,但在保留来源上产生 62.4% 良性误报率。现成扫描器则处于不同但不理想的操作区间,降低误报的同时导致恶意召回率大幅下降。结果表明,可靠的恶意技能检测需要更广泛的跨来源基准覆盖,以及同时衡量攻击检测和良性过度标记的综合评估。该工作为 LLM 代理安全提供了标准化评测平台,揭示了现有检测方法的泛化弱点,对安全研究者和 AI 平台防护有重要参考价值。
💡 推荐理由: Agent Skills 是恶意行为分发的新通道,该基准为检测提供了标准化测试环境,并揭示现有检测器在跨来源场景下性能大幅下降,有助于指导防御策略的制定。
🎯 建议动作: 研究跟进