#skill-selection

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Qikai Wang, Yongzhao Zhang, Zhiwei Chen, Yimiao Sun, Jiguo Yu, Xiaosong Zhang

本文研究了大语言模型(LLM)代理系统中的技能选择阶段的安全性。技能选择是决定用户请求由哪一个已安装技能来处理的关键环节。现有攻击手段主要依赖显式提示注入或指令级转向,这些方法容易暴露出可识别的操纵特征。针对这一空白,作者发现了一种新的隐式攻击面:即使单个用户提示和技能描述看起来都完全良性,攻击者仍可通过精心设计二者之间的语义关联,使模型倾向于选择攻击者指定的技能。基于此,提出了'基于语义匹配的隐式技能选择操纵'(ISM)方法。ISM通过联合改造目标技能的元数据和可复用的提示模板,在完全不包含显式选择指令的情况下,实现对技能选择过程的隐蔽操纵。具体而言,ISM采用三阶段策略:拓宽语义覆盖范围、增强目标技能的区分度、保持提示自然措辞以避免异常。在四个任务领域和八个不同选择器模型上的实验表明,ISM能将平均目标选择率(TSR)从15.2%提高至63.5%。在受控对比实验中,其TSR达到73.5%,仅比显式转向方法低9.8个百分点。更重要的是,人机审查实验显示,人类审查者仅在2.9%的判断中拦截了ISM的攻击,而显式转向的拦截率为91.4%;五个LLM检测器对ISM的平均放行率高达82.9%,对显式转向仅为37.4%。此外,ISM在PPL-W、Llama Prompt Guard 2和PIGuard等防御措施下依然有效。这一研究揭示了一种难以察觉的、针对技能选择环节的新型攻击方式,对LLM代理的实际部署安全构成了严峻威胁,也为防御方提出了新的技术挑战。

💡 推荐理由: 技能选择是LLM代理工作流中的关键信任边界。ISM表明攻击者无需依赖显式注入,仅通过调整技能元数据与提示的语义关系即可实现隐蔽操纵,现有检测手段和人类审查均难以识别。这会给依赖多个技能的自动化代理带来严重安全隐患,防御方需意识到这类隐式语义攻击的存在。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)