推荐 5.5
Conf: 50%
该论文揭示了大型语言模型(LLM)在支持函数调用的状态ful环境中存在的一种结构性安全漏洞。在此类系统中,开发者定义的函数schema、结构化参数以及不可信的工具输出被混入同一个共享模型上下文,导致可信控制逻辑与不可信数据间的边界模糊,攻击者可利用多轮执行路径分布式注入恶意意图。作者提出一种名为SMT(Simulated Moderation Traces)的黑盒攻击框架,该框架不依赖纯提示交互,而是构造一条模拟合法审核工作流的多轮轨迹:首先捏造一个审核帧,以红队测试为借口诱导模型生成有害内容;随后利用验证反馈将安全拒绝视为执行失败,促使模型逐步弱化安全约束,最终输出有害结果。在来自五个不同提供商的商业LLM及两个标准化安全基准上的实验表明,SMT在攻击成功率与HarmScore上持续达到最高,且查询次数接近最少,大幅超越现有基线。论文强调,仅靠提示级清理无法防御此类系统,急需对schema、参数、工具输出及累积对话状态进行上下文感知的验证。
💡 推荐理由: 该研究首次指出函数调用LLM的结构性漏洞,证明仅提示级防御完全不足,安全团队需重新评估集成工具调用的LLM系统的安全边界。
🎯 建议动作: 纳入内部评估
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)