#generation-time-defense

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

本文针对工具型大语言模型(LLM)智能体在多轮交互中的安全风险提出了一种新的防御方法。传统安全防护主要关注生成文本中的恶意内容,但工具型智能体能够执行影响外部系统的动作,安全风险范围因此扩展至动作序列。多轮分解攻击(multi-turn decomposition attacks)将有害目标拆解到多个单独看似合理的请求和工具调用中,只有从累计的交互轨迹中才能显现真实意图。现有的防御方法要么依赖额外的在线推理来恢复长期安全证据,要么在动作生成后再评估,导致推理成本增加或依赖特定运行时的动作表示。为此,作者提出生成时防御方法 ReDiR(Reassembling Distributed Risk),在动作生成之前,将当前轨迹压缩为紧凑的潜在安全表示,并将其注入冻结的基础模型。该表示通过同一模型的跨视图监督学习得到:显式任务视图中的安全行为提供监督信号,用于从原始多轮轨迹中恢复分布式的安全证据。ReDiR 无需独立的动作级安全模块,即可在生成过程中直接整合跨轮安全信息。作者在三个模型家族、八个保留工具域的两个智能体安全基准上进行评估,结果表明 ReDiR 将攻击成功率降至 8% 以下,能够迁移到未见过的工具域,同时保持良性的保真度并引入较低的计算开销。这篇论文面向 LLM 智能体安全研究者和安全防御工程师,提供了一种轻量级、生成阶段即可生效的防护思路。

💡 推荐理由: 该工作解决了多轮工具调用智能体难以检测分布式恶意意图的痛点,提供生成时轻量防御,且不依赖外部安全模块,适合集成到现有智能体系统中以降低跨轮攻击风险。

🎯 建议动作: 研究跟进,评估该方法在自身智能体业务场景中的适用性与额外的安全收益。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)