#llm-agent-security

共收录 8 条相关安全情报。

← 返回所有主题
👥 作者: Dylan Girrens, Guangjing Wang

本文针对大型语言模型(LLM)智能体在跨查询持久化场景下的安全威胁,提出了一种名为 SPA 的“计划优先”架构。研究背景是:现有防御通常只保护规划阶段或单个工具交互,但持久化智能体面临更广泛的攻击面——攻击者控制的数据可能改变控制流、进入安全敏感的工具参数,或影响后续查询。为此,SPA 在每个查询中仅调用一次规划器,生成声明式领域特定语言(DSL)的完整可执行计划,并采用双格信息流控制(dual-lattice IFC)来跟踪显式数据流和控制依赖上的机密性与完整性。为支持持久化且避免将不可信负载重新暴露给规划器,SPA 将执行结果存储为带标签的工件,并在后续规划时仅揭示语义元数据。作者在 AgentDojo 及其扩展的 AgentDojo-MQ(用于衡量安全状态复用和延迟攻击的多查询数据集)上进行了评估。在“tool_knowledge”攻击下,SPA 配合信息流控制将攻击成功率在 AgentDojo 上降至 0%,在 AgentDojo-MQ 上降至 0.2%。实验表明,计划优先执行与保留标签的持久化机制可显著增强持久化 LLM 智能体的安全性,同时也揭示了严格完整性执行带来的安全-效用权衡。本文适合关注 LLM 智能体安全、信息流控制、可信 AI 基础设施的研究人员和蓝队工程师阅读。

💡 推荐理由: 该研究直击持久化 LLM 智能体面临的关键安全盲区——跨查询状态污染与延迟攻击,提出的计划优先+信息流控制方案为构建安全代理架构提供了可量化验证的新范式,对防御 LLM 恶意网页/工具攻击具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Bohao Liao, Jingchao Wang, Qipeng Song, Jin Cao, Jieling Wang, Boyu Deng

本文提出 TraceGrant,一个面向网络化大语言模型(LLM)智能体的合同化安全治理框架。网络化 LLM 智能体从电子邮件、云存储、日历、交易平台和 Web 服务检索信息以完成多步骤任务,这些任务会产生持久的外部效应。合法执行所需的内容中可能同时包含间接提示注入,从而重定向工具调用、篡改敏感参数或破坏任务完成。现有防御主要约束不受信内容或单个工具调用,未能充分连接用户意图、运行时证据、实际效果和任务完成状态。TraceGrant 通过显式契约(Contract)在任务-效果生命周期内实施治理。执行前,从受信任的用户请求中建立任务-效果边界;执行中,被接受的证据只能实例化契约已授权的权限;执行后,根据实际工具结果验证任务完成情况。在固定基准设置下,针对949个 AgentDojo 和400个 Agent Security Bench 攻击案例,TraceGrant 记录零攻击成功,同时分别在77.32%和83.00%的攻击率下保持可用性。作者还通过白盒防御感知攻击、契约质量分析、阶段消融、定向压力测试和运行时开销测量进一步评估 TraceGrant。结果表明,TraceGrant 提供了一个统一的治理层,将受信任的用户意图、运行时证据、具体工具执行和经过验证的任务完成连接起来。该论文适合对 LLM 智能体安全、提示注入防御和形式化安全契约感兴趣的蓝队和安全研究人员阅读。

💡 推荐理由: 针对网络化 LLM 智能体的间接提示注入是当前实际风险,TraceGrant 通过显式契约将用户意图、运行时证据和任务验证统一治理,为构建可审计、可验证的智能体安全边界提供了新思路,值得防御方关注。

🎯 建议动作: 研究跟进:关注后续验证实现和可迁移性,评估是否可用于自身智能体安全架构

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

本文提出 ClawSentry,一个面向自主 LLM 智能体的渐进式多层安全监控网关。研究背景是:当 LLM 智能体从简单对话扩展到执行代码、读取本地文件、编排外部工具时,单个被恶意第三方技能劫持的智能体可能导致数据泄露、权限提升或级联破坏。作者认为智能体风险是渐进式的:风险可能出现在智能体控制循环的四个位置——技能准入、调用时意图、执行时效果、行动后后果;且一个被拒绝的危险目标可能通过不同的表面形式、工具或轮次重新出现。现有防护通常只针对单一生命周期边界或单个调用,存在局限性。基于这一威胁模型,ClawSentry 采用框架无关的架构,不修改智能体内部结构,通过 Agent Harness Protocol (AHP) 抽象将统一策略应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI。其核心机制包括:在技能包执行前,First-use Skill Package Review (FSPR) 在确定性证据下限下审计技能包,并将未解决案例升级到受限的只读智能体审查(位置 A);运行时采用三层渐进决策引擎——确定性 L1 层、规则锚定的 L2 语义审查器、和只读的 L3 证据寻求智能体——仅在残余歧义上消耗上下文审查;同时会话级反绕过机制可识别工具切换和改述重试(位置 B-C);行动后路径将高严重性证据非追溯地反馈到后续审查(位置 D)。实验结果显示:在 SkillInject 基准上使用 Codex/GPT-5.4,上下文攻击成功率(ASR)从 39.55% 降至 2.61%,而上下文任务成功率(TSR)仅从 83.78% 微降至 83.05%;在 SkillsSafety 基准的五个 Work Agent 上,ClawSentry 将 ASR 限制在 9.09%–15.03%(未防护时为 33.5%–49.7%),干净技能上的总体 TSR 保持在 98.7%。

💡 推荐理由: 针对 LLM 智能体被恶意技能劫持的威胁,提供了覆盖全生命周期的渐进式防御框架,且无需修改智能体内部,对实际部署具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jong Wook Kim, Byoungjae Min, Kennedy Edemacu, Yoonhyuk Choi, Sae-Hong Cho, Beakcheol Jang

本文针对长期记忆型大语言模型(LLM)代理中的隐私泄露问题展开研究。作者指出,虽然用户从未明确陈述受保护属性(如健康状况、政治倾向等),但代理在多次交互中基于长期记忆生成的条件响应,可能累积性地泄露这些属性。作者将该威胁形式化为“自适应转录隐私”(adaptive transcript privacy),即攻击者通过观察整个交互转录,不断调整先验信念,最终推断出敏感属性。为缓解这一风险,论文提出 DP-MemView——一个面向内存接口的差分隐私层,其核心思想是:不把原始记忆直接暴露给响应 LLM,而是通过一个受差分隐私保护的“视图选择”机制,仅向响应模型提供用于生成公开响应的条件视图。每个视图选择都会针对其读取集合所覆盖的每个受保护属性组进行“记账”(即扣除隐私预算);每个属性账本一旦超过预置上限,后续相关选择会被阻止,并返回一个固定的通用视图,从而在机制上限制累积泄露。作者在显式接口契约下证明了整个自适应转录满足纯 B_a-DP(一种针对贝叶斯攻击者的差分隐私变体),并将结论扩展到多个受保护组存在差异的存储场景,同时给出了观测转录对攻击者先验几率改变的上界。实验部分使用三个不同的响应 LLM,在受控的相邻存储基准和公共语料迁移测试上进行评估,验证了在线与预分配两种模式。结果表明,两种模式都能将转录可分性压低到接近随机猜测,同时保持目标所需的个性化和整体响应质量。进一步的诊断实验显示,若移除关键保护机制(如账本计费、视图约束等),会导致输出支持不匹配、缺失账本计费、暴露侧信道或产生长程泄露累积。总体而言,该工作为长期记忆 LLM 代理提供了一种可证明隐私保障的接口设计,对隐私保护型代理系统的开发具有重要参考价值。

💡 推荐理由: 长期记忆 LLM 代理的隐私泄露是现实且难以察觉的风险;本文首次将差分隐私引入记忆视图接口,为在保持个性化能力的同时提供可证明的隐私保证提供了新思路,对安全工程师设计隐私合规的智能代理有直接启发。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Ismail Hossain, Sai Puppala, Md Jahangir Alam, Tanzim Ahad, Sajedul Talukder

随着开源LLM(大语言模型)智能体生态系统的迅速发展,社区贡献的“技能”(即模块化工具定义,用于扩展智能体能力)的安全性普遍缺乏审查。现有安全扫描器仅在代码层运行,对于指令层和多智能体层面的风险——例如通过自然语言指令劫持智能体、通过编码侧信道窃取数据、或跨管道链式危害——在结构上存在盲区。因此,需要一个语义化的、多维度的审查系统,而非另一个签名匹配器。本文提出了SKILLVETBENCH——一个托管在Hugging Face上的实时公共排行榜,利用LLM作为裁判来审查智能体技能。其核心创新是SARS(技能代理风险评分),一个五维代理风险度量,并针对指令遵循系统设计了带权重的计算公式。系统集成了完整的CVSS v4.0向量分解以及ClawHub双视图,将LLM生成的审查结果与官方市场裁定并列展示。实验表明,在78个已确认的恶意技能和22个良性对照上,LLM作为裁判阶段实现了零假阴性和零假阳性;而最佳静态基线SKILLSIEVE仍漏报15%。对于指令层类别(如提示注入和记忆投毒),传统工具漏报了89%至100%的威胁(例如CODEBERT未能检测出9个记忆投毒技能中的任何一个)。四个不同的LLM评估者的检测率从35%到95%不等,这促使在生产部署中采用集成评分以提升可靠性。该工作为开源智能体技能的安全性提供了一个自动化、可扩展的评估基准,对智能体生态的安全治理具有重要参考价值。

💡 推荐理由: 该研究直接针对LLM智能体生态中技能安全审查的空白,尤其是现有工具无法处理的指令层攻击,提供了一种基于LLM的自动化评估方法,对于保障智能体应用的安全至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Faruk Alpay, Taylan Alpay

该论文提出了 AgentSecBench,一个用于系统性评估大型语言模型(LLM)代理安全性的实证基准框架。LLM 代理在处理可信指令、检索记录和工具观测时,所有信息均通过同一个生成通道,导致数据流与权限混淆:即使应用策略未授权,不受信任的字符串也可能影响包含机密的响应或操作提议。AgentSecBench 基于一个形式化安全框架,定义了三个安全博弈:指令完整性、检索机密性和能力完整性,统一在“意图到执行无干扰”概念下,并允许特定的可泄露信息。该框架将应用策略表示为对授权观测和能力的投影,区分提示标注与强制投影,并衡量对抗优势以及防御是否在生成前关闭相关的模型可见通道。实验采用了精确标记(exact-marker)的方法,作为博弈的一种可观测实例,而非完整的语义安全声明,测试了泄露和禁止动作区分器,具有明确的真值基准。作者使用 Qwen3-0.6B 和 Qwen3-1.7B 模型,对六类防御方法进行了配对对抗性和良性控制执行实验。测量结果表明,当通道关闭时风险降低,但模型可见的对抗能力在某些情况下仍然可利用。最终成果是一种面向安全的评估方法:提示文本可以描述边界,而来源投影、能力限制和输出验证可以强制实施边界。该研究为 LLM 代理的安全评估提供了可量化的方法论,适合安全研究人员和 LLM 应用开发者阅读。

💡 推荐理由: LLM代理在实际应用中面临提示注入、隐私泄露和工具滥用等严重威胁,现有评估缺乏统一框架。AgentSecBench提供了可量化的安全评估方法论,能帮助防御者识别代理系统的薄弱环节,推动更安全的代理设计。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Pengyu Sun, Qishu Jin, Enhao Huang, Zifeng Kang, Xin Liu, Dakun Shen, Song Li

本文提出了VIPER-MCP,这是首个针对MCP(模型上下文协议)服务器的端到端自动化漏洞审计框架。MCP已成为连接LLM代理与外部工具的标准接口,由于MCP服务器暴露特权操作(如shell执行、网络访问、文件系统操作),其工具处理程序中的实现缺陷可导致从自然语言输入到安全敏感接收器的直接路径,进而引发远程代码执行或系统完全沦陷。现有方法要么产生未经验证的静态告警,要么依赖缺乏代码级指导的固定模板库,无法触发需要特定参数形状或多步污染路径的漏洞。VIPER-MCP引入两种新技术:(1)两遍静态分析中的锚点-查询遍,通过函数级结构上下文增强标准污染告警,将文件级静态工件解析为具体的MCP工具处理程序,并生成以漏洞为锚点的调用链;(2)反馈驱动的提示进化机制,采用双变异器调度,独立校正工具选择漂移并加深参数渗透,结合适应度评分的种子选择,迭代优化自然语言提示以触发漏洞。在39884个真实开源MCP服务器仓库的大规模扫描中,VIPER-MCP发现了106个0-day漏洞,均通过端到端利用轨迹确认,迄今已分配67个CVE ID。所有发现的漏洞均已负责任地披露给受影响的开发者,并协调CVE分配。

💡 推荐理由: MCP正成为LLM代理生态的关键组件,其安全漏洞可能被攻击者利用自然语言提示远程控制主机。VIPER-MCP提供了首个自动化审计方案,可帮助防御者提前发现并修补此类高危漏洞。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Leo Linqian Gan, Jeffery Wu, Longyuan Ge, Lanqing Yang, Yonghao Song, Jingkai Zhang, Haojia Jin, Weiyi Wang, Guangtao Xue

本文针对自主LLM智能体面临的工作流劫持安全风险提出了一种新颖的被动式、带外检测方法。工作流劫持指攻击者在不被发现的情况下微妙地修改智能体调用的工具和技能,而现有防御依赖主机内部遥测(如审计日志),一旦主机操作系统被攻破,这些日志可以被伪造,失去可信度。为了解决这一问题,作者提出了ClawGuard系统,它利用电磁(EM)辐射作为侧信道,以物理方式独立于主机环境监测智能体工作流。其核心洞察在于:不同的智能体技能会产生独特的硬件使用模式(如计算、DRAM、网络阻塞),从而辐射出可测量的大尺度电磁包络。ClawGuard使用外部软件无线电(SDR)捕获这些物理信号,并通过一个漂移感知的管道将RF流转换为物理证据,该管道提取320维特征进行分类。在7.82TB的RF语料库上评估,ClawGuard达到了0.9945的AUC,攻击检测真阳性率100%,假阳性率仅1.16%。实验证明了被动电磁感知是一种实用、抗伪造的物理校验手段,能够有效对抗被攻陷主机软件的攻击。

💡 推荐理由: 现有LLM智能体安全检测依赖主机内部日志,一旦主机沦陷则防御失效。ClawGuard通过电磁侧信道提供物理层独立验证,为蓝队提供了一种无法被攻击者篡改的外部队列检测能力,显著提升了工作流劫持检测的可信度。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)