#agent

共收录 10 条相关安全情报。

← 返回所有主题
👥 作者: Kevin Chuanpu Fu, Yongsen Zheng, Zee Kin Yeong, Kwok-Yan Lam

VeriScene 提出将世界模型用于法医场景重建,以解决原始多模态证据直接输入世界模型时产生的证据遗漏、证词矛盾被忽略以及生成运动不符合证据记录等问题。该模型以智能体方式编排世界模型,接收法医照片和可靠性不一的证人陈述作为输入,通过“引用叙事融合—审计循环—探测回放—约束注入”的流程,将每条主张与具体证据关联,并利用世界模型的物理规律对假设的动态过程进行验证,最终从融合关键帧渲染出犯罪行为重演视频。实验基于25个犯罪场景、7种物理驱动的案件类型、139张法医风格照片和65份人为植入不可靠性的陈述,在20个测试场景上取得0.9014的证据覆盖率与0.7217的事实一致性(0-1分制),相比端到端多模态大语言模型基线,事实一致性提升20.35%,时间连贯性提升34.88%,且可在四种LLM编排后端上泛化,单场景成本约1.82美元。研究展示了如何将可信约束、人类审计和生成模型结合,为需高可靠性的多模态推理任务提供了新范式。

💡 推荐理由: 该研究对安全与取证调查具有借鉴意义:通过证据追溯和物理约束校验,降低生成式AI在关键推理任务中的不可信风险,可迁移至事件重建、威胁现场还原等需要可解释与可验证输出的蓝队分析场景。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

本文针对工具型大语言模型(LLM)智能体在多轮交互中的安全风险提出了一种新的防御方法。传统安全防护主要关注生成文本中的恶意内容,但工具型智能体能够执行影响外部系统的动作,安全风险范围因此扩展至动作序列。多轮分解攻击(multi-turn decomposition attacks)将有害目标拆解到多个单独看似合理的请求和工具调用中,只有从累计的交互轨迹中才能显现真实意图。现有的防御方法要么依赖额外的在线推理来恢复长期安全证据,要么在动作生成后再评估,导致推理成本增加或依赖特定运行时的动作表示。为此,作者提出生成时防御方法 ReDiR(Reassembling Distributed Risk),在动作生成之前,将当前轨迹压缩为紧凑的潜在安全表示,并将其注入冻结的基础模型。该表示通过同一模型的跨视图监督学习得到:显式任务视图中的安全行为提供监督信号,用于从原始多轮轨迹中恢复分布式的安全证据。ReDiR 无需独立的动作级安全模块,即可在生成过程中直接整合跨轮安全信息。作者在三个模型家族、八个保留工具域的两个智能体安全基准上进行评估,结果表明 ReDiR 将攻击成功率降至 8% 以下,能够迁移到未见过的工具域,同时保持良性的保真度并引入较低的计算开销。这篇论文面向 LLM 智能体安全研究者和安全防御工程师,提供了一种轻量级、生成阶段即可生效的防护思路。

💡 推荐理由: 该工作解决了多轮工具调用智能体难以检测分布式恶意意图的痛点,提供生成时轻量防御,且不依赖外部安全模块,适合集成到现有智能体系统中以降低跨轮攻击风险。

🎯 建议动作: 研究跟进,评估该方法在自身智能体业务场景中的适用性与额外的安全收益。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Hanlin Jiang, Jionghao Huang, Shaofei Li, Bojia Yu, Peng Jiang, Yuxin Ren, Ning Jia, Yao Guo, Ding Li

事件响应规划(Incident Response Planning)是网络攻击后恢复受损系统的关键环节。传统上依赖专家编写的剧本(playbook),但这些静态工作流难以适应不断变化的事件状态、恢复目标和执行反馈。近年来,基于大语言模型(LLM)的规划器和工具使用代理虽能提升自动化程度,但在长周期响应中仍不稳定,原因是缺乏统一的基础设施来维护事件状态、将行动与当前恢复阶段对齐,以及复用历史经验。为此,作者提出 STAIR——一个端到端的代理式规划框架,专门面向事件响应。STAIR 将当前事件状态建模为“图即状态”(Graph-as-State),通过“阶段路由器”(Stage Router)将规划任务分发到针对特定恢复阶段优化的代理,并从历史经验库中检索相似场景以指导动作选择。此外,框架中的“执行引擎”(Execution Harness)负责执行动作、收集反馈以更新事件状态,并验证动作效果以便将来复用。在 100 个基于 Docker 的网络靶场实验中,STAIR 取得了 0.94 的归一化防御分数,比最强基线提升了 9.5%。这项研究适用于安全运营中心(SOC)分析人员、安全工程师以及关注 LLM 自主代理的研究者,尤其是那些希望将静态响应预案升级为动态自适应流程的团队。

💡 推荐理由: 该工作将事件状态图与阶段专用代理结合,实现端到端事件响应规划,展示了 LLM 代理在动态、多阶段安全任务上的可行性,为自动化响应提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yiming Zhang, Jiangrong Wu, Yuhong Nan

该论文针对Android应用隐私与安全审计中数据流分析任务存在的重复分析成本问题,提出了一种基于知识复用的系统性解决方案FlowArk。在批处理模式下,多个代理实例分别处理不同的污点源到汇点的数据流分析任务,但由于代码复用导致不同数据流路径共享相同代码片段,传统方法中相互隔离的代理实例会重复分析这些共享代码,浪费API预算并限制可扩展性。FlowArk通过将已完成分析的历史知识蒸馏为可复用的知识候选,并封装成可匹配的知识条目,在后续代理实例的上下文中注入匹配的知识,从而避免重复分析。实验在50个开源Android应用的4,685个数据流分析任务上评估,基于OpenCode实现。结果表明,FlowArk在保持相似分析质量的同时,将端到端API成本降低26.83%,且在100美元预算下完成的任务数比标准OpenCode多36.66%(1060 vs 776)。该工作为大规模自动化数据流分析的高效部署提供了新思路。

💡 推荐理由: 该研究直接降低了安全分析工具运行成本,提升批量审计效率,有助于实现更广泛、更频繁的Android应用隐私合规检查。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xingzhi Qian, Xinran Zheng, Yiling He, Lorenzo Cavallaro

该论文提出了一种名为 Malaika 的多智能体框架,用于解决恶意软件理解中的核心挑战:如何在部分可观测性下,从稀疏、分散的代码证据中重建高级恶意行为,并与良性功能区分。作者将恶意软件理解形式化为一个基于证据的推理问题,并主张可靠的行为重建需要三种互补的接地:领域接地(约束假设生成与评估)、语义接地(定位并连接程序证据)、知识接地(通过外部可验证威胁知识支持行为归因)。Malaika 框架通过模拟分析师的推理过程、工具辅助的证据定位和基于检索的行为归因来实现这三种机制,并在 Android 恶意软件分析任务上进行了评估。结果显示,Malaika 在分析质量上优于先前的基于 LLM 的恶意软件分析框架,并表明可靠性不仅依赖于模型能力,还依赖于推理过程。与恶意软件分析系统和前沿智能体框架的对比表明,接地感知推理能产生更精确、可审计的结论。消融研究进一步支持了接地假设。该工作为可靠恶意软件理解提供了原则性基础,并更广泛地适用于基于证据的软件分析。

💡 推荐理由: 该研究为利用 LLM 进行恶意软件分析提供了可解释、可审计的推理框架,有助于分析师高效定位恶意行为证据并形成可信结论,提升自动化分析可靠性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nada Lahjouji, Ashwin Gerard Colaco

大型语言模型(LLM)智能体越来越多地用于查询数据库、检索文档集合、调用外部API、记忆过往交互并代表用户执行操作。随着其应用从简单的问答扩展到处理敏感数据,隐私保护变得更加困难。智能体涉及多个数据源、运行多步工作流、跨会话保持状态,并拥有委托权限。因此,敏感信息不仅可能通过最终答案泄露,还可能通过其发出的查询、处理的中间结果、写入的记忆以及与其他智能体交换的消息泄露。本文从数据为中心的角度对LLM智能体的隐私问题进行综述,围绕智能体接触的数据组织研究领域,而非按攻击类型分类,并使用“数据智能体”作为处理数据的LLM智能体的简称。关于这些风险的研究很活跃但分散在检索增强生成、文本到SQL接口、智能体记忆、提示注入、访问控制和上下文隐私等领域。该综述将这些工作整合在一起:对智能体接触的数据源、每个数据源产生的隐私风险以及应对这些风险的治理机制进行了分类;绘制了用于衡量这些风险的基准图并指出了缺失之处;提出了开放问题。两个发现反复出现:在治理机制中,只有信息流控制同时覆盖了组合性推理泄漏和跨会话推理泄漏,这是两个保护最不充分的风险;并且没有基准能在单一隐私策略下驱动智能体跨越其数据表面,这是该领域最缺乏的工具。目标是提供一个可定位分散文献的参考,并为未来工作提供统一的框架。

💡 推荐理由: LLM智能体在数据密集型应用中的隐私风险日益突出,但相关研究分散。本文首次系统性地从数据视角梳理隐私问题,为安全从业者提供了全面的风险分类和治理机制参考。

🎯 建议动作: 阅读并参考其分类框架

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhen Xu, Zihao Wang, Yuhua Sun, XiaoFeng Wang

本文针对侧信道分析领域长期存在的挑战——手动分析效率低、依赖预定义目标事件和已知信道、难以规模化——提出了一种名为SCAgent的自动化框架。该框架利用LLM(大型语言模型)驱动的智能体,通过系统探索自动识别敏感事件(如用户或系统行为),避免手动指定;同时,为缓解LLM幻觉,SCAgent基于系统文档进行推理并引入显式验证机制,确保语义一致性、威胁模型可行性和信道可用性。在数据分析方面,采用基于基础模型的少样本学习,避免为每个信道-事件对训练定制模型;并引入时间平移鲁棒的特征提取层,将原始时间序列侧信道信号转换为表格基础模型可处理的形式,从而在有限数据下实现高效分析。作者以iOS系统为实例,重点研究非特权应用可观测的操作系统级侧信道。评估覆盖了标准基准(如前台应用和网站指纹识别)以及新识别出的流行应用中的敏感应用内活动,证明了框架的有效性和可扩展性。

💡 推荐理由: 该研究为侧信道分析提供了自动化、可扩展的解决方案,利用LLM智能体显著降低人工成本,有望提升OS级隐私风险发现效率。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
INFO
PAPER 2026-05-07

Stateful Agent Backdoor

推荐 5.5
Conf: 50%
👥 作者: Zhengchunmin Dai, Jiaxiong Tang, Liantao Wu, Peng Sun, Honglong Chen

该论文提出了一种针对基于大型语言模型(LLM)的智能体的有状态后门攻击方法。现有后门攻击在单个会话内执行固定行为,且攻击状态无法跨会话持久化。作者设计了一种有状态后门,通过持久化组件(如文件系统、数据库等)维护攻击状态,使得在一次触发注入后,攻击能够在多个会话中自主、增量地执行,即使这些会话处于权限隔离环境中。形式上,作者将攻击建模为Mealy机,并推导出分解框架,使得每个状态转换的数据可以独立构建。他们基于此框架实现了一个主要攻击实例和两种扩展变体(不同拓扑结构和持久化组件)。在四个主流LLM模型上的实验表明,主要攻击实例的成功率达到80%–95%,每转换分析验证了分解方法的有效性。扩展变体也展示了一致的效果。该研究揭示了LLM Agent在面对跨会话持久化后门时的脆弱性,对Agent安全防御具有警示意义。适合AI安全研究员、LLM应用开发者阅读。

💡 推荐理由: 该研究揭示了LLM Agent面临的新型持久化后门威胁,突破了传统单会话攻击的局限,对构建鲁棒的Agent安全防护具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Benjamin Probst, Andreas Happe, Jürgen Cito

本文针对本地部署的开源权重大语言模型(LLM)在自动化 Linux 权限提升攻击任务中性能不佳的问题,提出并验证了五种系统级和提示工程的干预方法,以弥补其与云模型(如 GPT-4o)之间的性能差距。研究首先分析了开源模型在自主权限提升中的失败模式,然后设计并实现了链式思考(CoT)、检索增强生成(RAG)、结构提示、历史压缩和反思分析五种干预措施,并将其集成到渗透测试框架 hackingBuddyGPT 中。通过全因子消融实验,在包含多种 Linux 漏洞的测试环境中评估了各干预措施的效果。结果表明,启用干预后,Llama3.1 70B 模型能够利用 83% 的测试漏洞,而较小的模型如 Llama3.1 8B 和 Qwen2.5 7B 在引导下也达到了 67%,均持平甚至超过了 GPT-4o 基线的性能。进一步分析发现,基于反思的干预贡献最大,同时漏洞发现仍是本地模型的瓶颈。该研究为红队自动化渗透测试工具的选型与优化提供了实证依据,表明通过恰当的增强策略,本地模型可以在保证数据隐私的前提下达到接近商业云模型的攻击能力。

💡 推荐理由: 该研究证明本地开源 LLM 通过简单干预即可在权限提升攻击中媲美云模型,为注重数据隐私的组织提供了低成本、高自主性的自动化渗透测试方案,同时揭示了当前本地模型的瓶颈,对红队工具研发和安全评估实践具有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)