#guardrails

共收录 11 条相关安全情报。

← 返回所有主题
👥 作者: Rahul Dev T Y, Hiran V Nath

该论文聚焦于 LLM 驱动的自主渗透测试代理(AI-powered pentesting agent)的安全性问题。这类代理与传统的对话式 LLM 存在本质差异:它们具备持久化记忆、可调用外部安全工具(扫描器、漏洞利用框架、后渗透工具等)、能够在真实环境中执行动作,并支持长周期(long-horizon)推理与多步规划。作者指出,正因为这些能力,代理可以自主完成侦察、漏洞识别、利用方案编排乃至后渗透操作,仅需极少人工监督,其安全风险也属"质变"级别——对话式 AI 的护栏机制(内容过滤、拒答、话题限制等)无法覆盖工具调用、记忆写入、跨会话持久化等新型攻击面。围绕这一问题,论文开展了一次系统性的安全分析:首先梳理若干具有代表性的自主渗透测试代理架构,刻画其组件构成与执行流程;其次明确各架构中的信任边界(trust boundaries)与攻击面(attack surfaces);随后提出一套与代理生命周期对齐的威胁分类体系(threat taxonomy),将威胁划分为 LLM 生命周期攻击、代理架构攻击以及横切性的行为攻击三大类;最后分析现有护栏机制在上述威胁面前的局限性,识别关键研究空白,并讨论未来的研究方向,即构建面向此类代理的、具备上下文感知与架构感知能力的专用护栏。论文整体属于威胁建模与研究议程性质的工作,其核心贡献是问题空间的结构化定义与分类框架,而非具体攻击实现或经验性评测数据。适合关注 LLM 代理安全、AI 红队工具治理、自动化渗透平台建设与合规评审的研究人员、安全架构师与 SOC 管理者阅读。

💡 推荐理由: 自主渗透测试代理正在被安全团队实际采用,但现有 LLM 护栏是为对话场景设计的,无法约束工具调用、持久记忆与长周期自主决策。论文给出的信任边界与威胁分类可作为评估、采购和加固此类代理的参考框架。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 16.5
Conf: 50%
👥 作者: Xunguang Wang, Zhenlan Ji, Wenxuan Wang 0001, Zongjie Li, Daoyuan Wu, Shuai Wang 0011

本文是一篇针对大语言模型(LLM)越狱防护机制的系统化知识(SoK)综述。研究背景在于:尽管LLM取得了显著进展,但其部署暴露了严重的安全漏洞,尤其是越狱攻击能够绕过模型的安全对齐机制。为应对这一威胁,防护栏(guardrails)——即用于监控和控制LLM交互的外部防御机制——已成为一种有前景的解决方案。然而,当前LLM防护栏的研究与实践呈现出碎片化状态,缺乏统一的分类体系和全面的评估框架。针对这一问题,本文首次对LLM越狱防护栏进行了整体性分析,提出了一种新的多维度分类法,沿六个关键维度对防护栏进行归类;同时引入了一个名为“安全-效率-效用”(Security-Efficiency-Utility)的评估框架,用于衡量防护栏在实际部署中的有效性。作者通过大量分析与实验,识别了现有防护栏方法的优势与局限,深入探讨了如何优化其防御机制,并检验了这些防护栏在不同攻击类型之间的通用性。本研究为后续研究与开发提供了结构化基础,旨在指导健壮LLM防护栏的原则性推进与部署。代码已开源:https://github.com/xunguangwang/SoK4JailbreakGuardrails。

💡 推荐理由: 为LLM安全防护栏的选型与设计提供了首个系统化分类和评估框架,帮助安全工程师建立对防护机制的全局认知,避免碎片化理解。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Pingyu Wu, Weiming Zhang, Nenghai Yu

本文针对大语言模型服务中维护防护机制的效果评估问题展开研究。当前业界通常以拒绝率、攻击成功率或违规率等指标来衡量防护本身的有效性,但这些指标仅反映防护在预定义测试请求集合上的表现,不能说明在实际部署环境中,面对持续适应攻击方式的对手,服务仍可能提供多少“有助害任务”的功能。论文提出以系统部署安全性为统一的评估判据,将“防护是否降低了部署后的残余危害”作为比较不同防护族的基准。为此,作者指出在证据要求上存在明显的不对称性:只要能够观察到一次通过部署系统的成功攻击,就足以证明残余危害存在,而此类攻击在编码记录中很容易出现;但若要证明残余危害极小,仅依赖防护自身的评分记录是不够的,必须提供防护运行后系统其他部分仍然允许发生的行为的证据。作者对相关文献中的声明进行深度编码和分析,发现只有少数声明符合这种系统级证据标准,其中仅有一个声明能够给出有界的残余风险边界。基于此,论文批评了单纯追逐更高本地分数的做法,认为没有部署级有效性的验证,则任何“防护生效”的结论都只是局限于特定测试集的有界陈述。研究贡献主要包括:提出以部署安全为共同分母的防护评估视角、揭示评估证据的不对称结构、匡正了当前关于“分数提升 = 系统更安全”的默认假设,并使未来研究聚焦于真实系统层面的修复与验证。该工作适合LLM安全研究员、安全测试工程师、模型治理人员阅读。

💡 推荐理由: 该论文挑战了业界仅看防护本地指标的做法。提醒安全团队:高拦截率不代表整个 LLM 系统更安全,攻击者可通过改变攻击或利用其他功能绕过防护。值得所有评估和红队人员了解,因为它可能改变安全测试设计准则。

🎯 建议动作: 建议阅读全文并开展方法论验证;如适用,将部署判据引入现有 LLM 安全评估清单。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
INFO
PAPER 2026-08-31

SingProbe Technical Report

推荐 5.5
Conf: 50%
👥 作者: Sing Team

大型语言模型(LLM)在生产环境中的可靠部署高度依赖运行时安全防护栏(runtime guardrails)。然而,现有防护方案大多采用独立的外部模型,不仅带来额外的推理开销,还会延迟安全信号并难以跟上基础模型能力的快速演进。为应对上述挑战,本文提出SingProbe——一种轻量级的内在运行时防护机制,它直接复用LLM在自回归解码进程中产生的隐藏状态(hidden states),在不影响原模型推理流程的前提下,随解码过程同步进行实时安全评估。SingProbe在统一框架中连续执行三类逐token预测:查询意图(query intent)、响应安全性(response safety)和幻觉风险(hallucination risk),其额外防护推理开销极小,被作者称为“免费午餐”方案。为了验证流式防护的有效性,论文还构建了SingStreamBench基准,专门考察防护拦在良性前缀上是否保持静默,同时能及时捕捉新出现的不安全内容。实验表明,SingProbe仅需约200万参数,附加开销低于0.5%,即可达到或超过体积远为庞大的独立防护模型和专业幻觉检测器的性能。除被动检测外,SingProbe生成的风险分数还可以用于预测后续生成内容的风险程度,并指导受约束的安全解码,从源头规避潜在问题。论文进一步将该范式扩展至医疗文本生成任务(SingProbe-Med),根据临床风险的出现情况有选择地触发干预措施。综合来看,这项工作表明LLM内部表示能够为生成过程的监控和控制提供一个高效且有表现力的接口,对未来构建低延迟、低成本的运行时安全体系具有重要参考价值。

💡 推荐理由: 为LLM应用提供了一种几乎零附加成本的实时防护思路,可同时检测不安全内容、幻觉与恶意意图,有望降低安全防护的部署门槛和运行开销,助推大规模安全推理落地。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yingjie Zhang, Yuanbo Xie, Kai Chen

该论文聚焦于 LLM 代理系统中的护栏(guardrails)过度安全(over-safety)问题。护栏在 LLM 执行每个操作前进行批准或拒绝,然而它们有时会拒绝本应安全的授权操作,这种过度保守的行为会阻碍系统在真实场景中的部署。论文指出,评估过度安全十分困难:在授权与非授权行为的边界上,两者看起来相似,且安全与否的标签取决于授权策略的选择,并非仅由操作本身决定。因此,现有基准无法映射一个理想护栏应有的决策边界。为了填补这一空白,作者构建了 Cautious Bench——首个专门将过度安全作为代理护栏核心评估对象的基准。该基准将每个样本与明确的授权策略共同设计,并通过构建时门控机制重新推导每个示例来保证标签的正确性,使标签成为策略的机械推论而非人工标注的个人判断。基准包含 756 个可判定的良性/孪生样本对,每个对在三种对象名称类型下变体,合计 2268 个测量对,另有 40 个不可判定对单独报告。作者测量了来自五种设计的六个护栏,发现一种“名字迷信”效应:当对象名称显得可怕时,护栏对授权操作的拒绝率明显高于使用良性名称时。由于对比实验中仅改变了对象名称,这表明护栏读取的是表面标签而非授权上下文。该研究提供了首个系统的过度安全基准,并揭示了护栏决策中的偏差,为设计更可靠的代理防护机制提供了重要参考。

💡 推荐理由: LLM 代理正在承担越来越多的自动化操作,护栏的过度安全会误拒绝合法请求,导致不可用甚至业务中断。Cautious Bench 为评估护栏的过度安全提供了首个系统化工具,有助于安全团队发现和修正此类偏差,提升代理系统的可用性与可靠性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

本文提出 ClawSentry,一个面向自主 LLM 智能体的渐进式多层安全监控网关。研究背景是:当 LLM 智能体从简单对话扩展到执行代码、读取本地文件、编排外部工具时,单个被恶意第三方技能劫持的智能体可能导致数据泄露、权限提升或级联破坏。作者认为智能体风险是渐进式的:风险可能出现在智能体控制循环的四个位置——技能准入、调用时意图、执行时效果、行动后后果;且一个被拒绝的危险目标可能通过不同的表面形式、工具或轮次重新出现。现有防护通常只针对单一生命周期边界或单个调用,存在局限性。基于这一威胁模型,ClawSentry 采用框架无关的架构,不修改智能体内部结构,通过 Agent Harness Protocol (AHP) 抽象将统一策略应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI。其核心机制包括:在技能包执行前,First-use Skill Package Review (FSPR) 在确定性证据下限下审计技能包,并将未解决案例升级到受限的只读智能体审查(位置 A);运行时采用三层渐进决策引擎——确定性 L1 层、规则锚定的 L2 语义审查器、和只读的 L3 证据寻求智能体——仅在残余歧义上消耗上下文审查;同时会话级反绕过机制可识别工具切换和改述重试(位置 B-C);行动后路径将高严重性证据非追溯地反馈到后续审查(位置 D)。实验结果显示:在 SkillInject 基准上使用 Codex/GPT-5.4,上下文攻击成功率(ASR)从 39.55% 降至 2.61%,而上下文任务成功率(TSR)仅从 83.78% 微降至 83.05%;在 SkillsSafety 基准的五个 Work Agent 上,ClawSentry 将 ASR 限制在 9.09%–15.03%(未防护时为 33.5%–49.7%),干净技能上的总体 TSR 保持在 98.7%。

💡 推荐理由: 针对 LLM 智能体被恶意技能劫持的威胁,提供了覆盖全生命周期的渐进式防御框架,且无需修改智能体内部,对实际部署具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ted Kwartler, Alan Aqrawi, Arian Abbasi

本文研究了长期运行的智能体(agent)在上下文压缩(context compaction)过程中,安全护栏(safety guardrail)如何因单一周期的自我摘要(self-summarization)而失效。长期智能体通常需要周期性地压缩上下文,将原始对话记录替换为模型生成的摘要。近期研究(Governance Decay,Chen 2026)表明,在压缩过程中丢弃持续性的安全约束会导致多种模型出现行为违规。本文则聚焦于更细粒度的问题:在单一压缩周期内,一条安全规则是如何被丢失的,以及这对检测与评估有何意义。核心发现是:存在性检查(presence check)并不等同于安全性检查(safety check)。当压缩过程并未彻底丢弃一条规则时,常常会留下一个“看起来像规则但行为上不像规则”的退化残留(degraded residue)。在行为回放(behavioral replay)测试中,这种残留会导致模型执行被禁止行为的频率远高于完整焊接(intact welded)的规则;在两种回放模型下,全场景差异分别达到+34分和+57分(均为正向)。类别级(category-level)的存活表现类似于残留,甚至完整的规则有时也无法触发(fail to fire),因此仅检查文本存在的审计会产生虚假的安全感。进一步的分析表明,规则形式(rule-form)的条目比显著性匹配的事实(prominence-matched facts)被保留的频率高得多——这正是为什么基于存在性的检查会让人觉得足够,尽管“存活”并不等于“受到保护”。文本丢失的模式是依场景而定的:在单一规则下表现为“焊接或丢弃”(weld-or-drop),在更紧的预算下则表现为退化的谓词丢失(predicate-loss residues);本研究未观察到假设中的文本切断(textual severing)模式。这种丢失在运行时是静默的,只有通过与保留的外部地面真值(如约束注册表)进行比较才能发现,而这种比较只能揭示文本缺失,无法判断存活的规则是否仍能触发。本文还记录了评估陷阱:若仅依赖LLM裁判的标签,会得出相反的结论。所有实验结果均针对单个压缩周期。

💡 推荐理由: 该研究揭示了现有护栏审计方法的盲区——仅检查规则文字是否保留会给出虚假安全感,而退化残留可能在运行时静默地导致违规。对依赖上下文压缩的长期智能体安全评估具有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shuo Shi, Rui Yin, Naen Xu, Jiahao Chen, Chunyi Zhou, Tianyu Du, Zhihui Fu, Jun Wang, Zhaoxiang Wang, Shouling Ji

该论文首次系统性地研究了多模态安全护栏模型(multimodal guard models)中的一种新型对抗威胁——“不安全诱导攻击”(Unsafe Induction Attacks)。与以往关注越狱攻击(产生假阴性,即放行恶意内容)不同,该攻击旨在诱导安全过滤器对良性输入产生假阳性,即错误地将安全图像判定为不安全内容,从而拒绝合法用户请求。作者将这种现象类比为“狼来了”效应,指出其会严重降低服务可用性并侵蚀用户信任,揭示了已部署安全过滤器的一种可用性故障模式。为了实现这一威胁,论文提出了一种名为“不安全语义蒸馏”(Unsafe Semantic Distillation, USD)的方法,该方法不针对具体提示词实例,而是将对抗扰动与不安全内容的分布式表征对齐,从而在多样化的用户提示下仍能高效触发误判。作者在四个最先进的安全护栏模型上进行了评估,并模拟了真实的用户交互场景。实验结果表明,USD 的攻击成功率高达 84%,显著优于现有方法,暴露了当前多模态安全架构中的根本性弱点。该研究为多模态内容安全评估提供了新视角,强调安全护栏不仅要防恶意绕过,也要防恶意误报,对防御者设计健壮的安全过滤机制具有重要参考价值。适合关注大模型安全、红队评估、可用性攻击及对抗机器学习的研究人员和工程师阅读。

💡 推荐理由: 该攻击颠覆了传统越狱方向的关注点,揭示安全护栏可能被利用来拒绝合法请求,造成服务拒绝和信任危机,是防御者必须正视的新型可用性风险。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: SingGuard Team

本文介绍了SingGuard-NSFA,一个面向Agentic AI系统的安全护栏框架,旨在防御提示注入、敏感信息提取、恶意代码请求、危险工具滥用和资源耗尽等操作威胁。首先,作者提出了NSFA分类法,将185种风险变体组织成基于CIA三元组(机密性、完整性、可用性)的层次结构,并与三个成熟的OWASP指南进行了交叉验证。基于该分类法,他们构建了一个覆盖133种语言的基准测试套件,包含超过93K个针对用户查询和代理响应的专门样本,以及从五个公开的代理安全数据集中改编的3,435个跨来源样本。为了实际检测这些操作威胁,他们开发了双模式方法:基于SFT的生成式推理用于可解释的离线审计,以及在冻结骨干网络上使用判别式分类头用于实时检测(约50毫秒)。他们发布了四个模型(0.8B、2B、4B和9B参数),在专门基准测试上均达到≥94%的F1分数,比最强的竞争护栏高出6到12个绝对百分点。在跨来源评估中,9B模型达到了91.29%的F1分数,且精确率-召回率权衡更平衡。此外,消融实验表明,分类头可以使护栏获得超出其原始范围的风险检测能力,并达到最先进的性能。这些结果证明了方法的可扩展性以及作为即插即用增强的通用性。

💡 推荐理由: 随着Agentic AI在自动化决策中的广泛应用,操作威胁如提示注入和工具滥用日益突出。本工作提供了系统化的威胁分类、大规模多语言基准以及高效的混合检测方法,显著提升了护栏的准确性和可解释性,对AI安全运营具有直接实用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Paulo Ricardo Ferreira Neves, Edson Rodrigues da Cruz Filho, Paulo Henrique Eleuterio Falsetti, João Vitor Pavan, Ian Degaspari, Henrique Vieira Laturrague, Patrick Vieira Laturrague, Guilherme Nielsen Dias, Marccello Wilson Perez Berto, Gustavo Voltani Von Atzingen

大型语言模型(LLM)在自然语言处理任务中展现出强大能力,但易受提示注入(PI)和越狱(JB)攻击。此外,现有基准评估可能受到数据污染和部分信息泄露的影响,导致性能估计不可靠。本文提出 GuardNet——一种基于浅层神经网络(BiLSTM)集成(ensemble)的护栏系统,模型参数量约 4700 万。作者假设在对抗场景中,鲁棒性更多依赖于示例覆盖的多样性和阈值校准,而非模型规模。实验结果表明,GuardNet 在盲测 JBB-Behaviors 基准上达到 AUROC=0.747(n=200),在专有基准上(n=50)F1 分数为 0.92,且通过阈值校准和声明部分信息泄露的评估实现。系统在 CPU 上平均延迟约 50 毫秒,适合在成本和基础设施受限的生产环境中部署。尽管与 Mistral-7B 和 Llama-3.1-8B 等大型 LLM 相比,GuardNet 在 F1 和 AUROC 上仍有差距(后者性能更优),但 GuardNet 提供了轻量级、高效的防护方案,为实际部署提供可行选择。

💡 推荐理由: GuardNet 展示了轻量级神经网络集成在对抗提示注入和越狱攻击中的潜力,为资源受限环境下的 LLM 安全防护提供了实际可部署的方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis, Bharath Chandrasekhar, Kyomin Jung, Tomas Pfister, Long T. Le

本文提出了 LiSA (Lifelong Safety Adaptation) 框架,旨在解决 AI Agent 部署后的安全护栏适应性问题。随着 AI Agent 从聊天界面扩展到读取私有数据、调用工具和执行多步骤工作流,护栏失效的后果不再是单纯的回答质量错误,可能引发秘密泄露、危险操作授权或阻碍合法工作。最棘手的失效往往是上下文相关的:一个行为是否可接受取决于当地的隐私规范、组织策略和用户期望,而这些很难在部署前完全指定。这造成了实际差距:护栏需要适应其运行环境,但部署反馈通常仅限于稀疏且带有噪声的用户报告,且重复微调往往不切实际。为此,LiSA 通过结构化记忆改进固定基础护栏。LiSA 将偶发失效转化为可复用的策略抽象,使稀疏报告能够泛化到个别案例之外;引入冲突感知的局部规则以防止混合标签上下文中的过度泛化;并通过后验下界应用证据感知的置信门控,使得记忆复用的规模随积累的证据而非单纯的经验准确性增长。在 PrivacyLens+、ConFaide+ 和 AgentHarm 三个基准上,LiSA 在稀疏反馈条件下一致优于强记忆基线,即使在 20% 的标签翻转率噪声下依然稳健,并将延迟-性能边界推至超过骨干模型缩放的效果。总之,LiSA 为确保 AI Agent 免受现实世界边缘风险的长尾问题提供了实用路径。

💡 推荐理由: AI Agent 的安全护栏必须动态适应运行环境,但部署后反馈稀疏且噪声大。LiSA 提供了一种无需频繁微调即可持续改进护栏的方法,解决了护栏在复杂真实场景下的泛化与鲁棒性难题。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)