#guardrail

共收录 7 条相关安全情报。

← 返回所有主题
👥 作者: Jinyang Li, Mingyu Guo, Hung X. Nguyen

该论文提出 CS-Guard——据作者所述是首个系统性评估「代码生成安全护栏(guardrail)」的基准测试框架。研究背景是:大语言模型已被滥用于生成恶意软件,但现有护栏在代码生成场景下的实际防护效果缺乏系统量化。CS-Guard 从两个维度构建评测集:其一是文本到代码(text-to-code)生成,包含 1000 条高质量的恶意代码生成提示词、7 种越狱攻击手法,以及作者新提出的一种「虚构场景攻击(FSA)」——即把恶意意图包装进看似正当的虚构软件开发情境中,从而绕过护栏的意图识别;其二是代码到代码(code-to-code)生成,包含 331 条代码提示,覆盖代码填充(infilling)、代码补全(completion)与代码翻译(translation)三类任务。作者在 7 个 LLM 上对 9 种护栏进行了实证评测。主要发现包括:面对恶意代码生成请求,当前护栏表现普遍不佳;在 text-to-code 场景中,经过越狱攻击后的平均攻击成功率(ASR)对许多护栏可达约 50%;在 code-to-code 场景中,基础 LLM 上的平均 ASR 接近 100%,即使叠加多种护栏后仍处于 14.4% 至接近 100% 的高位;新提出的 FSA 在多种护栏上也取得接近 100% 的 ASR。作者认为这给真实世界的软件开发流程带来了重大的可靠性隐患。为支持后续研究,CS-Guard 采用模块化的三层护栏分类法(taxonomy),允许开发者注册自家护栏并纳入统一评测,同时公开了基准与数据集。论文适合 AI 安全、LLM 应用工程、代码助手/CI 安全防护方向的读者。

💡 推荐理由: 许多团队把 LLM 护栏当作代码生成安全的最后一道防线,但该评测显示其在越狱与「正当场景包装」下大面积失效,code-to-code 场景尤其严重。这直接挑战了以护栏为唯一控制措施的现有安全设计假设。

🎯 建议动作: 研究跟进:将 CS-Guard 的评测维度(text-to-code、code-to-code、FSA)纳入内部 LLM 代码助手上线前安全评估清单

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Nikita Oblakov, Sabrina Sadiekh, Evgeniy Kokuykin

本文提出并评估了 HiveTraceGuard-Pro——一个面向生产环境大语言模型(LLM)的轻量级生成式护栏模型,用于检测提示注入、越狱(jailbreak)以及对抗性混淆内容。作者指出,现有公开研究大多集中于英语场景,对俄语提示注入和俄语表层混淆攻击的证据匮乏。该模型基于 Qwen3-0.6B 进行 LoRA 微调,参数量仅为 0.6B,同时支持俄语和英语,并采用单一二元评分规则(安全/不安全)对最终目标轮次进行分类。训练语料包含与良性样本配对的恶意示例,并应用了八种混淆变换来增强鲁棒性。作者构建了包含 19 个基准组的测试框架(其中 16 个为公开基准),将 HiveTraceGuard-Pro 与其他 34 个防护模型进行对比。结果显示,其综合得分(key)为 0.7432,略低于得分最高的两个模型(0.7641 和 0.7552);在 16 个公开基准组中得分为 0.7153,有 4 个其他模型得分更高。在额外的 15 模型对比中,该模型在俄语干净样本鲁棒性综合 F1 值(0.88)和俄语提示注入召回率(0.999)上表现最佳,但作者提醒至少 27.1% 的测试数据与训练语料存在重叠,可能带来乐观偏差。其延迟中位数仅为 14.3 毫秒,在对比模型中最低。整套测试的假阳性率(FPR)为 0.268,假阴性率(FNR)为 0.156。作者指出,所有报告的结果均基于旧式的独立回复序列化方式,而非发布版聊天模板的自然助手角色路径,可能影响实际部署表现。模型权重已在 Hugging Face 上以 Apache-2.0 许可发布;训练语料、评估集和评估代码暂未公开。该研究对需要同时覆盖俄语和英语、且对延迟敏感的生产 LLM 安全防护场景有参考价值。

💡 推荐理由: 该工作填补了俄语提示注入与混淆攻击防护的公开空白,展示了一个仅有 0.6B 参数的生成式护栏如何实现较低延迟与较高俄语召回,同时揭示了评估集与训练集重叠的问题,提醒社区警惕基准分数虚高。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tanzim Ahad, Ismail Hossain, Md Jahangir Alam, Sai Puppala, Syed Bahauddin Alam, Sajedul Talukder

本文研究了当前最先进的基于影响(influence)的保护机制(guardrails)在工具使用型 LLM 代理中的局限性:它们无法可靠地区分合法且经用户授权的动作与恶意未授权的动作,当两者都依赖外部工具信息时。这种模糊性可能导致良性动作触发不必要的验证和干预,降低实用性并增加延迟。作者通过从 24 个基础案例推导出 96 个条件,进行了“授权等价性”审计。在匹配源比较中,保持授权状态、具体执行动作及其预期效果不变,仅改变必需值的来源(来自用户或合法工具结果)。结果显示,虽然动作本身不变,但这种无害的来源迁移在所有 24 个案例中,在 Llama 和 Gemma 评分器下都将因果信号移向攻击区域。匹配的未授权对照表明信号仍然对攻击敏感,但良性的来源迁移所产生的平均分数偏移大于真实授权变更所产生的偏移。架构级评估显示这种不匹配如何在保护机制设计中传播。使用语义监视器时,攻击成功率为0%,而实用性为28%;无监视器时分别为16%和60%。基于阴影的保护机制允许所有测试的无害运行,但在总体上并不会更多地拒绝匹配的未授权动作:57.5%的未授权运行在到达后续安全检查之前自动通过,而授权运行只有29.2%自动通过。这些结果表明,所研究的因果信号揭示了动作由什么塑造,但不能可靠地编码动作是否被授权;参考构建和路由是有效安全决策中不可或缺的一部分。

💡 推荐理由: 对于依赖工具调用的 LLM 代理防护(如权限控制、动作安全审批),当前护栏信号易将合法工具数据视为攻击,导致误报率高,同时可能放过真实攻击,呼吁安全社区关注更精细的授权语义建模。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon, Abu-fuad Ahmad, Thi Hong Tran

该论文针对大型语言模型(LLM)在实际部署中面临的安全挑战——攻击者通过精心构造的提示词(prompt)绕过安全控制。现有防护方法(如 LLM-as-a-judge 和基于云的安全 API)虽能检测不安全内容,但每次请求会增加约 250-900 毫秒的延迟,难以满足实时应用(通常要求 <100 毫秒)的需求;同时,将用户提示路由至外部审核端点也会引发数据隐私问题。为此,作者提出 Reflex-Guard,一种本地运行的轻量级防护栏(guardrail),其核心组件包括:越狱感知的预处理(jailbreak-aware preprocessing)、紧凑的句子变换器嵌入(compact sentence-transformer embeddings)以及七个快速的二分类器。这些组件协同工作,实现了高精度的提示安全过滤,且延迟远低于现有方案。实验基于一个策略性平衡的数据集,包含 30,568 个样本,来源涵盖五个互补的数据源。结果显示,Reflex-Guard 在端到端延迟仅 37.6 毫秒的情况下,对有害提示的召回率达到 95.9%。相比之下,基线 Llama Guard 2 需 255 毫秒,SafeDecoding 需 723 毫秒。Reflex-Guard 在默认阈值下能 100% 检测 GCG 后缀攻击和 Base64 编码提示;但对于 DrAttack 结构化提示,因概率分布不同,需将阈值降至 0.03 才能达到最优检测。此外,Reflex-Guard 的 Reflex 效率得分(RES)最高达 16.79,明显优于 Llama Guard 2(11.90)和 SafeDecoding(9.80)。论文还提供了实际部署建议,并指出不同类型的攻击在嵌入概率空间中占据不同区域。适合关注 LLM 安全、实时应用防护、本地化安全过滤器的研究者和工程师阅读。

💡 推荐理由: 该研究直面 LLM 实时防护的高延迟痛点,提出可本地部署的低延迟方案,在保持高召回的同时将延迟压缩至 37.6ms,对需要毫秒级响应的应用(如聊天机器人、实时审核)意义重大,且避免了外部 API 带来的隐私泄露风险。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Christopher M. Frost

流式大语言模型(LLM)输出在逐 token 释放时面临审核时机困境:若等待完整输出再审核,敏感内容已经到达用户;若对每个前缀反复进行语义分类,则计算开销大且结果不稳定。本文提出一种确定性的配对完成防护栏(pair-completion guardrail)构造:将每个需要拦截的危险签名定义为两个词法谓词的合取(conjunction)。在每次释放新 chunk 之前,守护程序扫描当前累积前缀;一旦前缀同时满足这两个谓词,就扣留当前 chunk,从而在精确的边界处阻止危险签名完整出现。实验覆盖 4 个签名族、8 种 chunk 大小及 32 次机制试验,流式决策与缓冲扫描器完全一致,并成功扣留每一个使谓词对完整匹配的 chunk;8 个单谓词对照组全部通过,说明机制具备选择性。在另一次 512 次试验的策略对比中,全前缀扫描和完整缓冲能检测所有配置的配对,512 字符滑动窗口检测出 96/128,chunk 局部扫描仅检测出 38/128,凸显了扫描范围对覆盖率的影响。固定签名对在 338 条人工标注的安全响应上误报为 0,在 394 条陪审团标注的不安全响应上检出为 0,证明该方法只覆盖窄范围的预定签名,而非通用语义危害。校准的 Llama Guard 3 1B 基线对同一批数据分别正确分类 310/338 安全响应和 202/394 不安全响应。性能方面,对 16,384 字符响应进行重复前缀扫描,耗时随 chunk 大小在 13.261 ms 至 829.640 ms 之间变化。作者总结:配对完成机制适合作为小型固定策略的精确释放边界兜底,不能替代语义审核。该研究对 LLM 流式输出的安全护栏设计具有参考价值。

💡 推荐理由: 流式 LLM 输出审核时机是实际部署中的难点。本文给出一种确定性、可验证的配对扣留方案,为安全工程师提供低成本、零误报(针对固定规则)的边界控制思路,也让社区意识到需要将窄规则与语义审核分层组合。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: William Hackett, Peter Garraghan

本文提出了一种针对大型语言模型(LLM)及智能体系统中防护栏(guardrail)的黑盒侦察方法。在现实应用中,LLM常配备防护栏系统以检测并阻止恶意指令。然而,在进行黑盒对抗模拟时,研究人员难以区分防护栏拦截与LLM自身拒绝响应(LLM rejection),这两种情况需要不同的绕过策略,从而影响攻击技术的选择与优化。作者首次提出了一套黑盒防护栏侦察方法论,仅通过HTTP、词汇及时间信号的监控行为来推断目标AI系统中是否存在防护栏,无需任何先验知识。实验表明,该方法能以100%的准确率检测防护栏存在,且在良性交互与恶意交互之间实现统计显著的行为分离(q < 0.001)。此外,该方法还能识别防护栏设计阻止的内容类别,并在未见提示上以平均F1分数98%区分防护栏拦截与LLM拒绝。该研究为AI安全评估提供了重要工具,帮助安全从业者在黑盒场景下更准确地理解系统安全机制。

💡 推荐理由: 区分防护栏拦截与LLM拒绝是AI安全评估的关键挑战,直接影响攻击测试的有效性和防御策略设计。本文提供的黑盒方法能显著提升安全分析的精度。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
INFO
PAPER 2026-05-28

Provably Secure Agent Guardrail

推荐 5.6
Conf: 50%
👥 作者: Benlong Wu, Weiming Zhang, Kejiang Chen, Han Fang, Nenghai Yu

本文针对大型语言模型从有限生成引擎向具有广泛执行权限的智能代理转型过程中出现的失控问题,提出了一种基于逻辑推理基本局限性的新型安全范式。现有防御架构主要依赖经验性语义护栏和概率性大模型裁决器,无法在复杂语义符号解耦攻击下提供确定性安全下界。为克服这一困境,作者提出了一种可执行证明约束动作(ePCA)框架,采用神经符号隔离架构。该框架放弃对自然语言的语义信任,强制代理在执行物理操作前将其意图无损形式化为一阶逻辑数学约束,从而确保决策的可验证安全性。在宏观和微观二维动态对抗系统中的实验评估表明,该形式化验证机制在评估场景中实现了零攻击成功率和零误报率,且计算延迟极低。本文为构建未来智能系统的底层防御基础提供了在明确系统假设下的条件形式化基础和工程范式。适合AI安全研究员、大模型应用开发者及安全架构师阅读。

💡 推荐理由: 首次提出可证明安全的代理护栏,通过形式化逻辑约束从根本上解决LLM代理的语义不可靠问题,为代理安全提供了确定性保障。

🎯 建议动作: 研究跟进并评估该方法在自身代理系统中的应用可行性

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)