#harness

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Nanxi Li, Yingzi Ma, Yulong Cao, Edward Suh, Bo Li, Dawn Song, Chaowei Xiao

本文提出 EvoSafeHarness,一个面向 LLM Agent 的系统级安全约束(harness)自动化优化框架。研究背景是:LLM Agent 能将语言指令转化为真实世界操作,因此必须防御间接提示注入和直接有害请求;但现有安全 harness 通常由专家一次性设计,再直接套用到不同模型与领域,导致防护效果高度依赖部署环境。核心问题在于:不同模型对约束的耐受度不同(过严会损害效用),不同领域需要治理的状态与动作序列也各异,静态策略容易漏掉应用专属的安全关系。EvoSafeHarness 针对目标领域中“冻结”的模型联合搜索自然语言策略与可执行代码逻辑,生成可部署的安全 harness;其优化过程由模型行为、领域规范以及“全新上下文对抗评审”共同引导,以剔除只对 benchmark 有效的过拟合规则。实验在四类 Agent benchmark 上进行,结果显示该方法显著优于固定专家设计防御,实现更强的安全-效用帕累托前沿。例如,在 DecodingTrust-Agent 上,平均攻击成功率从 45.6% 降至 10.0%,效用仅损失 3.3 点,并在 15 个评测单元中取得 14 个最佳成绩;在 AgentDojo 上,以 0.0% 攻击成功率实现 82.8% 效用,是 CaMeL 在相同工作点效用的两倍,且无需修改即可迁移至未见过的 AgentDyn 套件;在 Agent-SafetyBench 上对所有受害模型均取得最佳分数,并在 16 次细化预算的自适应 PAIR 攻击下保持平均 ASR 低于 20%。分析表明,领域语义决定需要治理的安全关系与轨迹状态,而模型与运行时行为决定这些关系的实施方式和位置。本文的主要贡献是首次将安全 harness 设计形式化为一个可优化的合成问题,并通过自动化搜索得到领域与模型定制的防护层。适合 LLM Agent 安全研究者、系统安全工程师以及负责 Agent 应用部署的蓝队人员阅读。

💡 推荐理由: 该研究为 LLM Agent 的系统级防御提供了可自动化定制的新范式,能显著降低攻击成功率,且可迁移到不同 Agent 框架,对 SOC 和红蓝对抗有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Jiajun Ruan, Peiyang Li, Yukun Chen, Fengting Li, Chao Feng

随着大语言模型(LLM)代理的操作能力不断扩展,其引入的安全威胁也日益复杂。运行时防御通过在代理执行循环中集成安全机制,已成为缓解这些风险的有效方法。然而,现有的运行时防御严重依赖人工设计的干预措施,缺乏构建和维护这些防御的原则性框架。本文首先提出了一个基于 harness(运行框架)层面的运行时防御形式化描述,系统性地刻画了 harness 机制如何支持防御构建,并从 harness 视角统一了现有的运行时防御干预措施。在此基础上,作者提出了 HARD(Harness-based Autonomous Runtime Defense Evolution,基于 harness 的自主运行时防御进化)框架,该框架能够自动识别合适的干预策略,并根据观察到的失败轨迹迭代地改进防御工件。HARD 将运行时防御的开发从人工工程转变为自主进化过程。大量实验表明,HARD 在提升安全性能的同时,保持了良性任务的效用。研究结果强调,自主防御进化是保护已部署 LLM 代理的一个有前景的新范式,使代理能够识别自身防御弱点并持续改进其保护机制。

💡 推荐理由: 当前 LLM 代理安全防御多为人工设计,缺乏自动化演进。HARD 提出自进化框架,能自动迭代防御策略,有望减少安全运维负担,对部署 LLM 代理的组织有实际参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)