#self-evolving-defense

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Jiajun Ruan, Peiyang Li, Yukun Chen, Fengting Li, Chao Feng

随着大语言模型(LLM)代理的操作能力不断扩展,其引入的安全威胁也日益复杂。运行时防御通过在代理执行循环中集成安全机制,已成为缓解这些风险的有效方法。然而,现有的运行时防御严重依赖人工设计的干预措施,缺乏构建和维护这些防御的原则性框架。本文首先提出了一个基于 harness(运行框架)层面的运行时防御形式化描述,系统性地刻画了 harness 机制如何支持防御构建,并从 harness 视角统一了现有的运行时防御干预措施。在此基础上,作者提出了 HARD(Harness-based Autonomous Runtime Defense Evolution,基于 harness 的自主运行时防御进化)框架,该框架能够自动识别合适的干预策略,并根据观察到的失败轨迹迭代地改进防御工件。HARD 将运行时防御的开发从人工工程转变为自主进化过程。大量实验表明,HARD 在提升安全性能的同时,保持了良性任务的效用。研究结果强调,自主防御进化是保护已部署 LLM 代理的一个有前景的新范式,使代理能够识别自身防御弱点并持续改进其保护机制。

💡 推荐理由: 当前 LLM 代理安全防御多为人工设计,缺乏自动化演进。HARD 提出自进化框架,能自动迭代防御策略,有望减少安全运维负担,对部署 LLM 代理的组织有实际参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)