本文提出 EvoSafeHarness,一个面向 LLM Agent 的系统级安全约束(harness)自动化优化框架。研究背景是:LLM Agent 能将语言指令转化为真实世界操作,因此必须防御间接提示注入和直接有害请求;但现有安全 harness 通常由专家一次性设计,再直接套用到不同模型与领域,导致防护效果高度依赖部署环境。核心问题在于:不同模型对约束的耐受度不同(过严会损害效用),不同领域需要治理的状态与动作序列也各异,静态策略容易漏掉应用专属的安全关系。EvoSafeHarness 针对目标领域中“冻结”的模型联合搜索自然语言策略与可执行代码逻辑,生成可部署的安全 harness;其优化过程由模型行为、领域规范以及“全新上下文对抗评审”共同引导,以剔除只对 benchmark 有效的过拟合规则。实验在四类 Agent benchmark 上进行,结果显示该方法显著优于固定专家设计防御,实现更强的安全-效用帕累托前沿。例如,在 DecodingTrust-Agent 上,平均攻击成功率从 45.6% 降至 10.0%,效用仅损失 3.3 点,并在 15 个评测单元中取得 14 个最佳成绩;在 AgentDojo 上,以 0.0% 攻击成功率实现 82.8% 效用,是 CaMeL 在相同工作点效用的两倍,且无需修改即可迁移至未见过的 AgentDyn 套件;在 Agent-SafetyBench 上对所有受害模型均取得最佳分数,并在 16 次细化预算的自适应 PAIR 攻击下保持平均 ASR 低于 20%。分析表明,领域语义决定需要治理的安全关系与轨迹状态,而模型与运行时行为决定这些关系的实施方式和位置。本文的主要贡献是首次将安全 harness 设计形式化为一个可优化的合成问题,并通过自动化搜索得到领域与模型定制的防护层。适合 LLM Agent 安全研究者、系统安全工程师以及负责 Agent 应用部署的蓝队人员阅读。
💡 推荐理由: 该研究为 LLM Agent 的系统级防御提供了可自动化定制的新范式,能显著降低攻击成功率,且可迁移到不同 Agent 框架,对 SOC 和红蓝对抗有直接参考价值。
🎯 建议动作: 研究跟进