推荐 3.5
Conf: 50%
该论文提出一个名为 HarnessSafe 的基准测试,聚焦于现代智能体 harness(agent harness)中持久化载体(persistent carriers)带来的延迟安全风险。现代智能体系统为了跨任务和会话保持状态,会使用内存、技能、工具、共享工件等持久化载体,但这些能力可能使攻击者注入的内容跨越系统边界,并在后续某个良性请求执行时被触发,形成延迟性危害。已有基准往往只覆盖少数载体或 harness,且端到端的攻击成功率难以揭示风险的具体传播路径。为此,作者构建了包含 328 个可执行用例的基准,覆盖七类持久化载体家族,并在主流智能体 harness 上进行了评估。每个用例被建模为“持久风险生命周期”(Persistent-Risk Lifecycle),追踪攻击者影响从初始进入点开始,如何通过载体和系统边界持续传播,直至被一个后续良性触发器激活并产生可观察的违规行为。同时,论文提出了一种多阶段、基于痕迹的评估方法,利用可观察的执行证据来判断每条攻击链推进到哪个阶段、在哪一步被阻断。实验结果表明,风险遏制效果具有载体特异性,并强烈依赖 harness 与模型的具体配置;harness 和模型后端都会显著影响遏制结果,而单纯的攻击成功率无法反映不同的生命周期推进模式。该工作为智能体安全评估提供了更精细的方法论和数据集,适合智能体平台开发者、安全研究者和 LLM 应用工程师阅读。
💡 推荐理由: 该研究揭示了智能体 harness 中持久化载体带来的延迟攻击面,超越了传统单次攻击成功率评估,为蓝队构建针对智能体系统的纵深防御提供了可操作的评测框架。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)