#severity-assessment

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Harry Owiredu-Ashley

该论文针对工具型AI智能体的红队测试评估提出了一个关键问题:现有的二元攻击成功率指标(攻击成功或失败)忽略了防御者最需要的信息——即攻击造成的实际危害程度。作者设计了一个基于动作的分级危害量表(Action-Graded Harm Rubric),将智能体的工具调用轨迹按照七个等级(L0至L6)进行排序,等级依据包括动作是否可逆、是否越界影响到其他实体、以及是否扩展了权限。该量表通过两种方式计算:确定性阅读器(oracle)根据轨迹和攻击者目标直接评分,以及一个由三个前沿语言模型组成的评审团(judge panel)对同一轨迹的无标签描述进行评分。在AgentDojo工作空间套件上,针对四个受害者模型和两种防御的评估实验表明,该分级量表揭示了二元指标隐藏的三个案例,例如一种防御报告零攻击成功率,却通过未过滤的工具允许了外部可见的跨域泄露。评审团与oracle的评分具有较高的一致性(Krippendorff's alpha = 0.91),但存在系统性的盲点,特别是未能识别权限升级链。相比现有工作,该论文的贡献在于提供了一个可复用的、基于轨迹的分级严重性工具,可直接应用于现有红队日志中的实际动作。所有代码、提示和逐轮日志均已开源。

💡 推荐理由: 对安全从业者而言,该论文提供了比传统二元攻击成功率更精细的危害评估方法,有助于更准确地理解AI智能体被攻陷后的实际风险,并优化防御措施。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)