该论文关注一个被低估的攻防测量问题:随着 LLM 智能体被越来越多地用于自动化攻击链的后渗透环节,它们在复杂本地提权任务中的实际能力究竟如何,此前缺乏可执行验证下的大规模量化证据。作者指出,已有针对 Linux 提权任务的评测普遍存在样本量过小的问题(不足 15 个场景),既无法支撑模型能力横向对比,也无法给出统计意义上可靠的结论。为填补这一空白,论文提出 PrivEscalate —— 一个面向 Linux 提权的大规模基准测试集,包含 531 个基于 Docker 容器化的可执行场景,覆盖 14 个漏洞子类别,并在此基础上派生出 329 个参数化变体,用于测量模型对环境中干扰项(如配置差异、噪声信息)的敏感程度。作者在三种不同的智能体架构下评估了六个 LLM,得到三点主要发现:第一,模型能力在不同漏洞类别上呈现明显的异质性,在高发类别中没有任何单一模型能够全面领先,说明对该类风险应当采用多维度的评估而非单一排名;第二,LLM 的成功率对环境扰动敏感,通过配置轮换可以打断一部分提权尝试,但并不能消除被测量的整体风险,因此静态加固不等于风险归零;第三,智能体架构会实质性改变成功率,甚至重排模型之间的名次,但影响幅度依模型而异,说明评测结论必须与所采用的 agent 框架绑定说明。基于上述发现,作者进一步开发了 PrivEscAgent,这是一个领域专用的封装层,在不修改底层 LLM 的前提下,为通用 ReAct 智能体补充确定性枚举、类别匹配与步骤规划能力,从而在既有 Linux 提权智能体基线上取得提升。论文将 PrivEscalate 作为开源、容器化的测量工具发布,明确支持三类用途:LLM 智能体能力评估、防御工具有效性验证以及红队训练。
💡 推荐理由: 它把 LLM 自动化提权从传闻变成可复现的量化基线:531 个容器场景与参数化变体说明模型能力差异大且对配置敏感,防御方可用它验证加固与检测是否真正有效,而不是依赖单一模型排名。
🎯 建议动作: 研究跟进,并评估将 PrivEscalate 纳入内部 LLM 智能体风险测量与检测规则回归测试