#multi-host

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Brian Singer, Keane Lucas, Lakshmi Adiga, Meghna Jain, Lujo Bauer, Vyas Sekar

本文针对企业级多主机网络红队测试中依赖人工专家、成本高昂且难以扩展的问题,提出利用大语言模型(LLM)自动化执行红队演练。作者首先系统评估了现有最先进的LLM辅助攻击系统(如PentestGPT、CyberSecEval3)结合顶级LLM(如Sonnet 4、Gemini 2.5 Pro)在多主机网络攻击场景中的表现,发现这些系统均无法可靠地完成跨多跳主机(stepping stones)的复杂攻击链条。基于对失效模式的分析,作者指出当前系统在任务抽象与接口设计上的不足,并据此设计并实现了Incalmo——一个面向多主机网络自主红队演练的LLM辅助系统。Incalmo的核心思路是:由LLM负责将红队目标分解为高层声明式任务,再由领域特定的任务代理(task agents)具体执行;同时引入辅助服务管理上下文和已获取的资产(如凭证、会话等),以缓解长程规划中的上下文丢失问题。为了评估效果,作者构建了MHBench基准,包含40个真实感仿真网络环境,规模从22台到50台主机不等。实验结果显示,Incalmo在40个环境中成功获取关键资产(关键主机或数据)37个,而现有最先进的LLM辅助系统仅成功3个。此外,Incalmo效率较高:单次成功攻击耗时12-54分钟,LLM API成本低于15美元。本文的贡献在于:揭示了现有LLM攻击系统在多主机场景中的适用性瓶颈,提出了面向红队演练的任务抽象与执行解耦架构,并提供了可复现的高质量评测基准MHBench。适合红队自动化研究者、企业安全架构师及渗透测试工具开发者阅读。

💡 推荐理由: 该研究为LLM驱动的红队自动化提供了实证基础,证明通过任务分解与专用代理可大幅提升多主机攻击成功率,可能显著降低企业红队成本,同时推动LLM在安全评估中的实用化进程。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)