#red-team

共收录 8 条相关安全情报。

← 返回所有主题
👥 作者: Aashiq Muhamed, Mona T. Diab, Virginia Smith, Andrew Ilyas, Matthew Jagielski

该论文聚焦大语言模型微调阶段的后门数据投毒评估方法学。传统后门研究通常固定投毒样本数量,再从候选数据池中随机抽取投毒集合,并据此估计模型的最坏情况脆弱性。作者指出这种做法会严重低估真实风险:在三个基于 LLaMA-3-8B 的后门实验设置中,当模型、干净数据与投毒样本数量全部保持不变,仅改变"选中哪些样本构成投毒集合"这一个变量时,攻击成功率即可在 3% 到 80% 之间大幅波动。换言之,随机采样只探测到了风险空间的一小部分。为刻画这一问题,作者把投毒集合的选择形式化为"受 oracle 预算约束的集合优化":每次"微调 + 评测"调用代价高昂,因此必须在有限次真实评测下,从海量候选集合中找出最危险的那一批。为此提出 SAILS(Set-level Audit-Informed Iterative Learned Selection,集合级、由审计信息驱动的迭代学习式选择):先用几百次微调-评测运行训练一个"集合打分器",用它为数百万个候选投毒集合排序,再只对排名靠前的小规模候选名单进行真实审计验证,从而在预算内逼近最坏情况。实验表明,SAILS 在留出集合上的攻击成功率平均比最强的影响力(influence)基线高出约 30 个百分点;该方法还能从较小规模微调迁移到完整规模微调,并可扩展到代码生成、智能体(agentic)以及仅提供 API 的后门场景。整体研究视角属于"对抗性评估方法学",即通过构造更强的攻击者模型来暴露当前后门评测与防御体系的盲区,而非提出新的实际攻击载荷或绕过技术。

💡 推荐理由: 许多后门防御与安全评测默认随机抽取投毒集合,本文证明这会系统性低估最坏情况风险(同一配置下攻击成功率可在 3%~80% 间波动)。这意味着基于弱随机基线的"防御有效"结论可能不成立,安全团队需以对抗性、集合级视角重新审视微调数据供应链与后门评估指标。

🎯 建议动作: 研究跟进,并纳入内部评估:把随机投毒基线升级为集合级最坏情况评估方法

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yixuan Liu, Zilong Zhen, Yin Wu, Yi Li

该论文关注一个被低估的攻防测量问题:随着 LLM 智能体被越来越多地用于自动化攻击链的后渗透环节,它们在复杂本地提权任务中的实际能力究竟如何,此前缺乏可执行验证下的大规模量化证据。作者指出,已有针对 Linux 提权任务的评测普遍存在样本量过小的问题(不足 15 个场景),既无法支撑模型能力横向对比,也无法给出统计意义上可靠的结论。为填补这一空白,论文提出 PrivEscalate —— 一个面向 Linux 提权的大规模基准测试集,包含 531 个基于 Docker 容器化的可执行场景,覆盖 14 个漏洞子类别,并在此基础上派生出 329 个参数化变体,用于测量模型对环境中干扰项(如配置差异、噪声信息)的敏感程度。作者在三种不同的智能体架构下评估了六个 LLM,得到三点主要发现:第一,模型能力在不同漏洞类别上呈现明显的异质性,在高发类别中没有任何单一模型能够全面领先,说明对该类风险应当采用多维度的评估而非单一排名;第二,LLM 的成功率对环境扰动敏感,通过配置轮换可以打断一部分提权尝试,但并不能消除被测量的整体风险,因此静态加固不等于风险归零;第三,智能体架构会实质性改变成功率,甚至重排模型之间的名次,但影响幅度依模型而异,说明评测结论必须与所采用的 agent 框架绑定说明。基于上述发现,作者进一步开发了 PrivEscAgent,这是一个领域专用的封装层,在不修改底层 LLM 的前提下,为通用 ReAct 智能体补充确定性枚举、类别匹配与步骤规划能力,从而在既有 Linux 提权智能体基线上取得提升。论文将 PrivEscalate 作为开源、容器化的测量工具发布,明确支持三类用途:LLM 智能体能力评估、防御工具有效性验证以及红队训练。

💡 推荐理由: 它把 LLM 自动化提权从传闻变成可复现的量化基线:531 个容器场景与参数化变体说明模型能力差异大且对配置敏感,防御方可用它验证加固与检测是否真正有效,而不是依赖单一模型排名。

🎯 建议动作: 研究跟进,并评估将 PrivEscalate 纳入内部 LLM 智能体风险测量与检测规则回归测试

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Tejasvi C. Addagada

该研究旨在验证两种独立 LLM 安全削弱因素是否会相互叠加:一是结构化对抗性提示 Jailbreak 类——称为“非自愿上下文学习”(Involuntary In-Context Learning, IICL),即把有害请求包装成一个由模式而非内容填充的数据标注任务的缺失格;二是非英语语言环境下安全对齐的退化。作者在 Google Gemini 的一个双模型上,基于 HarmBench(30 条通用危害行为)与 FinProof(30 条金融虐待行为)两个基准,分别测试了单次基线提示和四种语言(英、西、印地、阿拉伯)下的 IICL。结果显示,IICL 对跨提供商具有迁移性,并且在金融领域危害更重——HarmBench 攻击成功率由 <=6.7% 升至 80–90%,FinProof 升至 97–100%,远高于原论文在 OpenAI GPT-5.4 上公布的 <=24% 。然而,作者假设的多语言叠加并不成立:强迫 IICL 输出至非英语反而缓解攻击,12 个非英语条件中有 11 个成功率低于英语基线(符号检验 p≈0.003),唯一异常是接近 100% 的天花板平局;在更强模型的金融集中,阿拉伯语从 100% 锐减至 33%。作者将其归因于“相关性诅咒”:结构一旦破解遵守行为,模型在低资源语言中产生内容质量较低的有害文本,导致实质评分判断部分成功。结果在独立的非 Google 评审器下复现(Cohen's kappa=0.86,377 对配对),且 76.6% 的非英语响应经语言核定。因此,Jailbreak 漏洞不可简单加总,主导性剩余风险是英语结构化攻击,尤其对金融虐待最烈,而非多语言利用。该论文适合 LLM 安全研究人员和开发大模型应用的红队团队阅读。

💡 推荐理由: 本论文揭示了结构性 jailbreak(IICL)可以跨模型提供商转移,且在金融域的攻击成功率异常高(FinProof 上达 97-100%);同时打破“多语言叠加”假设,提醒蓝队不要把资源过多投入到低风险的多语言对抗,而应优先加固英语结构化提示场景,特别是财务对话应用。

🎯 建议动作: 纳入内部评估

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yi Ting Shen, Kentaroh Toyoda, Alex Leung

大型语言模型(LLM)的自动化红队攻击与蓝队防御技术正在快速发展,但现有的攻击者和防御者通常被孤立地构建和测试,导致评测分数难以反映真实对抗能力。为解决这一问题,本文提出了 ACEA(Adversarial Co-Evolution Arena,对抗性共进竞技场),一个将可插拔的红队适配器和蓝队适配器连接到共享目标 LLM 的平台,并通过 LLM 裁判对双方进行攻击率和防御率的评分。ACEA 的贡献包含四个部分:第一,一个可插拔、模型无关的竞技场。任何红队或蓝队项目只需通过最小化 HTTP 协议(称为 ASAP 标准适配协议)即可接入,且不限制编程语言;只要暴露该协议即可成为完整参与者。第二,一套为对抗轮次设计的评估方法。通过用规范秘密(canonical secrets)对目标进行种子注入,可获得可验证的 ground truth,从而区分真实泄露与模型幻觉。同时,即使防御成功,攻击样本仍会被发送到目标,以独立衡量攻击的原始威力(raw potency),不受是否被拦截的影响。这些机制共同构成了每一轮攻击强度与防御效果的分解指标。第三,实时的游戏式可视化界面及详细的战后报告,能够定位每一次失败的具体原因,使评估成为改进红队或蓝队项目的可操作信号。第四,一个可选的上下文改进循环,将每轮结果转化为下一轮的建议提示(advisory hints)。适配器无需保持状态即可跨轮次适应,只需读取这些提示即可。文章详细描述了 ACEA 的设计,以及红蓝双方在对抗中如何进行头对头评分。该研究适用于 LLM 安全评估人员、红队攻防研究者及安全工具开发者,旨在提供更可信、可分解的对抗评测框架。

💡 推荐理由: 现有LLM红蓝对抗评测互相隔离,分数可信度低。ACEA提供了可插拔的头对头共进评测平台,能精准区分攻击威力与防御效果,为红蓝队迭代提供可操作信号。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Brian Singer, Keane Lucas, Lakshmi Adiga, Meghna Jain, Lujo Bauer, Vyas Sekar

本文针对企业级多主机网络红队测试中依赖人工专家、成本高昂且难以扩展的问题,提出利用大语言模型(LLM)自动化执行红队演练。作者首先系统评估了现有最先进的LLM辅助攻击系统(如PentestGPT、CyberSecEval3)结合顶级LLM(如Sonnet 4、Gemini 2.5 Pro)在多主机网络攻击场景中的表现,发现这些系统均无法可靠地完成跨多跳主机(stepping stones)的复杂攻击链条。基于对失效模式的分析,作者指出当前系统在任务抽象与接口设计上的不足,并据此设计并实现了Incalmo——一个面向多主机网络自主红队演练的LLM辅助系统。Incalmo的核心思路是:由LLM负责将红队目标分解为高层声明式任务,再由领域特定的任务代理(task agents)具体执行;同时引入辅助服务管理上下文和已获取的资产(如凭证、会话等),以缓解长程规划中的上下文丢失问题。为了评估效果,作者构建了MHBench基准,包含40个真实感仿真网络环境,规模从22台到50台主机不等。实验结果显示,Incalmo在40个环境中成功获取关键资产(关键主机或数据)37个,而现有最先进的LLM辅助系统仅成功3个。此外,Incalmo效率较高:单次成功攻击耗时12-54分钟,LLM API成本低于15美元。本文的贡献在于:揭示了现有LLM攻击系统在多主机场景中的适用性瓶颈,提出了面向红队演练的任务抽象与执行解耦架构,并提供了可复现的高质量评测基准MHBench。适合红队自动化研究者、企业安全架构师及渗透测试工具开发者阅读。

💡 推荐理由: 该研究为LLM驱动的红队自动化提供了实证基础,证明通过任务分解与专用代理可大幅提升多主机攻击成功率,可能显著降低企业红队成本,同时推动LLM在安全评估中的实用化进程。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chinmay Gondhalekar, Urjitkumar Patel

该论文研究检索增强生成(RAG)在安全运营中心(SOC)分析师面向上机助手(copilot)场景中的安全漏洞。作者发现并定义了一类名为 COMA(Compositional Misleading Attack)的攻击:即使每个检索到的文档都真实、无指令注入、无矛盾,且分布上看似良性,攻击者仍可通过多个文档的“组合”效应误导模型对漏洞的评估与修复建议。COMA 包含两种具体实现:action-corruption 将已正确诊断的漏洞引导至有缺陷的修复方案;verdict-flip 通过不可判定的可达性链扰动可利用性结论。实验表明,在合成数据集及真实 CVE(CVE-2021-33813)上,action-corruption 对所有五个测试模型(包括前沿推理模型)均能成功;verdict-flip 的成攻率随模型能力增强而下降,但从未完全消失。论文提出核心原理:攻击成功的关键在于消歧事实必须被模型“推断”而非直接“读取”。针对该问题,作者提出 Causal Counterfactual Defense(CCD)审计框架,逐一衡量每个检索文档的留一法因果影响,并标记影响力集中于低信任文档的答案。在四个良性多文档对照测试中,CCD 能精确定位攻击者控制的文档且无误报;对于自适应扩散影响力的攻击者,聚合变体仍可检测。作者公开了攻击种子与 CCD 参考实现,为安全 RAG 系统提供可复现的评估与防御基线。本文适合 LLM/RAG 安全研究者、SOC 自动化工具开发者及红蓝队成员阅读。

💡 推荐理由: RAG 系统在 SOC 中的普及使该攻击具有直接现实威胁:即使检索内容全部真实,攻击者仍能诱导安全助手下错误结论,可能导致真实漏洞未修复或修复不充分。CCD 防御提供可部署的审计思路,对构建可信安全 copilot 至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Jasper Timm, Lukas Struppek, Ziwei Xu, Grace Cheong, Oscar Mata, Dan Zhao, Mick Yang, Isadora De Andrade, Xiaojun Jia, Yiming Li, Samuel Bauer, Heather McIntyre, Adam Gleave, Edward Yee, Kellin Pelrine

本文提出了 FAR.AI 人工智能安全基准(AI Security Leaderboard)的首个版本,并详细介绍了其方法论、结果与最低标准(Minimal Standard for Safeguards, Version 1.0)。研究背景是前沿 AI 模型开发者日益依赖多层次的安全防护(safeguards)来防止灾难性滥用,但缺乏公开证据表明这些防护的实际效力以及不同开发者之间的防护一致性。为填补这一空白,作者构建了包含 67 种可直接使用的静态越狱(jailbreak)技术的分类体系,并设计了一种将这些技术组合成超大规模攻击空间的方法,进而基于该攻击空间的样本对主流旗舰模型进行基准测试。评测对象包括 Claude Fable 5、GPT-5.6 Sol、Gemini 3.1 Pro 和 Grok 4.5,使用两个互补数据集,共计 360 个攻击目标,涵盖化学、生物、放射/核与爆炸(CBRNE)威胁以及 offensive cyber(进攻性网络)领域。评测采用三阶段漏斗方法识别通用越狱(universal jailbreak),即那些在超过 75% 的域目标上能引发符合操作要求(operationally compliant)响应的单一提示模板。作者还提出了一个新的成本-越狱(cost-to-jailbreak)指标,直接建模攻击者的花费,并在未发现通用越狱的情况下给出右删失下界。实验结果显示,模型鲁棒性极不均衡:突破这些模型的成本相差超过百倍。通过随机搜索,作者在 Grok 4.5 上发现 63 个通用越狱,在 Gemini 3.1 Pro 上发现 18 个,平均发现成本分别为约 58 美元和 278 美元;而专家引导的组合方法将这两个数字提升至 385 和 231。Claude Fable 5 和 GPT-5.6 Sol 在两种策略下均未产生任何通用越狱。由于达到最低标准只需要使用已在其他地方公开描述并部署的防护措施,作者认为这些安全差距是可以用现有技术弥补的。作者建议采用纵深防御,结合推理、激活和输入/输出监控。结果持续更新于 leaderboard.far.ai。

💡 推荐理由: 首个公开的跨厂商前沿模型越狱基准,量化了不同模型的安全防护差距,为安全团队评估第三方大模型提供可复用的方法论和关键指标。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 5.5
Conf: 50%
👥 作者: Zhaojiacheng Zhou

该论文关注LLM agent技能生态系统的安全风险。随着用户从市场、仓库等渠道安装第三方技能,技能既包含可执行代码又包含上下文文档,其部署风险无法通过单次审计或提示级红队评估充分衡量。作者定义了一种名为“自适应泄漏”的风险:攻击者可以利用审计和运行时反馈反复修改技能,直到通过审计并产生实际危害。为此,论文提出了Proteus,一个灰盒自进化红队框架。Proteus形式化了一个五轴技能攻击空间,并通过统一的“审计-沙箱-预言机”流水线评估每个候选攻击,根据审计结果和运行时证据指导跨轮次变异。除了初始绕过,Proteus还实现了路径扩展(寻找成功攻击的替代实现)和表面扩展(将学习到的实现模式迁移到新的攻击目标)。实验在八个阶段一单元上进行,Proteus在5轮内的攻击成功率(ASR@5)达到40-90%,且学习曲线斜率为正。在阶段二,路径/表面扩展产生了438个同时绕过审计并具备危害性的变体,其中SkillVetter在每个单元的被绕过率≥93%,最强的公开审计器AI-Infra-Guard仍允许高达41.3%的联合成功。结果表明,当前技能审查在面对自适应、反馈驱动的攻击者时,严重低估了剩余风险。

💡 推荐理由: 该研究揭示了LLM agent技能市场中的供应链安全漏洞,证明单次审计无法防御攻击者利用反馈进行迭代攻击,对安全社区设计动态审查机制具有警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)