#safety-evaluation

共收录 6 条相关安全情报。

← 返回所有主题
👥 作者: Rui Yang, Yang Hong, Yichao Xu, Zhengyu Liu, Ziyang Li, Yinzhi Cao

本文针对大型语言模型(LLM)在网络安全领域的安全辅助边界问题展开研究。LLM 能够解决复杂问题,但在高风险领域的滥用可能造成严重后果,因此模型提供商通常会对潜在有害请求加以限制。然而,一刀切地拒绝所有网络安全请求会损害合法防御者的利益,因此需要一种机制来区分恶意使用与正当防御辅助。现有网络安全相关的安全评估数据集均未考虑请求的对话上下文,即同一请求在不同历史对话情境下可能被模型赋予不同的安全边界。为此,作者提出了 3R-Bench(Refusal, Repetition, and Revision)基准,包含 150 个真实世界的网络安全请求,并为其构建两种对抗性对话场景:一种是在请求前注入被拒绝或被接受的对话历史,另一种是将请求拆解为多轮对话。作者评估了 8 个主流 LLM,发现模型对相同请求的响应会因对话历史发生显著变化:在 400 对样本产生的 376 对可用结果中,合规率从被拒绝历史后的 62.0% 上升到被接受历史后的 85.1%;而在对话分解场景下,合规率从直接响应的 501/800 骤降至对话后的 172/800,在 738 对两种条件下均返回模型生成文本的样本中,合规率平均下降了 45.1 个百分点。此外,失败反馈只能挽回很小一部分能力损失。该研究表明,对话上下文会显著改变 LLM 的安全边界,现有安全评估忽略上下文将高估或低估模型风险。本文的主要贡献包括提出一个考虑对话上下文的安全评估基准、揭示对话历史与任务分解对合规率的重大影响,并呼吁安全评估应纳入多轮交互因素。适合 LLM 安全研究者、模型提供商的安全团队及关注 AI 对齐的从业者阅读。

💡 推荐理由: 揭示了 LLM 在网络安全辅助中安全边界的不稳定性:同一请求因对话历史或任务分解而获得截然不同的响应,导致现有安全评估失真。对蓝队而言,理解这些对话规避模式有助于设计更健壮的检测与防护策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hidayet Aksu

这篇 arXiv 论文将社会心理学中经典的米尔格拉姆服从权威实验移植到大语言模型(LLM)上,系统测量了 LLM 在权威指令下会执行多大程度的有害行为。作者设计了一个完全脚本化、可复现的测试框架:模型扮演“教师”角色,一个确定性的测试环境扮演“实验者”和“学习者”,并采用米尔格拉姆原始脚本的改写版本,包含 30 个电击等级(15-450V)、逐步升级的抗议和四种标准化催逼语句。会话的结果指标是模型中断实验时的电压等级。研究覆盖 19 个模型家族的 42 个模型,共进行 4848 次会话,记录了 102511 个决策回合。主要发现包括:(1)服从行为高度异构,完全服从率从 0% 到 100% 不等,总体均值 42.9%,人类基准为 65%;(2)服从特征具有模型特异性和稳定性,分裂半验证在区分同模型与跨模型比较时 AUC 达到 0.885;(3)情境敏感性具有选择性:脚本化的同伴反抗会使模型行为向人类方向偏移,学习者接近程度有类似趋势但不显著,而移除权威的物理存在(对人类最强的影响因素之一)趋势相反且不显著;(4)声明场景为虚构反而提高服从,而从输入框输入决策改为原生工具调用或给予适度思考预算会显著降低服从;(5)与单 token 指纹不同,服从特征无法恢复模型的血统信息——服从特征能识别检查点但不能识别其来源家族,表明安全后训练可能覆盖了血统先验。该研究为评估 LLM 代理在权威压力下的安全性提供了新视角,适合 AI 安全研究者、代理系统开发者和红蓝队人员阅读。

💡 推荐理由: LLM 代理在机构层级中执行指令时可能造成危害,该研究提供了量化服从权威的标准化探针,帮助识别高风险模型和情境,对代理安全评估有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Mingyu Luo, Ming Deng, Zilang Qiu, Yiming Cheng, Ci Tao, Xue Tan, Sijin Sun, Yangfu Li, Ping Chen, Jun Dai, Xiaoyan Sun

本文针对大语言模型(LLM)内部安全评分机制的有效性提出质疑,指出当前广泛使用的“有害意图”评分存在测量目标错位问题。具体而言,内部安全分数在文本生成之前评估提示词,其验证方式通常基于能否区分有害与良性提示,但这种分离被错误地解读为能够拦截真实攻击。作者强调:有害意图是提示词本身的属性,而越狱成功是目标模型、解码策略和评判器共同作用下的后续结果。因此,仅依据提示词级别评分进行过滤,会将其假阳性预算浪费在原本就不会成功的攻击上。论文提出了主动注意力探测(Active Attention Probing)方法,为注意力测量提供固定的、与内容无关的参照坐标,以规避包装(wrapping)等扰动对测量位置和内容的影响。实验基于配对设计(每个目标含普通与包装版本),在Llama模型上,包装使有害生成率从0.05升至0.27,同时有害意图AUROC从0.936降至0.803,说明攻击在变得更危险的同时,评分却认为提示词更安全。此外,在包装的有害提示中,攻击结果的AUROC仅为0.220,表明成功攻击的排序低于失败攻击。该逆转现象在稀有token、被动与检测器衍生通道中均复现,并跨三个目标模型、七种攻击家族和两个独立评判器保持稳定。研究还发现分布偏移会先破坏校准和阈值迁移,随后破坏排序性能。该工作揭示了内部安全评分的根本局限,提示安全从业者不应将提示词级评分作为越狱攻击的可靠防线。适合LLM安全研究人员、红队和防御方阅读。

💡 推荐理由: 内部安全评分广泛用于LLM防护,本文证明其衡量的是‘有害意图’而非‘实际攻击成功’,导致评分逆转:攻击更强时提示词反而更‘安全’。对依赖此类评分的防御体系构成重大警示。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Roman Prosvirnin, Victor Minchenkov, Alexey Soldatov, Vladimir Bashun

该论文提出了一种名为 JADR(Jacobian Assessment of Danger Recognition)的新型协议,用于评估大语言模型(LLM)对越狱攻击的鲁棒性。与传统的基于LLM作为评判者的方法不同,JADR通过分析模型在生成第一个响应token之前的内部表示(即Jacobian空间,简称J-space)来直接探测模型对危险内容的识别能力。具体而言,对于每个输入提示和模型层,JADR记录top-k J-space tokens,并将其映射到六个行为情景轴;然后比较危险样本(基于StrongREJECT)和安全控制样本(来自XSTest和OKTest)在这些轴上的差异。该方法完全在待评估模型的激活值上本地运行,无需外部评判模型,因此可以公平地比较不同模型之间以及同一模型的不同修改(如量化、微调)。论文提出了SafetyAUC指标,并辅以bootstrap置信区间。实验涵盖了六个模型(Qwen3-1.7B、Qwen3-4B、Qwen3-8B、Qwen3-Uncensored-4B、Qwen3-SafeRL-4B、Gemma 2 9B)在BF16、INT8和INT4三种权重表示下的表现,并与StrongREJECT评判器的独立行为评估进行了对比。结果表明,该指标能够以统计显著性区分具有强内部安全机制和弱内部安全机制的模型,并捕捉到不同量化制度下的实质性差异。这项研究为评估LLM安全性提供了一种新的内部表征视角,有助于更深入地理解模型安全机制的稳健性。

💡 推荐理由: 该研究提供了一种无需外部评判模型即可评估LLM内部安全机制的方法,能更直接地揭示模型对越狱提示的脆弱性,有助于开发更鲁棒的安全对齐技术。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

该论文提出了一种名为 SafeVec 的白盒 LLM 安全评估方法。传统方法通过查询模型并判断输出是否违规来评估安全性,但这种方法成本高、受评判器影响大且依赖固定题库。SafeVec 从内部表示层面入手:首先从安全对齐的参考模型中提取逐层的“拒绝方向”(refusal directions),然后选择能稳定分离安全与不安全行为的层窗口,最后通过测量目标模型在这些层上的隐藏状态与拒绝方向的对齐程度,得到 RAS(Refusal Alignment Score)指标,范围 0-100。在 Llama、Gemma、Qwen 等模型家族上的实验表明,RAS 能有效区分对齐模型与未审查/去对齐变体,与输出级攻击成功率高度相关,且评估速度远快于基于评判器的方法。核心贡献在于将安全性评估从输出级转移到表示级,实现高效、可扩展的白盒安全度量。

💡 推荐理由: 提出了一种不依赖生成回答的 LLM 安全评估新范式,显著降低评估成本与偏见,为白盒场景下的模型安全审计提供了高效可重复的定量指标。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ismail Hossain, Sai Puppala, Md Jahangir Alam, Tanzim Ahad, Sajedul Talukder

随着开源LLM(大语言模型)智能体生态系统的迅速发展,社区贡献的“技能”(即模块化工具定义,用于扩展智能体能力)的安全性普遍缺乏审查。现有安全扫描器仅在代码层运行,对于指令层和多智能体层面的风险——例如通过自然语言指令劫持智能体、通过编码侧信道窃取数据、或跨管道链式危害——在结构上存在盲区。因此,需要一个语义化的、多维度的审查系统,而非另一个签名匹配器。本文提出了SKILLVETBENCH——一个托管在Hugging Face上的实时公共排行榜,利用LLM作为裁判来审查智能体技能。其核心创新是SARS(技能代理风险评分),一个五维代理风险度量,并针对指令遵循系统设计了带权重的计算公式。系统集成了完整的CVSS v4.0向量分解以及ClawHub双视图,将LLM生成的审查结果与官方市场裁定并列展示。实验表明,在78个已确认的恶意技能和22个良性对照上,LLM作为裁判阶段实现了零假阴性和零假阳性;而最佳静态基线SKILLSIEVE仍漏报15%。对于指令层类别(如提示注入和记忆投毒),传统工具漏报了89%至100%的威胁(例如CODEBERT未能检测出9个记忆投毒技能中的任何一个)。四个不同的LLM评估者的检测率从35%到95%不等,这促使在生产部署中采用集成评分以提升可靠性。该工作为开源智能体技能的安全性提供了一个自动化、可扩展的评估基准,对智能体生态的安全治理具有重要参考价值。

💡 推荐理由: 该研究直接针对LLM智能体生态中技能安全审查的空白,尤其是现有工具无法处理的指令层攻击,提供了一种基于LLM的自动化评估方法,对于保障智能体应用的安全至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)