#safety-evaluation

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Roman Prosvirnin, Victor Minchenkov, Alexey Soldatov, Vladimir Bashun

该论文提出了一种名为 JADR(Jacobian Assessment of Danger Recognition)的新型协议,用于评估大语言模型(LLM)对越狱攻击的鲁棒性。与传统的基于LLM作为评判者的方法不同,JADR通过分析模型在生成第一个响应token之前的内部表示(即Jacobian空间,简称J-space)来直接探测模型对危险内容的识别能力。具体而言,对于每个输入提示和模型层,JADR记录top-k J-space tokens,并将其映射到六个行为情景轴;然后比较危险样本(基于StrongREJECT)和安全控制样本(来自XSTest和OKTest)在这些轴上的差异。该方法完全在待评估模型的激活值上本地运行,无需外部评判模型,因此可以公平地比较不同模型之间以及同一模型的不同修改(如量化、微调)。论文提出了SafetyAUC指标,并辅以bootstrap置信区间。实验涵盖了六个模型(Qwen3-1.7B、Qwen3-4B、Qwen3-8B、Qwen3-Uncensored-4B、Qwen3-SafeRL-4B、Gemma 2 9B)在BF16、INT8和INT4三种权重表示下的表现,并与StrongREJECT评判器的独立行为评估进行了对比。结果表明,该指标能够以统计显著性区分具有强内部安全机制和弱内部安全机制的模型,并捕捉到不同量化制度下的实质性差异。这项研究为评估LLM安全性提供了一种新的内部表征视角,有助于更深入地理解模型安全机制的稳健性。

💡 推荐理由: 该研究提供了一种无需外部评判模型即可评估LLM内部安全机制的方法,能更直接地揭示模型对越狱提示的脆弱性,有助于开发更鲁棒的安全对齐技术。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

该论文提出了一种名为 SafeVec 的白盒 LLM 安全评估方法。传统方法通过查询模型并判断输出是否违规来评估安全性,但这种方法成本高、受评判器影响大且依赖固定题库。SafeVec 从内部表示层面入手:首先从安全对齐的参考模型中提取逐层的“拒绝方向”(refusal directions),然后选择能稳定分离安全与不安全行为的层窗口,最后通过测量目标模型在这些层上的隐藏状态与拒绝方向的对齐程度,得到 RAS(Refusal Alignment Score)指标,范围 0-100。在 Llama、Gemma、Qwen 等模型家族上的实验表明,RAS 能有效区分对齐模型与未审查/去对齐变体,与输出级攻击成功率高度相关,且评估速度远快于基于评判器的方法。核心贡献在于将安全性评估从输出级转移到表示级,实现高效、可扩展的白盒安全度量。

💡 推荐理由: 提出了一种不依赖生成回答的 LLM 安全评估新范式,显著降低评估成本与偏见,为白盒场景下的模型安全审计提供了高效可重复的定量指标。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ismail Hossain, Sai Puppala, Md Jahangir Alam, Tanzim Ahad, Sajedul Talukder

随着开源LLM(大语言模型)智能体生态系统的迅速发展,社区贡献的“技能”(即模块化工具定义,用于扩展智能体能力)的安全性普遍缺乏审查。现有安全扫描器仅在代码层运行,对于指令层和多智能体层面的风险——例如通过自然语言指令劫持智能体、通过编码侧信道窃取数据、或跨管道链式危害——在结构上存在盲区。因此,需要一个语义化的、多维度的审查系统,而非另一个签名匹配器。本文提出了SKILLVETBENCH——一个托管在Hugging Face上的实时公共排行榜,利用LLM作为裁判来审查智能体技能。其核心创新是SARS(技能代理风险评分),一个五维代理风险度量,并针对指令遵循系统设计了带权重的计算公式。系统集成了完整的CVSS v4.0向量分解以及ClawHub双视图,将LLM生成的审查结果与官方市场裁定并列展示。实验表明,在78个已确认的恶意技能和22个良性对照上,LLM作为裁判阶段实现了零假阴性和零假阳性;而最佳静态基线SKILLSIEVE仍漏报15%。对于指令层类别(如提示注入和记忆投毒),传统工具漏报了89%至100%的威胁(例如CODEBERT未能检测出9个记忆投毒技能中的任何一个)。四个不同的LLM评估者的检测率从35%到95%不等,这促使在生产部署中采用集成评分以提升可靠性。该工作为开源智能体技能的安全性提供了一个自动化、可扩展的评估基准,对智能体生态的安全治理具有重要参考价值。

💡 推荐理由: 该研究直接针对LLM智能体生态中技能安全审查的空白,尤其是现有工具无法处理的指令层攻击,提供了一种基于LLM的自动化评估方法,对于保障智能体应用的安全至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)