#refusal-alignment

共收录 1 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

该论文提出了一种名为 SafeVec 的白盒 LLM 安全评估方法。传统方法通过查询模型并判断输出是否违规来评估安全性,但这种方法成本高、受评判器影响大且依赖固定题库。SafeVec 从内部表示层面入手:首先从安全对齐的参考模型中提取逐层的“拒绝方向”(refusal directions),然后选择能稳定分离安全与不安全行为的层窗口,最后通过测量目标模型在这些层上的隐藏状态与拒绝方向的对齐程度,得到 RAS(Refusal Alignment Score)指标,范围 0-100。在 Llama、Gemma、Qwen 等模型家族上的实验表明,RAS 能有效区分对齐模型与未审查/去对齐变体,与输出级攻击成功率高度相关,且评估速度远快于基于评判器的方法。核心贡献在于将安全性评估从输出级转移到表示级,实现高效、可扩展的白盒安全度量。

💡 推荐理由: 提出了一种不依赖生成回答的 LLM 安全评估新范式,显著降低评估成本与偏见,为白盒场景下的模型安全审计提供了高效可重复的定量指标。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)