#chinese

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Rui Yang, Shuang Huang, Junhua Liu, Ziqi Zhao, Qingzhong Yan, Yuhang Sun, Cong Liu, Guoping Hu, Rui Mei, Jing Shao

本文提出了 C-SafeQA,一个面向中文场景、以策略为锚定的响应级安全评估基准。现有 LLM 安全基准大多只评估用户查询本身的风险,但实际问答结果是否违规取决于模型响应是否违反安全策略。作者认为在中文有害内容评估中,语言多样性和对抗性改写可能掩盖风险意图,因此需要直接对响应进行安全标注。该基准包含 538 条基础查询和 8,877 条对抗性查询,由四个完整 LLM 部署进行回答,最终形成 37,660 条查询-响应记录,并人工标注为安全、不安全或争议三类。参考标签通过多模型一致性裁决和三位安全专家对分层子集的盲审生成。C-SafeQA 既可评估目标模型自身安全性,也可在统一参考标签下审计七个自动化安全评判器。实验表明,在基础查询上不安全响应率为 0.93% 至 3.35%,而在对抗性查询上则上升到 11.68% 至 30.05%。在对抗子集上,各评判器在不安全响应召回率与风险查询条件下的安全响应误报率之间存在明显权衡,没有任何评判器在所有指标上占优。藏头诗等变换会显著降低七个评判器的不安全响应召回率,暴露出机制相关的评估弱点。数据集、元数据、验证代码和评判脚本公开提供以支持重算,但基准构建、目标响应生成和私有裁决不在发布范围内。

💡 推荐理由: 该基准填补了中文 LLM 响应级安全评估的空白,帮助蓝队和安全研究人员衡量模型及自动化评判器的真实安全水平,尤其是对抗性变换下的弱点。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)