#multilingual-llm-safety

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Chigozirim Ifebi, Brent Kong, Ayushi Mehrotra

该论文提出了一个名为Minionese的多语言大语言模型安全对齐基准测试,覆盖18种语言、4个资源层级和4种扰动类型(标准翻译、代码切换、音译、翻译腔)。研究发现,不同扰动类型会产生不同的安全漏洞轮廓:音译漏洞受文字系统身份影响,代码切换在最低资源层级仍保持有效性,而在所有模型中都观察到资源层级2和3之间存在明显的安全机制转变。从机制上分析,低资源语言的越狱成功是因为将有害内容通过几何上未对齐的子空间路由,该子空间在拒绝方向上投影不足,导致拒绝机制完好但未被触发。结果表明,仅进行英语安全评估是不够的,需要考虑文字家族、扰动类型和每种语言的对齐覆盖。论文提供了基准测试和分析代码。适合LLM安全研究人员、多语言NLP从业者阅读。

💡 推荐理由: 揭示了当前LLM安全对齐在多语言场景下的系统性脆弱性,尤其是低资源语言的攻击面,对构建真正鲁棒的多语言安全防护具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)