孟加拉语(Bangla)大语言模型的安全评测长期依赖英语中心或标准拼写基准,但真实用户常混用多种书写形式,包括标准孟加拉语、罗马化孟加拉语、Banglish(孟加拉语与英语混合)、代码混合孟加拉语-英语、噪声拼写及方言变体,导致现有安全评测严重失真。本文提出 BanglaVeilGuard,一个紧凑的“孟加拉语优先”安全基准与轻量级提示防护系统。基准部分包含 2,366 条经过质量过滤的提示,以及一个留出的 354 条评测集,覆盖不安全、安全及“安全但敏感”三类请求。BanglaVeilGuard 采用非破坏性的多视角归一化处理,结合提示风险分类器与基于阈值的生成前门控机制,在无需修改目标模型权重的前提下对异构目标模型进行提示筛查。在确定性响应评分下,受防护的 Claude Opus 4.8、BanglaLLama 和 TituLLM 的攻击成功率(ASR)从 93.8%–100.0% 降至 6.3%;TigerLLM-1B 配合 BanglaVeilGuard 达到 78.2% 的准确率和 8.8% 的 ASR。提示防护本身的不安全召回率达 88.5%,显著高于所对比的仅提示防护基线。主要代价是对方言和噪声良性提示的过度拒绝,这揭示了孟加拉语 LLM 部署中一条明确的安全-有用性权衡边界。本文的核心贡献在于首次系统性地将孟加拉语多脚本安全问题形式化,并提供了一个轻量、模型无关的缓解方案。适合 LLM 安全研究者、低资源语言 NLP 工程师以及负责多语言模型内容审核的安全团队阅读。
💡 推荐理由: 孟加拉语是低资源语言中用户基数极大的语言,其多脚本、代码混合特性使现有安全评测与防御失效。本研究提供了首个针对孟加拉语的轻量防护方案,对构建多语言安全护栏具有直接参考价值,也为低资源语言 LLM 的安全评测树立了范式。
🎯 建议动作: 研究跟进