#cross-lingual

共收录 1 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Alexander Nemecek, Osama Zafar, Debargha Ganguly, Vikash Singh, Vipin Chaudhary, Erman Ayday

该论文指出,当前大语言模型(LLM)输出水印方案的评估几乎完全基于英文文本,并且使用固定的检测阈值和狭窄的一组质量测量手段,这使得跨语言部署中的公平性问题被系统性忽视。作者提出了一套跨语言公平性审计框架,包含四个关键组成部分:第一,根据具体部署上下文经验校准检测阈值;第二,引入一种与阈值无关的伴随测量指标,用于区分校准失败与检测失败;第三,采用三种互斥的质量评估范式(分布相似性、配对语义相似性和参考困惑度);第四,使用广义熵分解方法,基于语言类型学家族划分来分析跨语言差异的来源。研究团队将这一框架应用于六种水印方案、三种开放权重生成器、涵盖四种文字系统和八个类型学家族的十一种语言,并同时考察了基础和指令调优两种配置。实验结果揭示了单语言、单范式评估无法发现的失败模式。在检测和质量两个维度上,观测到的差异主要集中在类型学家族之间,这表明跨语言公平性差距是语言结构属性的结构性结果,而非个别语言的独特怪癖。该框架为多语言部署下的水印公平性评估提供了系统方法论,有助于识别和修复潜在的跨语言偏差,对LLM内容溯源、版权保护和生成内容治理具有重要参考价值。适合自然语言处理、AI安全与隐私保护领域的研究人员阅读。

💡 推荐理由: 该研究首次系统性地审计LLM水印的跨语言公平性,揭示现有评估方法在多语言场景下的盲区。对于蓝队而言,理解水印的跨语言失效模式有助于在部署AI内容溯源与检测系统时避免误判和偏见。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)