#speaker-inversion

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Ye Lu, Yihan Yan, Zhaoyang Zhang, Zhitao Ou, Runze Liu, Li Liu, Shen Wang

本文研究端到端语音语言模型中语音令牌(speech tokens)泄露用户声纹的风险。传统级联架构(ASR-LLM-TTS)将语音转文本再合成,而端到端模型直接使用离散语音令牌表示语音,虽降低了延迟并提升了表现力,但这些令牌可能保留说话人的敏感特征。作者将此风险形式化为“说话人反转攻击”(Speaker Inversion Attack):攻击者窃听到模型前端的语音令牌输出后,能否恢复出说话人的声纹嵌入。 为此,作者提出Audio BERT(AuB),一个可训练的模型,从离散码本构建令牌嵌入并聚合为说话人敏感表示;并进一步提出SpInv,一种两阶段反转方法:第一阶段使用AuB从语音令牌重建说话人嵌入,第二阶段将其映射到攻击者指定的说话人编码器空间(如ResNetSE34)。实验在VoxCeleb数据集上评测了Moshi、Higgs3、Kimi-Audio、Qwen3-Omni四个模型,采用说话人不重叠的协议。结果表明:仅需3秒的前端输出,SpInv在攻击者指定的说话人编码器空间中即可达到0.70以上的余弦相似度,证实语音令牌确实泄露声纹。 主要贡献:首次系统化研究语音令牌的声纹泄露风险;提出AuB和SpInv攻击方法;在多个最新模型上验证了攻击可行性。适合关注语音隐私、端到端语音模型安全的从业者和研究人员阅读。

💡 推荐理由: 声纹作为生物特征,泄露后可能导致身份冒充或跟踪。随着端到端语音模型广泛应用,语音令牌的隐私风险亟待防御。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)