文本转语音(TTS)基础模型正越来越多地被用于在私有数据集上微调以合成高度个性化的声音,但这同时引入了严重的隐私风险,因为语音既包含生物特征身份又包含敏感语音内容。现有的黑盒成员推理攻击(MIA)通常采用查询生成和表示工程两阶段流程,但直接应用于TTS时会面临特有挑战:在查询生成方面,合成文本与参考语音的双重条件构成一个庞大且未被充分探索的查询空间,缺乏确定有效查询的准则;在表示工程方面,语音的多层次时序特征使得低级表示和直接比较难以有效捕获成员信号。为此,作者提出了第一个专门针对TTS模型的黑盒MIA框架,同时在说话人层面和记录层面开展工作。在查询生成上,他们刻画了可行查询空间的边界,并提出了两个评估标准(可评分程度和记忆诱导),据此比较了五种代表性查询,发现逐字复述(recitation)是攻击效果最强的查询策略。在表示工程上,他们从外部嵌入模型中提取多级语音表示,并对生成音频与目标音频实施时间对齐,以实现细粒度的成员信号比较。实验覆盖三种最先进的TTS模型(CosyVoice2、F5-TTS、XTTS-v2)和两个公开基准数据集(VCTK与British Dialect),结果显示隐私泄漏严重:说话人级别的AUC在最强设置下仍高于0.80并接近1.0,记录级别AUC则稳定在0.80至0.90之间;即使在成员与非成员均来自同一说话人的高难度场景下,攻击依然有效。此外,作者还识别出与过度记忆高度关联的若干语音特征。该研究首次系统揭示了TTS微调模型的成员推理暴露面,为隐私保护和风险评估提供了关键基础。适合关注语音模型隐私、AI安全及数据治理的研究人员与安全工程师阅读。
💡 推荐理由: 微调TTS模型已广泛应用于个性化语音服务,但研究揭示黑盒攻击者可高精度判断某段音频是否在训练集中,直接导致生物识别信息与敏感语音内容泄露。安全从业者需意识到此类模型的隐私风险,并主动开展风险评估。
🎯 建议动作: 研究跟进