#generative-speech

共收录 1 条相关安全情报。

← 返回所有主题
推荐 3.5
Conf: 50%
👥 作者: David Chernin, Ethan Fetaya

本文提出了一种名为 CRAW(Codec Robust Audio Watermarking)的音频水印框架,旨在解决生成式语音模型带来的虚假音频鉴别难题。近年来,生成语音模型使得合成音频与真实音频的区分愈发困难,可能被用于欺诈和虚假信息传播。音频水印通过在生成语音中嵌入不可感知的信号,并在后续检测中验证音频来源,是一种有前景的防御手段。然而,现有的事后水印方法在真实世界常见的神经编解码器、降噪器和声码器处理下鲁棒性不足,容易失效。CRAW 通过联合优化神经重合成鲁棒性并保持高感知质量,其核心贡献包括:失真感知训练、基于注意力的池化机制、推理时感知掩蔽,以及用于恢复鲁棒训练中损失保真度的纠错编码。实验结果表明,CRAW 在神经编解码器、降噪器和声码器下达到了最先进的鲁棒性,同时感知质量与现有事后水印方法相当。代码已开源。该研究适合关注深度伪造防御、音频溯源和生成式 AI 安全的从业者阅读。

💡 推荐理由: 生成语音滥用风险日益突出,音频水印是关键的防御技术。CRAW 显著提升了在真实传输链路下的鲁棒性,为音频来源认证和深伪检测提供了可行方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)