#speech-privacy

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Pavlos Nicolaou, Christos Efstratiou

针对辅助生活场景中老年人日常活动监测的声学传感技术,语音隐私泄露是阻碍其实际部署的关键壁垒。本文提出了一种基于U-Net编码器-解码器结构的隐私防火墙管道,完全使用合成数据训练,能够从环境音频中移除语音成分,同时保留与日常活动相关的环境声音信号。活动识别模块采用VGGish迁移学习结合SVM分类器实现。作者在ESC-50和SINS数据集上,于多种语音含量条件下评估了该方案,结果显示所有测试场景下残留语音均降至Silero语音活动检测器(VAD)的0%可检率,在ESC-50数据集100%语音水平下显著优于Facebook Denoiser(残留率6.55%)、SepFormer(36.34%)和ConvTasNet(47.21%)。在ESC-50的40%语音水平条件下,语音移除后的活动分类性能恢复至85%精确率和85%召回率,而移除前仅为81%/75%,无语音基线为84%/83%。进一步,在通过AudioHive应用采集的真实家庭居住者录音评估中,处理后的音频同样实现了0%的VAD可检语音,并保持了76%的精确率与召回率。该管道在几乎不影响活动识别性能的前提下实现了隐私保护的声学传感,为老年照护环境中环境监测技术的落地扫清了重要障碍。研究核心贡献在于:设计了基于合成数据训练的语音分离专用网络,实现了高鲁棒的隐私保护;系统验证了语音移除对下游活动识别任务的影响;并通过真实场景数据证明了实用性。适合智能健康监测、人机交互及隐私计算方向的研究者和工程师参考。

💡 推荐理由: 该研究为麦克风环境监测中的语音隐私问题提供了一种可复现的解决方案,利用合成数据训练达到完全去除语音的效果,并保持活动识别精度,对智能养老、家庭监护等场景的隐私合规设计具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Henriette Flore Kenne, Raphael Anaadumba, Mohammad Arif Ul Alam

该论文提出了一种多级隐私保护框架,用于从语音中进行痴呆症检测,同时防止说话人身份泄露。现有方法通常只解决单一威胁(如仅信号级或特征级),且难以平衡隐私保护与检测效用。本文设计的框架针对两种窃听向量:在信号级,提出累积信号攻击(CSA),通过在关键词对齐区域集中添加扰动,最大化语音转录错误率(词错误率WER=1.00),同时保留关键的韵律生物标志物;在特征级,利用梯度反转层(GRL)结合互信息(MI)引导的噪声注入,抑制说话人判别性维度,同时保留与痴呆症相关的诊断结构。在DementiaBank Pitt语料库上评估,框架在说话人识别任务上达到接近随机水平(等错误率EER=0.59,F1=0.003),同时保持较好的痴呆症分类性能(F1=0.78,AUC=0.86)。实验表明,该框架有效解决了隐私-效用权衡问题,为敏感医疗语音数据的安全利用提供了新思路。

💡 推荐理由: 医疗语音数据包含丰富的身份信息,直接用于痴呆症检测存在隐私风险。本文首次通过信号级和特征级双重对抗扰动,在保护说话人身份的同时维持诊断性能,为隐私保护语音分析领域提供了可操作的技术方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)