针对辅助生活场景中老年人日常活动监测的声学传感技术,语音隐私泄露是阻碍其实际部署的关键壁垒。本文提出了一种基于U-Net编码器-解码器结构的隐私防火墙管道,完全使用合成数据训练,能够从环境音频中移除语音成分,同时保留与日常活动相关的环境声音信号。活动识别模块采用VGGish迁移学习结合SVM分类器实现。作者在ESC-50和SINS数据集上,于多种语音含量条件下评估了该方案,结果显示所有测试场景下残留语音均降至Silero语音活动检测器(VAD)的0%可检率,在ESC-50数据集100%语音水平下显著优于Facebook Denoiser(残留率6.55%)、SepFormer(36.34%)和ConvTasNet(47.21%)。在ESC-50的40%语音水平条件下,语音移除后的活动分类性能恢复至85%精确率和85%召回率,而移除前仅为81%/75%,无语音基线为84%/83%。进一步,在通过AudioHive应用采集的真实家庭居住者录音评估中,处理后的音频同样实现了0%的VAD可检语音,并保持了76%的精确率与召回率。该管道在几乎不影响活动识别性能的前提下实现了隐私保护的声学传感,为老年照护环境中环境监测技术的落地扫清了重要障碍。研究核心贡献在于:设计了基于合成数据训练的语音分离专用网络,实现了高鲁棒的隐私保护;系统验证了语音移除对下游活动识别任务的影响;并通过真实场景数据证明了实用性。适合智能健康监测、人机交互及隐私计算方向的研究者和工程师参考。
💡 推荐理由: 该研究为麦克风环境监测中的语音隐私问题提供了一种可复现的解决方案,利用合成数据训练达到完全去除语音的效果,并保持活动识别精度,对智能养老、家庭监护等场景的隐私合规设计具有直接参考价值。
🎯 建议动作: 研究跟进