#speech-recognition

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Xinfeng Li, Chen Yan 0001, Xuancun Lu, Zihan Zeng, Xiaoyu Ji 0001, Wenyuan Xu 0001

自动语音识别(ASR)系统已广泛应用于智能助手、语音控制、电话客服、会议转写等场景,其安全性直接关系到用户隐私和设备控制权。已有研究表明,ASR系统容易受到对抗样本(Adversarial Examples, AEs)的攻击,通过引入精心设计的微小扰动,可以诱导识别系统输出攻击者指定的错误文本。然而,许多既有对抗样本在物理世界中可能具有可听性,容易被用户察觉,从而降低攻击的隐蔽性和实用性。针对这一局限,本论文(标题为“Inaudible Adversarial Perturbation: Manipulating the Recognition of User Speech in Real Time”)提出了一种不可听的对抗扰动方法,目标是在实时场景下操纵用户语音的识别结果。该扰动的核心特点是人类听觉上难以察觉,但能够被ASR系统感知并导致误识别。论文可能利用人耳听觉系统的掩蔽效应或超声波等机制来生成此类不可听扰动,但具体的生成算法和架构细节在摘要中未明确给出。研究的主要贡献在于揭示了一种更为隐蔽的ASR攻击途径,使攻击者可以在用户无感的情况下控制语音识别结果,从而对智能设备或语音交互系统构成切实威胁。本篇摘要仅包含一句关于ASR系统易受对抗样本攻击的陈述,未提供实验数据、技术细节或评估结果,因此所有内容仅基于标题和该抽象句进行合理归纳。该研究适合语音安全研究者、ASR系统开发者以及关注对抗机器学习的安全从业者阅读,有助于理解下一代语音攻击的潜在形态。

💡 推荐理由: 语音助手和声控设备日益普及,如果攻击者能在用户无感知的情况下篡改语音识别结果,可能导致设备执行恶意指令、泄露隐私或造成安全事件。防御者需提前了解此类不可听攻击的存在,并评估自身系统的抗性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Hadi Abdullah, Muhammad Sajidur Rahman, Washington Garcia, Kevin Warren, Anurag Swarnim Yadav, Tom Shrimpton, Patrick Traynor

该论文提出了一种针对自动语音识别(ASR)和说话人识别(SV)系统的高效且可迁移的黑盒对抗攻击方法。作者指出,现有攻击往往需要大量查询或依赖白盒访问,实用性有限。他们提出了一种基于梯度估计的查询高效攻击,使用自然进化策略(NES)来近似模型梯度,并结合时间域和频域扰动约束,以生成人耳不易察觉但能有效欺骗模型的对抗样本。通过实验,他们在多个主流ASR系统(如DeepSpeech、Kaldi)和SV系统(如GE2E、SpeakerNet)上验证了攻击的有效性,显示出极高的攻击成功率(>90%)和跨模型迁移性,即在一个模型上生成的样本能成功攻击其他模型。此外,攻击仅需少量查询(约1000次)即可收敛,显著优于此前方法。核心贡献包括:1)首个同时针对ASR和SV的高效黑盒攻击框架;2)展示了攻击的跨平台可迁移性;3)扰动约束设计确保音频质量损失小。这项研究揭示了语音接口在安全部署中面临的实际威胁,提醒开发者需考虑对抗鲁棒性。

💡 推荐理由: 语音交互系统广泛部署,本攻击展示了黑盒场景下高效欺骗语音识别和声纹识别系统的可行性,威胁智能助手、声纹认证等安全敏感应用。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Jinwen Xin, Xixiang Lyu, Jing Ma

该研究聚焦于语音识别模型的后门攻击,提出了一种利用自然或日常生活中的声音(如雨声、鸟鸣等)作为触发器的自然后门攻击方法。与传统的后门攻击不同,自然触发器不需要人工合成噪声,而是直接使用环境中存在的、看似正常的音频信号,从而攻击更具隐蔽性和危害性。实验在两种数据集(如Google Speech Commands和LibriSpeech)和三种模型(如DeepSpeech、Wav2Vec2等)上进行,评估了投毒率、触发器持续时间和混合比例对攻击性能的影响。结果表明,仅需5%的投毒样本即可实现接近100%的攻击成功率,且对良性样本的模型性能无显著影响。即使触发器持续时间很短或幅度很低,攻击依然有效。研究者指出,这类后门会在自然环境中被相应声音自动激活,难以被传统防御手段检测,对语音助手、自动字幕等实际应用构成严重威胁。论文的主要贡献在于系统性地研究了自然后门攻击的条件和效果,揭示了语音识别系统在面对自然触发器时的脆弱性,并呼吁开发更鲁棒的防御机制。

💡 推荐理由: 语音识别系统广泛应用在智能设备、安全认证等场景,自然后门攻击利用环境声音作为触发器,隐蔽性极强,可能导致设备被恶意操控或敏感信息泄露,值得安全从业者提前防范。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinwen Xin, Xixiang Lv

本文提出 SpeechGuard,首个针对语音识别模型的在线后门防御流水线。后门攻击通过在训练阶段注入少量恶意样本,使模型在遇到特定触发器时输出攻击者指定的错误结果,这在自动驾驶语音交互等安全敏感场景中危害极大。SpeechGuard 针对音频信号特性,设计了两阶段防御:第一阶段基于改进的 STRIP 方法(S-STRIP),通过自适应扰动注入检测并过滤被投毒的音频样本;第二阶段利用时频(T-F)掩码抑制触发器信号的表达,并基于自编码器自动生成掩码,从而净化中毒样本,即使输入含有触发器的语音也能得到正确预测。实验表明,SpeechGuard 能准确过滤中毒样本,显著缓解后门威胁,同时保持较高的预测精度。

💡 推荐理由: 首次提出针对语音识别模型的在线后门防御方案,填补了运行时防御的空白,对自动驾驶等关键场景有直接应用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)