#whisper

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Mohsen Seyedkazemi Ardebili

该论文提出并实现了一个名为 YazSes 的离线、隐私优先、跨平台的按住说话(hold-to-talk)语音听写系统。研究背景是:云端语音听写服务虽然准确率高,但需要将用户语音流式传输到远程服务器,这在隐私敏感的职业场景以及离线或气隙(air-gapped)环境中不可接受;而现有的主流端侧(on-device)替代方案要么被平台锁定,要么面向专家级脚本编写而非即插即用的听写需求。YazSes 采用 Apache-2.0 开源协议,完全在设备本地运行,通过基于协议的平台抽象层,用单一代码库支持 Linux、macOS 和 Windows。系统使用 faster-whisper(CPU、int8 量化)在本地转录语音,并将结果注入当前聚焦的应用程序;同时设计了一种快速正则表达式命令语法,辅以一个可选的小型语言模型路由器,将语音映射到编辑器或终端操作。在隐私保护方面,系统采用按住说话而非持续监听,无遥测数据,可选的个性化循环将语料库在设备上加密保存,并仅建议配置更改而非导出数据。论文详细描述了系统架构——基于协议平台抽象的分阶段流水线,以及 JSON-RPC 控制平面——并分析了其隐私与威胁模型。实验在单台普通 Linux 笔记本上进行评估;macOS 和 Windows 后端已实现并通过单元测试,但未进行端到端评估。在包含 40 位说话人的 200 条 LibriSpeech 测试集干净样本上,词错误率从 tiny.en 的 4.82% 到 small.en 的 2.59%,small.en 的实时因子为 0.520,即在无 GPU 的 CPU 上解码速度快于实时。命令语法在普通听写场景下达到 100% 的动作准确率和 0.0% 误报率,每次调用耗时 0.021 毫秒,非解码流水线额外开销为 0.289 毫秒。论文所有数据均基于公开的可复现基准测试工具。该工作适合对隐私保护语音交互、离线环境下的生产力工具、以及跨平台端侧人工智能系统感兴趣的开发者和安全研究人员。

💡 推荐理由: 该研究展示了如何在无云端依赖的情况下实现高准确率语音听写,对隐私敏感行业和离线环境具有直接价值;其架构设计和威胁模型分析可为构建本地优先的 AI 工具提供安全参考。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)