#on-device

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Simiao Ren

该论文提出 CallScreenBench,一个用于评估端侧(On-Device)语言模型充当“电话秘书”能力的基准测试。研究背景是:随着可量化到数比特的小型语言模型在手机上运行,由其代表用户自动处理来电成为可能。与大多数基准测试中的智能体不同,电话秘书没有明确的任务目标,也没有合作的用户:来电方掌握对话意图,可能是恶意对手,且秘书必须从第一句话开始就做出判断,没有外部提示或工具参考。衡量标准不是任务成功率,而是机主是否认可代理对通话的处理方式。CallScreenBench 从五个质量维度进行评分,每个维度都与对应的反向指标并列展示,且不合并为单一总分。论文还报告了一个无工具、不持有凭据的代理的“防范度”(guardedness)画像。实验在六个端侧模型(0.6-4B 参数,4-bit 量化)上进行,结果显示质量随模型能力提升而提升,但分流(triage)能力并不随能力提升。看似相关的现象实际上是测量伪影。通过引入脚本化的退化智能体(如直接挂断或简单回显)作为下限,修正后,在预注册的操作点上,能够区分分流性能的模型对数从 15 对中的 11 对降至 0 对。此外,一个只会挂断并回显来电者的智能体也能在信息保真度上得满分。论文报告了这些下限对各个指标的具体影响,并声明不设定通过/失败阈值。这项研究对评估端侧 AI 代理在真实、对抗性交互场景中的鲁棒性具有重要意义。

💡 推荐理由: 为端侧LLM代理在真实电话场景中的安全性评估提供了系统化基准,揭示现有基准可能高估模型分流能力,对防御部署具有警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mohsen Seyedkazemi Ardebili

该论文提出并实现了一个名为 YazSes 的离线、隐私优先、跨平台的按住说话(hold-to-talk)语音听写系统。研究背景是:云端语音听写服务虽然准确率高,但需要将用户语音流式传输到远程服务器,这在隐私敏感的职业场景以及离线或气隙(air-gapped)环境中不可接受;而现有的主流端侧(on-device)替代方案要么被平台锁定,要么面向专家级脚本编写而非即插即用的听写需求。YazSes 采用 Apache-2.0 开源协议,完全在设备本地运行,通过基于协议的平台抽象层,用单一代码库支持 Linux、macOS 和 Windows。系统使用 faster-whisper(CPU、int8 量化)在本地转录语音,并将结果注入当前聚焦的应用程序;同时设计了一种快速正则表达式命令语法,辅以一个可选的小型语言模型路由器,将语音映射到编辑器或终端操作。在隐私保护方面,系统采用按住说话而非持续监听,无遥测数据,可选的个性化循环将语料库在设备上加密保存,并仅建议配置更改而非导出数据。论文详细描述了系统架构——基于协议平台抽象的分阶段流水线,以及 JSON-RPC 控制平面——并分析了其隐私与威胁模型。实验在单台普通 Linux 笔记本上进行评估;macOS 和 Windows 后端已实现并通过单元测试,但未进行端到端评估。在包含 40 位说话人的 200 条 LibriSpeech 测试集干净样本上,词错误率从 tiny.en 的 4.82% 到 small.en 的 2.59%,small.en 的实时因子为 0.520,即在无 GPU 的 CPU 上解码速度快于实时。命令语法在普通听写场景下达到 100% 的动作准确率和 0.0% 误报率,每次调用耗时 0.021 毫秒,非解码流水线额外开销为 0.289 毫秒。论文所有数据均基于公开的可复现基准测试工具。该工作适合对隐私保护语音交互、离线环境下的生产力工具、以及跨平台端侧人工智能系统感兴趣的开发者和安全研究人员。

💡 推荐理由: 该研究展示了如何在无云端依赖的情况下实现高准确率语音听写,对隐私敏感行业和离线环境具有直接价值;其架构设计和威胁模型分析可为构建本地优先的 AI 工具提供安全参考。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)