该论文提出 CallScreenBench,一个用于评估端侧(On-Device)语言模型充当“电话秘书”能力的基准测试。研究背景是:随着可量化到数比特的小型语言模型在手机上运行,由其代表用户自动处理来电成为可能。与大多数基准测试中的智能体不同,电话秘书没有明确的任务目标,也没有合作的用户:来电方掌握对话意图,可能是恶意对手,且秘书必须从第一句话开始就做出判断,没有外部提示或工具参考。衡量标准不是任务成功率,而是机主是否认可代理对通话的处理方式。CallScreenBench 从五个质量维度进行评分,每个维度都与对应的反向指标并列展示,且不合并为单一总分。论文还报告了一个无工具、不持有凭据的代理的“防范度”(guardedness)画像。实验在六个端侧模型(0.6-4B 参数,4-bit 量化)上进行,结果显示质量随模型能力提升而提升,但分流(triage)能力并不随能力提升。看似相关的现象实际上是测量伪影。通过引入脚本化的退化智能体(如直接挂断或简单回显)作为下限,修正后,在预注册的操作点上,能够区分分流性能的模型对数从 15 对中的 11 对降至 0 对。此外,一个只会挂断并回显来电者的智能体也能在信息保真度上得满分。论文报告了这些下限对各个指标的具体影响,并声明不设定通过/失败阈值。这项研究对评估端侧 AI 代理在真实、对抗性交互场景中的鲁棒性具有重要意义。
💡 推荐理由: 为端侧LLM代理在真实电话场景中的安全性评估提供了系统化基准,揭示现有基准可能高估模型分流能力,对防御部署具有警示意义。
🎯 建议动作: 研究跟进