#black-box-audit

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Xiangfan Wu, Zonghao Ying, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

随着大语言模型(LLM)的广泛部署,第三方供应商提供的开源权重模型推理服务已成为生态系统的重要一环,但对其推理 API 质量的审计仍然是一个开放问题。本文提出 Ventor-QTest,一种无需目标 API 提供任何概率信息的复合黑盒审计方法。该方法将宿主模型路由视为随机过程,通过两个互补组件度量保真度损失:重复请求组件将每个固定的受限上下文多次发送至目标 API,根据返回文本计数重建分类输出分布,并计算平均保真度损失(AFL),该指标是经过零偏差校正、窗口内平均的粗粒化 KL 散度统计量;长序列组件则通过多次独立运行,基于运行级参考中心惊奇统计量的经验上尾报告极端保真度损失(EFL)。实验在三个支持 logprob 的路由条件下验证了 AFL 与基于 logprob 推导的粗粒化 KL 比较器之间存在强线性一致性;在七个路由快照上,20 轮序列探测揭示了不同路由特有的 EFL 变化。AFL 和 EFL 与 GPQA-Diamond 准确率无明显关联,但显著的 EFL 与 Terminal-Bench 通过率随任务暴露增加而下降的现象吻合,表明长跨度任务的正确性对极端保真度损失更为敏感。这些结果支持在审计长视野代理任务时联合报告 AFL 和 EFL。实现已开源(https://github.com/Tencent/AI-Infra-Guard/tree/main/services/api_checker/ventor_qtest),适合 LLM 安全研究者、模型审计工程师及依赖第三方推理 API 的组织阅读。

💡 推荐理由: 该研究提供了一种无需内部信息的黑盒审计框架,可客观量化托管 LLM API 的保真度损失,尤其适合检测长跨度代理任务的异常退化,为第三方大模型服务的信任评估提供新工具。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuewei Zhang, Zhi-Hai Zhang, Hanzhang Qin

商业大语言模型(LLM)网关作为用户与托管模型之间的中介,用户期望调用的是广告中宣称的模型。然而,实际后端可能被替换为更便宜的模型(完全替换),或者仅将部分请求(比例ε)路由至宣称模型而其余请求使用其他模型(路由稀释)。现有黑盒审计方法通常需要特权信号(如对数概率、token排名或参考样本)或特定目标探针,且预先固定查询预算,仅返回是/否判断,无法同时检测替换与稀释、归因后端、估计ε以及自适应预算。本文提出IRIS,一种仅依赖返回文本的黑盒审计方法。IRIS要求端点生成随机数或字符串,以此作为后端的指纹。其核心创新包括:(1) 首次在单一纯文本审计中同时实现全流替换与分数稀释检测、后端归因、路由比例ε估计以及自适应查询预算;(2) 使用廉价试点阶段拟合指数级查询-误差衰减曲线,在发出任何可疑查询前冻结预算;(3) 在Qwen3模型族内实验中,后端验证AUROC达0.99,且随查询积累归因精度提升;在商业OpenRouter库中,对于边际合格的模型对,以0.017假阳性率检测ε=0.3的稀释,平均功效0.85,ε估计误差在0.04以内;(4) 跨提供商在线审计中,通过量化与内核偏差标记出15个同模型提供商对中的14个,并在第三方MET轨迹上得到验证;(5) 与可比黑盒审计相比,IRIS在共享任务上匹配或超越检测性能,自适应分配将匹配预算的目标命中率从73%提升至87%。此外,论文还涵盖对抗性网关、可识别性、未见稀释剂及假阳性控制等实验。该方法适合AI安全研究员、云服务审计人员以及LLM网关部署方阅读。

💡 推荐理由: LLM网关被替换或稀释可能导致用户获得低质量服务且支付超额费用,IRIS提供了首个仅需返回文本的通用审计方案,能自动估计路由比例并自适应查询预算,对保障LLM服务透明性和公平性有重要实践价值。

🎯 建议动作: 纳入内部评估:如部署LLM网关或使用第三方API,可考虑将IRIS集成至定期审计流程中以检测模型替换与路由稀释。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)