#black-box-audit

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yuewei Zhang, Zhi-Hai Zhang, Hanzhang Qin

商业大语言模型(LLM)网关作为用户与托管模型之间的中介,用户期望调用的是广告中宣称的模型。然而,实际后端可能被替换为更便宜的模型(完全替换),或者仅将部分请求(比例ε)路由至宣称模型而其余请求使用其他模型(路由稀释)。现有黑盒审计方法通常需要特权信号(如对数概率、token排名或参考样本)或特定目标探针,且预先固定查询预算,仅返回是/否判断,无法同时检测替换与稀释、归因后端、估计ε以及自适应预算。本文提出IRIS,一种仅依赖返回文本的黑盒审计方法。IRIS要求端点生成随机数或字符串,以此作为后端的指纹。其核心创新包括:(1) 首次在单一纯文本审计中同时实现全流替换与分数稀释检测、后端归因、路由比例ε估计以及自适应查询预算;(2) 使用廉价试点阶段拟合指数级查询-误差衰减曲线,在发出任何可疑查询前冻结预算;(3) 在Qwen3模型族内实验中,后端验证AUROC达0.99,且随查询积累归因精度提升;在商业OpenRouter库中,对于边际合格的模型对,以0.017假阳性率检测ε=0.3的稀释,平均功效0.85,ε估计误差在0.04以内;(4) 跨提供商在线审计中,通过量化与内核偏差标记出15个同模型提供商对中的14个,并在第三方MET轨迹上得到验证;(5) 与可比黑盒审计相比,IRIS在共享任务上匹配或超越检测性能,自适应分配将匹配预算的目标命中率从73%提升至87%。此外,论文还涵盖对抗性网关、可识别性、未见稀释剂及假阳性控制等实验。该方法适合AI安全研究员、云服务审计人员以及LLM网关部署方阅读。

💡 推荐理由: LLM网关被替换或稀释可能导致用户获得低质量服务且支付超额费用,IRIS提供了首个仅需返回文本的通用审计方案,能自动估计路由比例并自适应查询预算,对保障LLM服务透明性和公平性有重要实践价值。

🎯 建议动作: 纳入内部评估:如部署LLM网关或使用第三方API,可考虑将IRIS集成至定期审计流程中以检测模型替换与路由稀释。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)