#model-auditing

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Xun Wang, Bihe Zhao, Michael Backes, Franziska Boenisch, Adam Dziedzic

本文针对商用LLM API中模型身份被悄悄替换(如用较小模型替代、量化或包装)导致的不透明现象,提出了一种新的审计方法。现有审计大多基于文本输出通道来判断模型身份,但在代理型(agentic)API场景中,由于模型调用工具时服务堆栈(如OpenAI、Anthropic、Gemini等)会丢弃文本并仅暴露结构化动作,加上服务提供商注入系统提示词会扭曲文本分布,使得文本通道的测试极易产生误报。作者观察到最新的代理型后训练技术已将工具使用能力内化到模型权重中,从而开辟了一条新的审计通道:动作通道。该通道由服务堆栈直接暴露,且基本不受部署上下文影响。基于这一洞察,论文提出了Agentic Provenance (AgentProv),这是一种首个基于动作的身份审计方法。AgentProv通过收集模型在工具调用时的分类分布来为部署模型生成指纹,并使用最大均值差异(MMD)置换检验来判定模型身份是否与宣称一致。实验表明,在630个检查点对上,AgentProv能够以100%的召回率捕获所有被替换的模型,同时在系统提示词注入干扰下,假阳性率仅为7%(而对比的MET方法为67%,RUT方法为53%)。此外,在第三方API端点上的测试中,AgentProv与MET的分歧结果与一个独立的令牌计数侧信道一致,后者可辅助检测服务商是否注入了系统提示词。总体而言,该工作为代理型LLM API的模型身份审计提供了新的可靠途径,对保障AI供应链的安全性和透明度具有重要意义。

💡 推荐理由: LLM API提供商可能静默替换模型以降低成本,而现有文本通道审计在代理型API下不可靠。AgentProv开创了基于工具调用分布的新审计方向,有助于防御方检测模型身份欺骗、确保AI供应链透明,防止因模型替换导致的安全或合规风险。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yinbo Yu, Xueyu Yin, Jing Fang, Chunwei Tian, Qi Zhu, Jiajia Liu, Daoqiang Zhang

深度神经网络(DNN)仍然容易受到后门攻击,现有后门检测方法通常需要干净数据、代理数据、梯度或迭代触发器重建,导致计算成本高且在实际模型审计场景中鲁棒性有限。本文提出HTell,一种快速、轻量级且无需数据的后门检测方法,基于头部随机探针技术。HTell的核心洞察是:后门模型在随机潜在探针下,预测头部的目标类别上往往表现出异常高的响应集中度。该方法首先生成架构感知的随机潜在探针,直接馈入模型头部,然后通过分析类别级响应统计量来检测后门,无需访问真实/代理数据、模型梯度或参数优化。在包含超过6000个后门模型和700多个干净模型的大规模基准上进行评估,覆盖4个数据集、14种架构和21种后门攻击类型。HTell实现了99.03%的真阳性率和2.11%的假阳性率,每模型检测延迟仅为12.69毫秒,相比基于梯度的代表性检测器时间成本降低超过30,000倍。结果表明,头部随机探针为大规模无数据后门模型审计提供了准确、鲁棒且高效的解决方案。

💡 推荐理由: HTell实现了无需数据、快速且高精度的后门检测,大幅降低了模型审计的计算门槛,适合安全团队在本地或云端大规模部署前对第三方模型进行黑盒筛查。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)