#model-risk-management

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Sriram Nagaraj

传统模型风险管理(MRM)指南假设模型生命周期是静态的:模型经过开发、独立验证和部署后,不再进行自主修改。然而,持续自适应的生成式AI系统——即在生产部署过程中会不断更新自身权重的模型——从根本上违背了这一假设,使得时点验证(point-in-time validation)变得不充分。这篇论文针对由此产生的治理问题,分两部分提出了解决方案。第一部分为这类模型构建了严格的遥测(telemetry)架构,同时涵盖离散时间和连续时间场景。作者建立了用于审计目的的最小充分统计量(Minimal Sufficient Statistic),为离散权重序列构造了可防篡改的默克尔链(Merkle chain),并借助伊藤公式(Ito formula)推导出适当的连续时间推广形式,最后提出了基于KL散度停时(KL divergence stopping times)的事件驱动日志机制,该机制在计算上可行且对验证有意义。第二部分提出了一个对抗性视角:当模型提供方是敌对的时,部署此类模型的企业有强烈动机隐藏可能触发强制验证审查的学习更新。作者将此形式化为“模型隐藏问题”(Model Hiding Problem),并针对第一部分的架构系统性地归纳了六种不同的攻击策略,覆盖离散和连续时间,且为每种策略都提供了对应的正式防御措施。论文的总体结论是:连续遥测是必要但不充分的,它能缩小定期侵入式审计的范围,但永远无法替代审计本身。该框架与具体模型架构无关,旨在满足传统MRM的三大支柱。

💡 推荐理由: 自适应生成式AI在生产环境中自我更新权重,传统安全验证失效。该论文为监控此类模型提供了形式化遥测架构,并系统分析对抗性隐藏攻击,对蓝队设计AI审计与检测机制具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)