本文提出一种针对机器学习模型审计的防操纵协议,旨在解决模型提供方在审计过程中可能故意或无意地操纵评估结果的问题。在监管审计等场景中,审计行为通常会被声明或容易暴露,模型提供方可能借此推断审计所关注的敏感属性,并策略性地调整不同组别之间的资源分配率以满足公平性指标,从而规避真正的公平性审查。为此,作者利用私有信息检索(Private Information Retrieval)机制设计了一种新的审计流程:审计方可以以“ oblivious”方式查询模型,要求提供方对大量实例进行标注,但提供方无法得知其中哪些子集最终会被用于审计。该协议不要求修改被审计模型本身、其训练流程或推理管线,只对审计方增加极小的额外开销。作者提供了理论保证,证明在该协议下,若提供方试图隐藏不公平性,就必须伪造数量明显更多的响应,从而同时增加了操纵的难度与被发现的概率。实验在多种代表性审计场景中验证了该方法的有效性和实用性。对于关注算法治理、模型公平性验证以及对抗性审计的从业者而言,本文提供了一种可落地的审计增强方案,无需改动现有模型即可显著提高审计结果的可靠性。
💡 推荐理由: 为蓝队和合规审计提供了一种无需修改模型即可增强审计抗操纵性的方法,尤其适用于公平性评估场景,能提升第三方审计的可信度。
🎯 建议动作: 研究跟进