原则性监管(如“公平、清晰、不误导”或“提供良好结果”)属于评判性标准,无法简化为二元谓词。随着大型语言模型(LLM)被越来越多地用作裁判,其实际评估质量变得至关重要。本文提出,任何此类裁判都必须从四个维度进行评测:准确性(accuracy)、释义鲁棒性(paraphrase robustness)、对抗鲁棒性(adversarial robustness)和校准性(calibration)。作者发布了 Principle-Bench,一个包含 168 个加密资产金融推广场景的数据集,这些场景映射到英国金融行为监管局(FCA)的两条原则,并预注册了释义改写、关键词填充和边界扰动等攻击样本。这是首个覆盖原则性监管全部四个评估轴的数据集。同时提出 Ceca(Calibrated Exemplar-Cluster Assessment),一个校准且可审计的评估器,可输出每个示例的反事实归因。实验比较了关键词计数、三种句子转换器嵌入、一个开放式权重 LLM 裁判和一个校准级联,结果显示没有任何方法在所有四个轴上占优。最强的 120B LLM 裁判在良性输入上表现最好,但在面对关键词填充的 Consumer Duty 输入时,准确率从 0.74 骤降至 0.27,被作者称为“合规剧场”。另一个模型家族的裁判在相同分割上 Cohen's kappa 仅为 0.16,说明失败源于模型而非语料库。最终结论是:任何部署级用于原则性监管的 LLM 裁判,除了总体准确率外,还必须报告每个原则的对抗欺骗性和事后校准指标。
💡 推荐理由: LLM 在金融监管等高风险领域被用作自动裁判,其对抗鲁棒性和校准不足可能导致合规误判。本文提供了可复现的评测基准,帮助安全团队评估这类系统的可靠性,避免“合规剧场”式的虚假安全。
🎯 建议动作: 研究跟进