推荐 5.5
Conf: 50%
本文系统性地调查了大型语言模型(LLM)在欺诈检测、诈骗调查、内容审核及其他信任与安全(Trust-and-Safety)工作流中的部署证据现状。作者指出,现有公开文献大多将LLM作为独立模型进行评估,而较少关注其在运营流水线中作为组件的实际表现,这导致了决策证据上的关键缺口。为此,论文采用欺诈优先的视角,对49份操作相关的来源进行编码分析,涵盖欺诈检测(18份)、内容审核(14份)和跨领域鲁棒性(17份),并辅以15份上下文参考以确立调查边界。这些来源包括系统、基准、框架和部署相关调查,而非49个实际生产部署。主要发现是证据不平衡:欺诈类文献提供了最多的任务特定证据,但审核类论文更明确地报告了延迟、成本、治理和公平性方面的公开证据。在18份欺诈和调查来源中,没有一份报告了干净的每次决策延迟、每次决策美元成本或校准证据;多数仅报告了离线任务性能、检索增益或案例研究准确率。本文贡献了一个角色与证据组织框架FORTE,用于将LLM定位为分类器、检索接口、解释生成器、审核助手、智能体、特征提取器或升级组件。此外,还提出了一个最小部署证据检查清单,涵盖延迟预算、单次决策成本、决策阈值、解释完整性和对抗压力。最终得出的研究议程指出了支持LLM在欺诈和信任安全工作中部署声明所需的研究。
💡 推荐理由: 该研究揭示了当前LLM在敏感安全场景部署时缺乏关键操作证据(延迟、成本、校准、对抗鲁棒性)的现状,为安全团队评估LLM实际可行性提供了系统性框架。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)