本文针对公共部门中高风险场景下的结构化信息抽取任务,系统评估了开源模型(OCR引擎、大语言模型LLM和视觉语言模型VLM)的端到端性能。研究背景是,虽然专有方案在商业应用中占主导,但开源组件组合成的抽取流水线正成为可行替代,然而在真实多步骤任务上的系统评估仍然缺乏。欧盟《人工智能法案》将公共部门某些文档处理任务归类为高风险,因此负责任地使用这类工具需要基于现实任务的全面评测。作者构建了一个综合基准,使用一个真实世界的高风险文档处理任务——国际学习项目学生申请审核——来评估开源系统的端到端表现。实验覆盖了最先进的OCR引擎、LLM和VLM。核心发现是:VLM通常优于OCR+LLM流水线,但即使最先进的开源模型也难以在零样本设置下可靠处理此类任务;35种配置中只有4种F1分数超过0.5,最好的OCR+LLM流水线与顶级VLM性能相当,但大多数OCR+LLM组合表现明显更差;约75%的配置得分低于0.25。模型规模会影响性能,但关系是非线性的,更大的模型并不保证成比例更好的结果。输入质量,特别是OCR输出的结构保留程度,是独立于下游模型能力的关键因素。该研究为在受监管的高风险公共部门应用中部署开源信息抽取系统提供了实证依据和谨慎乐观的参考。适合关注AI系统负责任部署、开源模型落地评估的从业者阅读。
💡 推荐理由: 为公共部门高风险场景的开源信息抽取系统提供首个真实基准,揭示VLM与OCR+LLM管线的实际性能差距,并指出输入结构保留比模型规模更关键,有助于安全工程师评估此类系统的风险与可靠性。
🎯 建议动作: 研究跟进