#ocr

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Elias Schubert, Felix Bießmann

本文研究开放权重模型在公共部门高风险场景下进行结构化信息抽取(Structured Information Extraction)的端到端性能。作者指出,结构化信息抽取是各行业数字化转型的关键环节,虽然商业专有方案占据主导,但快速发展的开源OCR引擎、大语言模型(LLM)和视觉-语言模型(VLM)生态提供了可获取的替代方案。然而,针对现实多步骤抽取流程的系统性评估仍然稀缺。鉴于欧盟《人工智能法案》将公共部门某些应用归类为高风险,负责任地使用这些抽取工具必须基于真实任务的综合评估。为此,作者构建了一个基准测试,针对一项高风险真实文档处理任务——国际学习项目学生申请处理——评估开源系统的端到端性能。他们采用最先进的OCR引擎、LLM和VLM进行了全面的实证评估。结果显示:虽然VLM普遍优于OCR+LLM流水线,但即使最先进的开源模型在零样本设置下也难以可靠地处理此类任务;35个配置中只有4个F1分数超过0.5,最佳OCR+LLM流水线与顶级VLM性能相当,但大多数OCR+LLM组合表现明显更差;约75%的配置得分低于0.25。模型规模影响性能,但关系是非线性的:显著更大的模型并不能保证成比例更好的结果。输入质量(尤其是OCR输出的结构保留程度)是独立于下游模型能力的关键因素。该研究为评估开源信息抽取系统在高风险公共部门场景中的适用性提供了重要基准和洞见。

💡 推荐理由: 该研究为公共部门高风险场景(如学生申请处理)使用开源模型提供了首个端到端基准,揭示当前开源模型在零样本抽取任务中的不可靠性,对欧盟AI法案合规与模型选型有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 8.5
Conf: 50%
👥 作者: Wenbo Sun, Hongzong LI, Yanyun Wang, Jiahao MA, Shuxin Zhuang, Rong Feng, Shiqin Tang, Zi Liang

本文针对深度OCR系统(具体为DeepSeek-OCR)提出了首个纯黑盒对抗攻击方法。Deep-OCR将视觉模态视为光学压缩介质,以低token成本实现长上下文OCR,但其复杂性也引入了新的安全风险。作者将攻击问题重构为一个零阶优化问题:仅能查询解码后的字符串输出,无法获取梯度、logits或模型内部信息。他们直接在字符串输出上定义了基于序列相似性的有界标量损失函数,并采用随机方向有限差分方案估计梯度,该方案的查询成本与图像维度无关。通过带ell_infinity投影的Adam更新,实现对无目标和有目标对抗扰动的生成,且扰动具有不可感知性。初步实验在Deep-OCR上验证了仅字符串攻击和评估流程的有效性,同时暴露了严重的解码器故障,包括重复、截断和提示泄露。实验还表明,受控的目标重写比无目标退化困难得多;在预注册评估完成前,作者未声称目标攻击成功。

💡 推荐理由: 首次对生成式OCR视觉语言模型进行纯黑盒对抗攻击,揭示了文档识别系统在仅有字符串输出时仍可被攻击,对依赖OCR的自动化流程构成威胁。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)