#pdf extraction

共收录 1 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Side Liu, Jiang Ming

本文研究了文档到LLM应用(例如用户上传PDF供LLM分析)中的语义完整性威胁。作者指出,这类应用通常通过一个用户无法观察或审计的隐藏提取层将PDF转换为文本。他们发现该层使得“分裂视图PDF”成为可能:同一个PDF在渲染视图(用户看到的内容)和提取视图(LLM接收的文本)之间可以存在语义差异。通过挖掘PDF规范允许或实现容忍的渲染/提取边界表示差异,作者实例化了25种提取间隙(EG),在这些间隙中,提取器返回攻击者控制或提取器依赖的文本,而渲染页面显示的是良性或不同的内容。这些间隙分为四类:语义覆盖(semantic overrides)、隐藏语义注入(hidden semantic injection)、阅读顺序分裂(reading-order splits)和字体解码分裂(font-decoding splits)。其中14种间隙在先前针对PDF到LLM的攻击中没有精确的路径/机制级别匹配。作者在16个PDF处理栈和7个商业LLM服务上评估了这些间隙,发现每个间隙至少在一种栈上导致渲染-提取不一致。在间隙级暴露标准下,每个被评估的服务至少暴露一种间隙,暴露数在12/25到21/25之间。暴露主要由摄入栈驱动,而非仅模型身份。进一步测试显示,当前的安全过滤器仅覆盖了部分隐藏文本构造。为支持分类,作者开发了一个静态筛选扫描器,其规则可触发所有25个基准间隙,并讨论了双视图一致性作为长期防御方向。

💡 推荐理由: 该研究揭示了文档到LLM供应链中一个被忽视的语义攻击面,攻击者可能通过构造分裂视图PDF绕过安全过滤、注入恶意指令,影响LLM输出的可靠性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)