该论文介绍了一个名为 PolyDoc 的工具,用于对从 PolySwarm 众包威胁情报网络获取的 PDF 文件进行格式感知的追踪和分析。PDF 格式因其复杂性和对互操作性与一致呈现的严格要求,成为攻击者编码漏洞和攻击的常见载体。研究旨在探究 PDF 文件的结构畸形与其恶意性之间是否存在关联。PolyDoc 以实时狩猎模式运行,收集提交给 PolySwarm 的 PDF 文件,并使用 Mutool、Poppler 和 Caradoc 等主流 PDF 工具执行这些文件,以追踪其执行过程和产生的错误。研究人员共收集并分析了 58,906 个文件,利用 PDF 错误本体论(PDF Error Ontology)根据追踪输出对错误进行分类,并将分类结果与 PolyScore(PolySwarm 提供的恶意性评分)进行比较。研究得出三个核心发现:第一,被归类为恶意的 PDF 文件确实包含语法畸形;第二,未分类的错误本体论类别在不同 PDF 工具中都很常见,表明现有的 PDF 错误本体论可能无法充分覆盖真实世界威胁引擎收到的文件类型;第三,攻击者确实利用特定的语法畸形进行攻击,而这些畸形是当前 PDF 工具能够检测到的。该工作为理解 PDF 恶意文件的特征提供了数据驱动的方法,并指出了改进 PDF 错误分类和检测工具的潜力。
💡 推荐理由: 该研究为蓝队提供了基于真实世界数据(PolySwarm 众包)的 PDF 恶意文件结构特征实证,有助于理解攻击者利用的语法畸形模式,并改进 PDF 解析器的错误检测和防御策略。
🎯 建议动作: 研究跟进