本文报告了一个名为“文件观测站”(File Observatory)的研究项目,旨在收集和分析大规模多样化的文件集合,以支持安全解析器的开发。项目背景是解析不可信数据极其困难,错误处理恶意构造的数据会导致广泛漏洞。语言理论安全(LangSec)哲学提倡在软件开发生命周期中使用形式化正确且可验证的输入处理,而构建广泛的文件语料库是开发安全解析器的关键组成部分,可帮助开发者理解特定格式的问题空间,并作为模糊测试及其他自动化测试的种子。本文继承了2020年LangSec会议的早期工作,最初重点是可移植文档格式(PDF)及通常嵌入PDF的文件格式。本次论文报告了新增的缺陷跟踪器语料库(bug tracker corpus)和新的分析方法。该观测站将支持开发者分析文件格式的多样性、识别常见缺陷模式,并促进基于LangSec的解析器开发。实验部分(未在摘要中详述)应展示了语料库的规模、覆盖范围以及新方法在发现潜在问题上的有效性。对于安全工程师,该工具可帮助理解实际文件格式中的异常和攻击面,从而设计更健壮的解析器。
💡 推荐理由: 文件解析漏洞是常见攻击面,该观测站提供大规模真实世界文件语料库,助力开发者系统性地发现和预防解析缺陷,提升软件安全性。
🎯 建议动作: 研究跟进