本文提出了一种将生产环境安全信息与事件管理(SIEM)数据转化为可复用网络安全工件的方法论。研究背景是:安全运营中心(SOC)的生产遥测数据是最真实的,但由于隐私和机密性限制,原始日志无法公开,导致安全研究长期依赖合成数据集或过时数据,缺乏现实性。作者来自金融行业SOC和学术机构,他们设计了一个流程:从生产金融SOC中提取SIEM数据,通过匿名化、结构化处理,并严格验证,在声明隐私边界的前提下保留任务相关的调查结构。核心方法包括保持时间顺序和实体一致性,以支持MITRE ATT&CK映射的挑战(HIKARI数据集中的37个挑战)。作者通过两个消费场景评估工件:作为训练材料时,匿名化必须精确保留时间顺序和实体一致性,否则训练效果显著下降;作为测量基座时,在200个SOCpilot事件中,确定性验证器检测到大型语言模型(LLM)的合规动作,而这些动作在人类基线中不存在,揭示了隐私-效用权衡。论文的主要贡献是给出了一个可度量的隐私-效用边界,而非形式化的匿名性声明。本文适合安全研究人员、SOC运营者以及数据隐私工程师阅读,提供了一个从原始生产数据到共享研究数据的可行转换范例。
💡 推荐理由: 本文首次系统性地解决了生产SIEM数据无法开放给研究界的核心矛盾,提出的方法论可在保护隐私的同时保持数据效用,为真实环境安全研究提供了可行路径。
🎯 建议动作: 研究跟进