#structural-fidelity

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Ahmed M. Elmisery

本文提出一种基于图的结构化评估方法(GBSE),用于评估大语言模型(LLM)在跨操作系统对手模拟程序翻译中的质量。对手模拟程序描述了多步攻击者流程,通常基于MITRE ATT&CK技术、权限需求和可观测遥测。LLM能够自动将这些程序从源操作系统(如Windows)翻译到目标操作系统(如Linux),但翻译可能仅重命名工具而保留源平台逻辑,导致防御者获得的目标平台覆盖不足。传统二元评分(如工具名称匹配)可能高估保真度,因为它只衡量可计数特征而非结构、可观测性和规则级别的等价性。GBSE将每个程序建模为有向属性图,并在四个层(技术、战术、遥测类和Sigma日志源)上计算归一化图编辑距离(GED)。该方法应用于一个29步骤的ALPHV/BlackCat Windows-to-Linux翻译案例,比较了重建的Windows控制版本与LLM生成的Linux版本。结果表明:技术和战术结构完全保留(GED=0,相似度=1.000);遥测相似度降至0.897(GED=3),因为三个步骤包含未映射或漂移的可观测项;Sigma日志源相似度为1.000。所有状态被分类为中等保真度,最佳综合得分为0.674,未达到0.80的部署阈值,因为技术现实性得分为0.43(需0.990)。框架还包括二分图GED、将自由文本转换为可观测类的遥测意图解析器,以及49个经过验证的Sigma规则(19个Linux,30个Windows),这些规则提供了完整的ATT&CK技术覆盖且验证零发现。额外分析揭示了技术层面的分歧,例如基于RDP的外部访问映射到未加密的外泄,凭证存储访问映射到远程系统发现。研究结果可复现,并已与记录输出验证。本文适合安全评估人员、对手模拟工具开发者及LLM应用安全研究者阅读。

💡 推荐理由: LLM自动翻译对手模拟程序可能引入隐蔽的保真度损失,传统评分无法发现。本文提出的图结构评估方法能更精确地衡量翻译质量,帮助防御者避免依赖虚假的跨平台覆盖。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)