YARA规则易于分发,但用于验证正匹配的恶意软件样本却难以共享,给存储、持续集成、灾难恢复演练和可复现的扫描器验证带来麻烦。构造替代固定件(fixture)并不仅仅是嵌入字面量:YARA条件可能组合多种结构,如备选分支、计数、偏移、整数读取以及可执行容器约束,同时生成的文件不应再现恶意行为。正向验证是存在性的:只需要一个属于规则匹配集的文件,而非重建原始样本。为此,论文提出Aray,一个确定性优先的YARA解释器与正固定件合成器。其核心思想是:模型(可能为大语言模型)仅允许提出建设性的规范化或类型化提取回退,绝不接触后端代码或二进制结构;常规代码负责验证规范化后的规则、推导字符串和整数见证、执行提取、路由、碰撞检查的布局,并进行ELF、PE或通用序列化。仅残余的规范化语义到达一个有界的模型评判器。作者在416条公共规则条目上评估Aray:无模型辅助时规范化接受182条,经模型规范化后接受234条;可构造性预检接纳406条,所有被接纳的固定件均匹配其上游原始规则。总体成功率为406/416(97.6%),而在可构造规则中为406/406,存在十个预期的预检处置,没有扫描器不匹配或构建失败。一个不可达端点证实实现过程中模型调用次数为零。原始规则预言机依据源规则验证生成的固定件;对所有可能文件证明蕴含关系是一个更独立的强目标。两次锚定正则表达式的失败在最终运行前已被修复,因此这些是修复后系统的结果,而非预留样本的估计。该工作为YARA规则验证提供了自动化、可扩展的良性样本生成路径。
💡 推荐理由: 该研究解决了YARA规则验证中缺乏良性正样本的痛点。Aray能自动生成既匹配规则又不含恶意行为的文件,可集成到CI/CD和扫描器回归测试中,提升规则质量与可信度,减少对真实恶意样本的依赖。
🎯 建议动作: 研究跟进