该论文聚焦于大语言模型(LLM)被引入安全运营中心(SOC)后所引入的新型攻击面。作者指出,将 LLM 用于威胁情报的聚合、解读与优先级排序虽然显著提升了分析效率,但同时也打开了间接提示注入(indirect prompt injection)的通道:攻击者可将恶意指令嵌入系统日志、告警字段等本应被视为"数据"的内容中,借助日志投毒(log poisoning)劫持 LLM 的推理逻辑,进而编排多步骤的"promptware"杀伤链,使 AI 分析代理变成攻击者的执行器。 论文将防御困境概括为一种两难:确定性规则/正则类防御计算开销低但"语义盲",无法识别语义层面伪装的注入;纯神经网络(如另一个 LLM 做判别或裁判)的语义评估虽然更聪明,却带来不可接受的延迟以及概率性判定带来的漏报与不稳定。 为此,作者提出一种神经-符号(neurosymbolic)纵深防御架构,目标是保障 AI-SOC 流水线的端到端完整性。整体分为两层加一个闭环反馈机制:第一层是确定性预过滤,利用定制化的 SIEM 解析器(decoders)在数据摄入边缘做结构化清洗与规范化,直接中和体积型填充攻击以及基于特征签名的注入;第二层在告警进入 LLM 之前,使用 NeMo Guardrails 对已结构化的 SIEM 告警实施严格的自检式语义边界校验,从而在保留语义理解能力的同时限制模型输出空间。此外,架构集成了闭环遥测系统,把被拦截攻击的可见性直接呈现在 SOC 控制台中,实现人在环(HITL)监督。 实验部分作者按 MITRE ATLAS 分类法组织评估,针对多种提示注入场景进行测试。结果显示该协同方案能有效拆解 promptware 杀伤链,用可验证的约束约束 LLM 的随机性,并为下一代 AI-SOC 提供具备高可观测性的弹性防御机制。
💡 推荐理由: SOC 正在快速把 LLM 接入告警分诊与威胁情报流程,而日志本身是攻击者可控的输入,日志投毒型间接提示注入因此成为可直接落地的现实威胁。该工作给出了确定性预过滤 + 语义护栏的分层方案,并映射 MITRE ATLAS,为蓝队设计 AI-SOC 防护边界提供了可参考的架构模板。
🎯 建议动作: 研究跟进:评估将确定性预过滤与语义护栏分层架构纳入内部 AI-SOC 试点,并同步按 MITRE ATLAS 梳理自家提示注入检测用例。