#pppo

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Uday Vallabhaneni, Cassie L. Cagwin, David J. Wild

该论文提出 SENTINEL-RL,一种用于安全运营中心(SOC)的智能体架构,旨在克服大型语言模型(LLM)智能体在自主威胁分析中的两个核心局限:有限上下文窗口难以承载大规模认证图,以及自由文本生成无法保证推荐动作与网络拓扑的一致性。SENTINEL-RL 将拓扑推理与语义推理解耦:通过异构图表征编码器将实时认证子图压缩为固定维状态,使用近端策略优化(PPO)策略将状态映射为受限的调查动作集合,LLM 主体仅被限制为消费策略的推荐并生成分析师可读的叙述,且由评论员模型把关。作者在 LANL 综合多源网络安全事件数据集和印第安纳大学 Quartz HPC 集群上进行了实验,报告了四个主要结果:(i) 两阶段 CREATE 摄取模式可在单台 32 核节点上于 14.2 分钟加载包含 2400 万条边的认证子图,比经典 MERGE 管线快约 24 倍;(ii) 滑动窗口告警引擎在 50 次试验中可靠地在不超过 2.5 秒内触发 25 事件/10 秒阈值;(iii) PPO 经过 200 次迭代收敛,平均回合回报 8.74±0.31,在标记红队事件上的保持精度为 0.91,召回率为 0.87;(iv) 完整检测-调查-推荐-人工审批循环的中位数耗时为 6.3 秒。论文还贡献了可复用的工程模式(如热节点死锁规避)、可移植的 HPC 部署模式(锚点节点共置),并提供了涵盖误报经济学、可逆性保证、审计合规性和人工审批边界的企业就绪性分析。适合关注 LLM 智能体在安全自动化中的应用、图神经网络与强化学习结合的防御性安全研究者和 SOC 架构师阅读。

💡 推荐理由: 该架构解决了 LLM 智能体在真实企业规模 SOC 中因上下文有限和生成不一致而难以落地的问题,通过图编码与强化学习约束决策,为安全自动化提供了更可靠、可审计的范式,值得安全团队关注。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)