本文提出 TwinGridShield,一个面向 LLM 辅助能源管理工具的、与模型无关的运行时授权层。研究背景是:大语言模型可将自然语言上下文转换为结构化电网命令,但语法合法并不代表物理上可执行。TwinGridShield 在每条动作被释放到真实系统之前,先在确定性网络孪生环境中评估其后果,检查连通性、支路潮流、发电机和减载不变量,并将每个决策记录在哈希链日志中。作者在 IEEE 14 节点标准算例上进行了受控实验,基于直流潮流和实验设定的支路额定值,评估单步开关操作、再调度和减载动作。在匹配模型实验中,一个随机提案源(配置为以 p=0.84 的概率选择不安全动作)在 500 次受攻击条件下产生了 421 个不安全提案,实际比例为 84.2%;该值仅用于刻画所配置的替代代理,并非对 LLM 提示注入敏感性的经验测量。TwinGridShield 在这 500 次试验中实现了 0 次不安全释放。由于动作标记和授权使用相同的直流模型、系统状态、支路额定值和编码约束,这一结果验证的是实现与编码授权谓词的一致性,而非模型错误下的安全性。因此,主要的鲁棒性评估引入了模型失配:在每节点负载测量误差为 +20% 和 -20% 的范围内,不安全接受率达到 5.63%;当实际支路额定值比建模值低 20% 时,不安全接受率达到 30.09%。本文核心贡献是提出一种“后果感知”的运行时授权机制,将物理约束检查从 LLM 推理中解耦,为 AI 代理在关键基础设施中的安全部署提供了一种可审计、可验证的防护层。适合关注 LLM 代理安全、电网自动化、安全运行时监控的研究人员和蓝队工程师阅读。
💡 推荐理由: 针对 LLM 代理在关键基础设施中的物理安全风险,提出可审计的运行时授权层,为电网等工控场景的 AI 落地提供安全范式。
🎯 建议动作: 研究跟进