#inductive-logic-programming

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Pingchuan Ma, Zhaoyu Wang, Zimo Ji, Yuguang Zhou, Zhantong Xue, Zongjie Li, Shuai Wang, Xiaoqin Zhang

本文提出 AutoSpec 框架,针对大语言模型(LLM)智能体在自动化复杂任务时面临的安全规则设计困境:手工规则过于保守(高误报)或过于宽松(漏报),而神经分类器缺乏可解释性。AutoSpec 基于归纳逻辑编程(ILP)的计数器示例引导归纳综合(CEGIS),从专家初始规则和用户标注的安全/不安全轨迹出发,自动迭代演化规则。首先评估当前规则,挖掘假正例和假负例,利用 ILP 高效识别在假负例中出现频繁而在假正例中罕见的谓词,从而显著剪枝规则编辑的指数级搜索空间,生成候选规则修改,并通过验证选择最优修订版本。迭代直至收敛,最终产生在精确率和召回率之间取得平衡的可解释规则。在涵盖代码执行和具身智能体的 291 条执行轨迹上评估,规则 F1 得分分别达到 0.98 和 0.93,误报率降低高达 94% 同时保持高召回率,收敛仅需 4-5 轮迭代。与启发式 CEGIS 相比,ILP 引导的方法 F1 最高提升 4.8 倍。学习到的规则易于人类阅读、审计,并能泛化到未见场景。

💡 推荐理由: LLM 智能体的安全风险日益严峻,现有规则方法难以兼顾鲁棒性与可解释性;AutoSpec 提供一种自动演化、可审计的规则优化方案,填补了该领域空白。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)