该论文对神经符号AI(NeSy)的安全、安保与认知风险进行了系统性研究。神经符号AI融合了神经感知与符号推理,适用于需要可解释性和结构化推理的高风险领域(如医疗诊断、自动驾驶)。然而,这种混合架构引入了扩大的攻击面,涵盖五个层次:神经感知层、符号知识库层、推理引擎层、智能体编排层和数据存储层,每个层次都存在纯神经系统中不存在的可利用漏洞。论文做出了六项贡献:(1) 形式化定义了NeSy攻击面、符号完整性违背(SIV)和跨层放大比X,并将其分解为神经引起的和自主符号敏感性两部分;(2) 提出了统一威胁模型,扩展了MITRE ATLAS,增加了11个NeSy特有的策略扩展和五类攻击者画像;(3) 构建了符号层威胁目录,涵盖知识图谱投毒、本体合并攻击和推理引擎颠覆;(4) 分析了认知风险——自动化偏差、权威偏差和谄媚强化——这些风险因NeSy的显式逻辑解释相对于黑箱神经输出而被结构性放大;(5) 提出了跨学科缓解措施,并给出了与NIST AI 600-1和欧盟AI法案一致的可衡量验收标准;(6) 进行了三项实证基准测试:(E1) 在包含205个实体的医学知识图谱上,针对性知识图谱投毒在注入预算B=5时达到SIV盈亏平衡点,存在隐蔽性与SIV之间的权衡;(E2) 在DistilBERT+ProbLog流水线上,PGD-10在ε=0.01时产生X=5.884(95%置信区间[4.64, 8.00], p<0.0001),并通过匹配随机基线(E^R_rand=0)确认为对抗性特定;(E3) 单公理OWL编辑实现93.3%的SIV成功率,且100%保持Pellet一致性隐蔽,但基于STIX的检测在50%水平(随机猜测)失败,这是一个开放问题。该研究为NeSy系统的安全分析提供了理论基础和实验基准,适合AI安全研究员、系统设计者和监管机构阅读。
💡 推荐理由: 神经符号AI在医疗、自动驾驶等高风险场景应用日益增多,但此前缺乏对其独特攻击面和认知风险的系统化研究。本文首次量化了跨层放大效应并提出了统一威胁模型,对防御者识别和缓解NeSy系统的安全漏洞具有重要指导意义。
🎯 建议动作: 研究跟进