本文针对检索增强生成(RAG)系统在大型语言模型(LLM)应用中面临的知识污染攻击问题,提出了一种名为 SecureCollaRAG 的拜占庭容错协作式 RAG 框架。研究背景是:虽然 RAG 能够缓解 LLM 的幻觉问题,但攻击者可通过投毒外部文档来操纵 LLM 输出,形成新的安全漏洞。为应对这一威胁,作者引入多源知识验证机制(Multi-source Knowledge Validation Mechanism),使智能体系统能够通过基于动态图神经网络(GNN)的可信度评分来安全地验证文档来源,从而有效防御隐蔽的知识污染攻击,同时保留关键领域知识的完整性。论文通过大量实验和形式化分析证明,SecureCollaRAG 在非独立同分布(non-IID)数据分布下仍能保持对攻击者的鲁棒性。核心贡献包括:提出针对 RAG 知识污染威胁的拜占庭容错协作框架、设计动态 GNN 驱动的文档可信度评估方法、以及提供形式化安全性分析。适合关注 LLM 安全、智能体安全、RAG 系统防御的研究人员和安全工程师阅读。
💡 推荐理由: RAG 已被广泛用于 LLM 应用,但知识投毒攻击可悄无声息地操纵模型输出。SecureCollaRAG 提出一种基于多源验证和 GNN 可信度评分的防御思路,为构建健壮的智能体知识管道提供了新方向。
🎯 建议动作: 研究跟进