#poisoning-defense

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Torsten Krauß, Alexandra Dmitrienko

联邦学习(Federated Learning, FL)通过在不共享原始数据的情况下协作训练模型,能够保护数据隐私、降低通信开销,并利用多样化的数据源提升模型性能。然而,FL 面临多种安全威胁,包括无目标投毒攻击(untargeted poisoning attacks)和具有隐蔽性的目标后门攻击(targeted backdoor attacks)。后门攻击尤其难以防御,因为攻击者可以在训练过程中注入恶意更新,使模型在特定触发条件下产生错误预测,而在正常输入下表现正常。现有的防御方法虽然在特定场景下有效,但往往基于过于简单的威胁模型,忽略了现实世界中攻击者可能具备的自适应能力,同时也未充分考虑不同客户端之间数据分布的非独立同分布(non-IID)特性。为此,本文提出一种名为 MESAS 的防御机制,旨在针对自适应攻击者提供鲁棒的投毒防御。虽然论文摘要未详细展开 MESAS 的具体技术细节,但从标题和摘要推断,该方法可能结合了异常检测、聚合规则改进或鲁棒学习策略,以在存在恶意客户端的情况下仍能保持全局模型的完整性和准确性。该研究的主要贡献在于:1)提出一种能够抵抗自适应攻击者的新型防御框架,填补了现有方法在对抗动态威胁模型方面的空白;2)考虑了非独立同分布数据对防御效果的影响,使方案更贴近实际部署场景;3)通过实验验证了 MESAS 在各类投毒攻击下的有效性,尤其是在传统防御失效的场景中表现出更强的鲁棒性。本文适合联邦学习安全研究者、隐私保护机器学习工程师以及关注分布式学习系统防御策略的安全从业者阅读。由于当前仅有论文摘要,具体实验设置、对比基线和量化结果尚不明确,后续需要阅读全文评估方法的实际效能与适用范围。

💡 推荐理由: 该研究聚焦联邦学习中对自适应攻击者的防御,填补了现有防御方案忽视攻击者动态调整策略的空白。对于依赖联邦学习进行模型训练的企业和机构,MESAS 提供的鲁棒防御思路有助于提升系统在恶意参与者存在时的安全性,尤其是针对隐蔽后门攻击的韧性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Walid Saidi

该论文提出 MutMem,一个用于持久化智能体内存的授权变更协议,并集成在 HOM-AIMOS 持久化内存引擎中。核心问题在于:持久化内存需要根据后续结果调整早期证据,但可变的检索权重会引发“归因问题”——审查者必须区分经授权的自适应变更与数据库篡改。MutMem 通过保留内存内容、记录带签名的正面和负面结果证据(无年龄过期)、并将每个非平凡权重变更作为“管家授权”的转换提交来解决该问题。每个转换绑定一个终端溯源节点、签名者时期、量化后的新旧权重、无分叉前驱,以及两个域分离的 SHA-256 承诺。Ed25519 验证在数据库写入器和便携验证器中均执行。被分类为“疑似中毒”的内容会被保留,并附带可修订的签名标签,召回时作为信任证据。实验方面:HOM-AIMOS 在 LongMemEval 上通过 LLM 评判正确回答 459/500(91.8%);在 LoCoMo 上获得 74.12% 的评判准确率,并在另一个上游兼容协议下获得 58.20 的 token F1。原生测试套件通过所有声明的授权、拓扑、篡改、签名者时期和变更后召回测试;签名转换的中位延迟为 4.865 毫秒。在声明 N=100 的 PoisonedRAG 适应实验中,受攻击的前 5 披露中未出现注入毒样本(0/100;95% Wilson 置信上限 3.70%),而在 98 个干净阴性目标中,诱导目标答案攻击成功率为 1/98(1.02%)。一项预注册的四臂消融实验将检索减少归因于签名存储标签:当绕过认知策略时,检索器为 94/100 个目标选择毒样本;恢复标签后为 0/100。MutMem 提供了完整性、授权、可追溯性和历史连续性的证据,但不建立内容真理性。该研究适合关注 LLM 智能体内存安全、数据完整性和投毒防御的研究人员与安全工程师。

💡 推荐理由: 该研究解决了 LLM 持久化内存中授权变更与篡改难以区分的问题,为智能体内存的完整性审计和投毒防御提供了可验证的密码学协议,是 agent 安全领域的重要进展。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Shixiong Jiang, Taozheng Zhu, Fanxin Kong

离线安全强化学习(Offline Safe RL)能够在没有在线交互的情况下学习策略,因此适用于机器人等安全关键系统。然而,其依赖静态数据集的特点使其容易遭受数据投毒攻击,攻击者注入恶意样本以破坏安全性并导致不安全策略行为。本文提出一种新的学习范式——安全反学习(Safe-RULE),作为防御框架,无需从头重新训练或访问原始训练环境即可消除投毒数据的影响。作者将反学习扩展至离线安全强化学习,在反学习过程中显式考虑任务性能和安全性约束。在多个安全强化学习基准任务上的实验表明,该方法能有效增强对数据投毒攻击的安全性能。核心贡献包括:定义了离线安全强化学习中的投毒防御问题;提出结合安全约束的反学习机制;实验验证了防御效果。适合关注AI安全、强化学习安全尤其是防御技术的研究人员阅读。

💡 推荐理由: 首次将反学习范式引入离线安全强化学习投毒防御,无需重新训练即可消除恶意数据影响,对提升机器人等安全关键系统的鲁棒性具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)