本文提出了一种名为 Alchemy 的无数据对抗训练框架,旨在解决实际场景中模型鲁棒性提升面临的训练数据不可得问题。传统对抗训练方法通常依赖原始训练数据来生成对抗样本并增强模型鲁棒性,但随着开源模型平台和商业模型的普及,用户往往只能获得模型权重,而原始数据集因商业利益或隐私原因并未公开。在此背景下,现有对抗训练方法无法直接应用。Alchemy 是首个无数据对抗训练框架,它不需要原始训练数据,而是通过重构具有鲁棒特征的高质量训练数据,同时提升模型对不可访问原始数据集的对抗鲁棒性,兼顾准确率保持与鲁棒性提升。作者针对两个核心挑战展开:一是如何在无数据条件下生成能够反映原始数据分布的训练样本,二是如何利用这些合成样本有效提高模型在未知攻击下的鲁棒性。实验覆盖四个数据集,并与五种基线方法对比,结果表明 Alchemy 在多数攻击场景下能够显著提升平均鲁棒性,且性能优于现有方法。此外,作者还评估了框架在不同设置下的稳定性,并讨论了未来研究方向。该工作为模型发布者和使用者提供了一种无需数据即可增强模型安全性的新思路,特别适用于模型迁移、安全微调等场景。
💡 推荐理由: 实际中用户常只能拿到模型权重而无法获得原始训练数据,Alchemy 首次实现无数据对抗训练,为模型鲁棒性增强提供了可行方案,对蓝队防御对抗攻击具有重要参考价值。
🎯 建议动作: 研究跟进