本文研究了检索增强式文生音乐(Retrieval-Augmented Text-to-Music, TTM)系统面临的一种新型数据投毒攻击。此类系统在用户提示词不明确时,会从音乐描述数据库中检索相关文字描述(caption)来增强提示,再交由生成模型创作音乐。这种架构引入了对音乐知识数据库的完整性依赖:数据库中的描述信息可能被恶意利用。作者提出一种名为“音乐描述投毒攻击”(caption poisoning attack)的方法,攻击者只需向数据库中注入少量经过精心构造的音乐描述,即可在不修改用户提示词、检索器或生成模型的情况下,使系统检索到恶意描述,从而令提示增强与后续音乐生成结果偏离用户原本意图,转向攻击者预设的目标方向。为实施该攻击,作者设计了一种双层描述投毒策略:第一层保留高层的检索锚点,确保恶意描述在检索阶段有机会被命中;第二层注入低层的声学描述符,用以操控提示增强过程,引导下游音乐生成朝向攻击者选择的意图。实验基于MusicCaps知识数据库、CLAP检索器与MusicGen生成流水线开展,结果表明,投毒后的生成结果在语义和声学特征上显著接近攻击者目标,同时又能与用户原始查询保持相当程度的一致性,说明攻击具备隐蔽性。该成果揭示了检索增强式创意AI系统面临的实际安全与完整性问题,提示此类系统的数据来源可信度至关重要。适合AI安全研究者、音乐生成系统开发者及关注数据供应链安全的下游应用方阅读。演示见项目主页。
💡 推荐理由: 该研究揭示了检索增强生成(RAG)架构在创意AI领域的新攻击面,数据库投毒可能导致用户被静默导向攻击者意图,影响内容生成服务的可信度与用户体验,值得AI平台与安全人员警惕。
🎯 建议动作: 研究跟进:建议相关系统评估数据源完整性保护与异常描述检测机制。