推荐 5.5
Conf: 50%
该论文聚焦于代码语言模型(CLM)在代码检索任务中的脆弱性,首次提出了一种编程语言无关、可迁移的对抗性攻击方法。研究背景在于,当前基于神经代码语言模型的检索工具虽然能提升开发者查找代码的效率,但其对非功能性的文本元素(如标识符命名)高度敏感,容易被恶意操纵。核心问题是如何在不改变代码语义的前提下,通过扰动代码片段中的标识符,使该代码片段与任意目标查询在嵌入空间中显著接近,从而破坏检索结果的排序。作者提出的方法完全不需要修改代码的执行逻辑,仅对标识符进行替换或变形,就能使无关代码与查询产生虚假的高相似度。实验部分,作者使用小型代码嵌入模型(如CodeT5+)生成对抗样本,并验证其可迁移性到大型闭源嵌入模型(如Voyage-code-3)以及LLM(如Gemini-3.1-Pro)。结果表明,该方法能使最先进检索模型的平均倒数排名(MRR)下降高达77%,显著降低了检索质量。该研究的贡献在于揭示了当前代码搜索方法普遍存在的语义理解盲区,并证明了基于标识符的扰动具有极强的攻击效果和跨模型迁移能力,为后续设计语义感知、鲁棒的检索模型提供了反面教材。适合软件工程、代码智能和安全领域的研究者阅读,以理解代码检索系统的潜在风险。
💡 推荐理由: 代码检索是开发者的高频操作,该研究揭示CLM存在可被利用的脆弱性,攻击者可操纵检索结果诱导开发者使用不相关或有风险的代码,影响供应链安全。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)