#GEO

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Bing Zheng, Zongyao Zhao, Wenming Yang

生成式引擎优化(GEO)是一种通过操纵网页内容来提升其在生成式搜索引擎中可见度的技术,类似针对传统搜索引擎的SEO。然而,该技术可被攻击者滥用:他们制作看似普通但经过特殊优化的文档,当受攻击的大语言模型(LLM)在检索增强生成过程中获取并综合这些文档时,会输出被信息扭曲的答案,从而传播定向虚假信息。目前,在受控条件下系统评估这类威胁防御手段的基准仍然缺失。为此,本文提出了Counter-GEO-Bench防御基准。作者构建了247个人工验证、质量把关的查询,每个查询均包含两种GEO改写版本:一种保留信息,另一种扭曲信息,以模拟正常与攻击场景。基准在三个受害LLM上,以攻击成功率(ASR)、误报率和答案质量为核心指标,评估不同防御策略。实验结果显示:现成防御——Granite Guardian、Llama Guard 3和NeMo Self-Check Fact-Checking——均未能有效抵御攻击,相对ASR下降最多仅5.7%,其中Granite Guardian的降幅不具备统计显著性。作者分析,这些基于安全分类的护栏旨在识别违反策略的恶意内容,但GEO扭曲后的信息以自然流畅的形式出现,能轻松绕过监测。为证明威胁可被处理,作者提出轻量级防御基线C-GEO Guard。该基线将ASR相对降低47.6%,且几乎不损失回答质量,表明针对信息扭曲型GEO的防御是实际可行的。Counter-GEO-Bench为后续研究提供了一个标准化的评估平台,有助于开发更健壮的生成式AI内容安全保障。

💡 推荐理由: 生成式AI检索应用日益普及,GEO攻击可能导致LLM输出看似可信的虚假答案,而现有安全护栏难以拦截此类内容。Counter-GEO-Bench为首个系统化评估数据与防御方案,为保护RAG类系统提供重要参考。

🎯 建议动作: 研究并评估将C-GEO Guard应用于自身RAG系统的可能性,关注基准及后续开源进展。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)