#web-poisoning

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Zhongan Bi, Qiwen Wang, Jianrong Jiang, Jigang Ding, Wenwen Xiong, Changhua Meng, Xuanang Gao, Kepeng Lin, Changjiang Jiang, Yiang Chen, Huan Yao, Wei Wang, Zhenyu Ma, Wenhui Dong

随着搜索增强型大语言模型(LLM)智能体被广泛用于消费者决策场景,其面临的生成引擎优化(GEO)投毒攻击风险日益突出。现有安全评测基准大多只关注被操纵的内容是否被检索或认可,并未跟踪智能体是否验证可疑证据、是否修正已采纳的错误观点、以及在生成最终推荐前能否自我恢复。为此,本文提出 HAE-GEO 基准,系统性追踪智能体在渐进增强的网页投毒攻击下从暴露到恢复的完整轨迹。基准采用多轮“搜索-抓取”交互界面,设置了三个越来越具有说服力的攻击层级:L1 为直接断言,L2 为上下文伪装,L3 为表面佐证(即多个看似独立的来源相互印证)。受控语料库包含 72,039 个干净页面,每个攻击层级各附带 770 个投毒页面,覆盖 8 个产品类别和 154 个品牌。评估方法结合了确定性行为度量与六维语义评分标准。对 10 个不同智能体的评估揭示了三个反复出现的模式:其一,在“佐证陷阱”下,智能体的证据识别能力明显下降;其二,智能体式搜索虽然能提升最终输出的抵抗性,但并未改善证据识别或实用性;其三,防御性提示虽能增加验证行为,但很少能够将验证转化为最终的恢复与纠错。该研究为构建更具鲁棒性的搜索增强智能体提供了新的评测视角和数据集,适合关注大模型安全、对抗鲁棒性及信息检索可信度的研究人员阅读。

💡 推荐理由: 该研究首次从证据验证与恢复全流程评估大模型搜索智能体对网页投毒的抵抗力,揭示当前模型“表面抵抗但实际易误导”的漏洞,为蓝队设计防御提示和检测逻辑提供参考。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)