#adversarial

共收录 14 条相关安全情报。

← 返回所有主题
👥 作者: Rui Yang, Shuang Huang, Junhua Liu, Ziqi Zhao, Qingzhong Yan, Yuhang Sun, Cong Liu, Guoping Hu, Rui Mei, Jing Shao

本文提出了 C-SafeQA,一个面向中文场景、以策略为锚定的响应级安全评估基准。现有 LLM 安全基准大多只评估用户查询本身的风险,但实际问答结果是否违规取决于模型响应是否违反安全策略。作者认为在中文有害内容评估中,语言多样性和对抗性改写可能掩盖风险意图,因此需要直接对响应进行安全标注。该基准包含 538 条基础查询和 8,877 条对抗性查询,由四个完整 LLM 部署进行回答,最终形成 37,660 条查询-响应记录,并人工标注为安全、不安全或争议三类。参考标签通过多模型一致性裁决和三位安全专家对分层子集的盲审生成。C-SafeQA 既可评估目标模型自身安全性,也可在统一参考标签下审计七个自动化安全评判器。实验表明,在基础查询上不安全响应率为 0.93% 至 3.35%,而在对抗性查询上则上升到 11.68% 至 30.05%。在对抗子集上,各评判器在不安全响应召回率与风险查询条件下的安全响应误报率之间存在明显权衡,没有任何评判器在所有指标上占优。藏头诗等变换会显著降低七个评判器的不安全响应召回率,暴露出机制相关的评估弱点。数据集、元数据、验证代码和评判脚本公开提供以支持重算,但基准构建、目标响应生成和私有裁决不在发布范围内。

💡 推荐理由: 该基准填补了中文 LLM 响应级安全评估的空白,帮助蓝队和安全研究人员衡量模型及自动化评判器的真实安全水平,尤其是对抗性变换下的弱点。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shir Bernstein, David Beste, Daniel Ayzenshteyn, Lea Schönherr, Yisroel Mirsky

该论文题目为《Trust Me, I Know This Function: Hijacking LLM Static Analysis using Bias》,作者包括 Shir Bernstein、David Beste、Daniel Ayzenshteyn、Lea Schönherr 和 Yisroel Mirsky。根据标题,本文主要研究如何利用人工智能模型中的偏见(bias)劫持基于大语言模型(LLM)的静态分析工具。研究背景是,现代软件安全分析越来越多地引入 LLM 辅助代码审查与漏洞检测,但这类模型可能受到训练数据分布、提示注入或逻辑偏差的影响,导致分析结果被误导。论文的核心问题可能是:攻击者能否通过精心构造的函数名、注释或代码模式,使 LLM 静态分析器产生误判,从而让恶意代码绕过检测?提出的方法可能涉及识别并利用模型在特定类型函数名或代码语义上的先验偏好,实现对分析流程的隐式控制。主要贡献可能包括揭示这种攻击面,提出对抗样本生成策略,并给出缓解建议。不过,由于本条目仅提供标题,没有完整的摘要内容,无法确认具体技术方案和实验细节,也不确定是否提供真实案例。该研究适合 LLM 安全、软件供应链安全以及静态分析工具开发人员阅读,用于理解 AI 辅助安全分析潜在的新型攻击路径。需要注意的是,题目中强调了“Trust Me, I Know This Function”,暗示对模型‘信任’某个函数判断的操纵,这可能是通过改变函数名或上下文让模型产生错误关联。但以上分析基于标题推断,实际内容可能有所不同。

💡 推荐理由: LLM 正被集成进安全分析链,若其决策可被微小输入偏见操纵,将导致漏洞漏报或误报,影响软件安全审查体系的可信度。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Xi Nie, Hongwei Li, Shenghao Wu, Wenshu Fan, Qiyang Song, Wenbo Jiang

本文针对检索增强生成(RAG)系统中证据冲突这一根本性挑战,提出了一种新的研究问题——冲突来源归因(conflict origin attribution),并设计了无训练框架 EvoTrustRAG。在动态和对抗性环境中,同一冲突可能源自合法的知识演化、恶意操纵或尚未解决的不确定性,而现有方法通常将冲突视为静态不一致,仅选择更可靠的知识,忽略了冲突的演化属性。EvoTrustRAG 在答案生成之前,将基于跨度(span)的检索事实建模为冲突证据图,利用时间关系、支持结构和辅助一致性评估 grounded evolution(基于证据的演化)与方向性干预假设,并将局部决策投影为全局一致的冲突组解释。该归因过程决定早期与后期状态是保留为时间知识、将干预候选与主要上下文分离,还是作为未解决冲突保持可见供生成器参考。与基于溯源(provenance)的事后分析方法不同,EvoTrustRAG 在推理阶段即可判断冲突证据是否遵循合理的知识演化、是否呈现类似干预的支持结构,或无法可靠归因。实验表明,EvoTrustRAG 在基准原生冲突设置上平均准确率达 81.4%,将归因宏 F1 比最强基线提升 7 个百分点(72.2% → 79.1%),并在最强协同攻击下将错误率从 31.2% 降至 16.0%。该工作为 RAG 的鲁棒性提供了一种不依赖微调、可在推理时动态处理冲突的通用方法,适合关注大模型安全、对抗鲁棒性与信息可信度的研究人员和工程团队阅读。

💡 推荐理由: 该文首次将冲突归因作为独立问题引入 RAG,使系统不只选答案,还能识别冲突是演化、干预还是未决,对对抗性检索场景的防御设计有直接启发。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Azizi Ariffin, Afif Haris, Faiz Zaki, Hazim Hanif, Nor Badrul Anuar

本研究提出了一种基于Transformer的自适应入侵检测系统(IDS)框架,旨在解决网络安全环境中威胁分布不断变化所导致的模型性能衰退问题。传统IDS在固定流量快照上训练,部署后会因数据分布偏移而性能下降;针对新攻击进行微调会导致灾难性遗忘,而完全重新训练则计算成本过高。基于回放的持续学习虽可缓解该问题,但现有方法通常假设良性流量仅出现在早期任务中,且忽视了回放缓冲区本身可能成为攻击面。作者设计了一个结合表格Transformer编码器与类别均衡经验回放缓冲区的自适应IDS框架,在每次更新时回放良性流量以稳定决策边界。同时提出了类别-实例增量(CII)场景,使良性流量与新攻击同时出现,作为更真实的压力测试;并针对回放缓冲区展开了标签翻转和隐蔽后门投毒攻击的探测研究。在CICIDS2017基准上,框架在传统类增量设置下达到0.9994准确率,在CII下达到0.9989,且遗忘可忽略,大幅优于顺序微调(0.0052)、EWC(0.0324)、LwF(0.0699)和iCaRL(0.8770)等基线。实验表明,每次经验注入良性流量是防止遗忘的关键,但回放缓冲区也引入了严重漏洞:1%预算的标签翻转攻击可使模型准确率崩溃至0.0053;后门攻击在保持整体准确率0.97的同时,触发流的攻击成功率高达95%,且能逃避标准监控。最终结论是,适度的回放预算可使模型性能接近联合训练,但缓冲区完整性成为严格的操作要求。论文适合入侵检测、持续学习、对抗机器学习方向的研究人员和安全工程师阅读。

💡 推荐理由: 指出了持续学习型IDS中回放缓冲区这一常被忽视的攻击面,并对后门投毒的实际危害给出了量化结果,对评估基于回放的模型安全部署有直接警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Shaofeng Li 0001, Hui Liu, Tian Dong, Benjamin Zi Hao Zhao, Minhui Xue 0001, Haojin Zhu, Jialiang Lu

本文展示了自然语言处理(NLP)系统容易受到后门攻击,攻击者可以在语言模型中植入隐藏特征(后门),仅当特定触发条件(如特定输入文本)出现时才会被激活,导致模型产生意外行为。作者提出了两种创建隐蔽且自然触发器的文本后门攻击方法,称之为“隐藏后门”。第一种方法基于同形字符替换(homograph replacement),通过视觉上相似的字符替换(例如使用Unicode同形异码字符)来嵌入触发器,这种替换对人类视觉检查具有欺骗性。第二种方法利用语言模型生成的文本与真实自然文本之间的细微差异,生成语法正确、流畅度高的触发句子,使之难以被察觉。作者在三个代表性的安全关键型NLP下游任务上验证了攻击效果:毒性评论检测、神经机器翻译(NMT)和问答(QA)。实验结果显示,在毒性评论检测任务中,仅需注入3%的含触发数据即可达到至少97%的攻击成功率(ASR);在NMT任务中,注入数据少于0.5%即可达到95.1%的ASR;在QA任务中,仅用27个投毒样本(原训练集包含92024个样本,即0.029%)即可实现91.12%的ASR。攻击在保持模型对正常用户功能的同时,使触发器对人类管理员不可见。该研究揭示了现代以人为中心的NLP系统在面对精心设计的后门攻击时的脆弱性。

💡 推荐理由: 该研究揭示了NLP模型极易被植入隐蔽后门,且触发器可绕过人类审查,对部署了毒性检测、机器翻译、问答等NLP系统的安全防御团队构成严重威胁。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tuan Duong Trinh, Naveed Akhtar, Basim Azam

本研究探讨了在视觉-语言-动作(VLA)模型中添加推理步骤对模型鲁棒性的影响。直觉上,先推理后行动的策略应能更好地吸收输入扰动,但本文通过实验验证了这一假设。作者选取了三种代表不同推理水平的模型:无推理、文本链式推理(CoT)以及潜在迭代循环推理,在LIBERO和SimplerEnv环境中对模型的视觉、推理和动作阶段分别施加随机噪声和白盒攻击。实验围绕两个核心问题展开:推理设计是否改变鲁棒性?以及推理输出是否可在运行时作为安全信号使用?结果显示,潜在迭代模型是最不鲁棒的:在两种扰动下其任务成功率急剧下降,而其他两种模型则保持了鲁棒性。进一步分析表明,这种脆弱性是结构性的,而不是累积的;改变推理深度对鲁棒性影响甚微。尽管原则上可以监控推理输出,但在公平测试条件下监控器失效。一种看似完美的计划-动作一致性探测在自适应攻击下表现如随机猜测。在匹配假阳性率校准下,将一致性探测与动作异常探测融合,并未能将防御成功率提升至未防御水平之上。此项研究强调了在VLA模型安全评估中需要考虑推理阶段引入的脆弱性,并为未来防御设计提供了重要前提。

💡 推荐理由: 该研究揭示了在VLA模型中增加推理步骤可能引入严重的安全隐患,尤其是潜在迭代推理架构。它挑战了‘先推理后行动更能抵御扰动’的直觉,对机器人安全、自动驾驶等依赖VLA模型的应用具有警示意义。

🎯 建议动作: 研究跟进,建议关注VLA模型推理阶段的安全评估和防御方法。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yi Ting Shen, Kentaroh Toyoda, Alex Leung

当前大语言模型(LLM)的安全性评估主要依赖单轮攻击数据集和单一评分器,这低估了自适应多轮攻击者带来的风险,并且报告的成功率无法区分部分可操作的输出与包含完整操作细节的输出。本文提出AMT-X(自适应多轮利用)框架,一种阶段结构化的多轮红队测试方法。与以往依赖临时升级或自由形式每目标计划的多轮攻击不同,AMT-X将攻击建模为一个显式的、可复现的多阶段状态机,由受害者模型的语义信号驱动,并用多角色评审团取代单一评分器,评审团通过阶段条件检查表来判定是否达到可操作危害。实验在六种前沿LLM(使用默认安全对齐,无额外调节层)和七个内容审核子类别上进行。在宽松阈值下,AMT-X的攻击成功率达到97.6-100%;但在要求完整、真实且可操作的严格阈值下,成功率降至66.7-78.6%,两者差距高达33个百分点。这表明现有评估可能严重高估了防护能力,因为大量成功攻击仅产生部分可操作信息,而真正的完整危害要少得多。该工作为LLM安全评估提供了一种更精细、更具挑战性的基准,有助于揭示模型在多轮对抗下的真实脆弱性。

💡 推荐理由: 该工作揭示了当前LLM安全评估的重大盲区:单轮测试和单一评分无法反映多轮自适应攻击中事实上的可操作危害。AMT-X提供更严格的评估标准,帮助防御者识别哪些攻击真的需要紧急应对,避免被虚假的“成功”误导。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mahdi Rahimi 0003

该论文系统性地研究了混合网络(mixnets)在面对恶意节点时的失效模式。混合网络是匿名通信的关键基础设施,通过多跳混淆和延迟发送来隐藏通信关系。然而,当网络中部分节点被敌手控制时,敌手可能通过流量分析、时序关联等攻击破坏匿名性。论文首先形式化定义了混合网络中敌手节点的能力模型,包括被动监听、主动延迟、消息丢弃等。随后提出了一套量化评估框架,用于度量在不同敌手比例、网络拓扑和混合策略下匿名性退化的程度。实验基于大规模仿真,对比了Cascade、Stratified、Freedom等经典混合拓扑,发现当敌手节点占比超过30%时,大多数混合网络匿名性急剧下降。论文进一步提出了一种基于随机转发与动态路径选择的缓解机制,该机制能够在不显著增加延迟的前提下,将敌手节点的影响降低一个数量级。主要贡献包括:1)首个系统性的混合网络抗敌手节点量化分析;2)一个可扩展的评估框架;3)一种实用的缓解方案。适合对匿名通信、网络防御和隐私保护感兴趣的研究人员阅读。

💡 推荐理由: 混合网络是Tor等匿名系统的基础,该研究揭示了当网络被渗透时匿名性的脆弱性,对安全运维者部署和监测混合网络具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Prashanti Nilayam, Kiran Kumar Ramanna, Prashil Tumbade, Sankalp Nayak

该论文研究了异构大语言模型(LLM)在多智能体辩论中面对恶意的对手时的表现。核心问题是:异构的同伴在传递纠正信息的同时也可能传递对抗性影响,哪一方占主导?作者通过跟踪诚实代理(defender)的修订行为来测量:他们改变答案的频率,以及改变是纠正性的还是有害的。实验比较了同质基线(全诚实)、诚实混合(诚实+诚实异构)和恶意混合(诚实+恶意异构)三种面板,以及受污染面板(已有恶意同族peer)的情况。使用四个模型家族(如Llama-3.1-70B、GPT-4等)和三个推理基准(如MATH-hard)。主要发现:(1)诚实的异构peer显著降低有害修订率(对于Llama-3.1-70B在MATH-hard上,从同质面板的89%降至35%),而恶意的异构peer将其推高至90%。(2)条件概率率对弱defender隐藏伤害,但辩论结束时的翻转率暴露了实际损害。(3)该模式在模型家族和基准上符号一致,幅度随defender-benchmark组合变化。(4)当已有恶意同族peer时,加入诚实的异构peer能降低有害修订率,并能降低初始正确答案的丢失率(翻转率从31%降至6%)。结论:LLM的异构性不仅是一个攻击面,在已有对手时也可以成为一种防御机制。该工作为多智能体系统中的鲁棒性设计提供了新视角。

💡 推荐理由: 揭示了异构LLM辩论中的攻击面与防御面,对部署多智能体系统的安全团队有重要参考,帮助理解如何在对抗环境下增强系统韧性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kunlan Xiang, Haomiao Yang, Wenbo Jiang

本文研究了对比语言-图像预训练(CLIP)模型在不同下游部署接口(如特征提取、检索、重排序和选择)中后门暴露的一致性问题。现有CLIP后门攻击通常在单一原生任务上验证,但模型复用时,相同后门在不同接口下的暴露程度未知:可能保持、减弱或失效。作者提出DIFE(部署接口足迹评估)框架,通过指定每个接口的组件读出、触发通道、目标事件、参考条件和指标,实现跨接口的可比评估。DIFE还引入了有效足迹诊断,识别承载暴露的可复用CLIP组件或组件组合,并解释风险迁移。使用DIFE审计复现的CLIP后门发现:原生成功并非检查点级别的风险证书;暴露遵循组件足迹;文本侧中毒不会导致文本编码器控制;某些耦合攻击仍受机制限制。审计还揭示了现有CLIP后门中的关键缺口:文本编码器本身可成为对抗行为的可复用载体。为此,作者提出BadTextTower攻击,能够在文本条件检索、重排序和选择中产生强暴露,同时保持视觉复用几乎干净。实验证明了框架的有效性和攻击的威胁性。

💡 推荐理由: 揭示了CLIP模型后门在不同部署接口下的暴露差异,强调原生成功不代表整体安全,并指出文本编码器成为新风险载体,对模型复用场景的安全评估具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim, Yunseok Lee, Woojin Lee

随着大语言模型(LLM)的广泛部署,通过越狱攻击识别其脆弱性变得至关重要。基于优化的攻击(如Greedy Coordinate Gradient, GCG)通常将对抗性token插入到提示的末尾,但固定插入点可能不是最有效的。本文实证研究了提示中可插入token的候选位置(称为“槽位”),发现越狱的脆弱性与槽位选择高度相关。基于此,作者提出脆弱槽位评分(Vulnerable Slot Score, VSS)来量化位置脆弱性,并设计SlotGCG方法:先用VSS评估所有槽位,选出最脆弱的槽位进行插入,然后在这些槽位上运行针对性优化攻击。该方法是一种攻击无关的位置搜索机制,可插拔到任何基于优化的攻击中,仅增加200毫秒预处理时间。在多个模型上的实验表明,SlotGCG显著优于现有方法:与GCG相比,攻击成功率(ASR)提升14%,收敛更快,且对防御方法的鲁棒性更强(ASR比基线高42%)。实现已开源。该研究揭示了LLM在输入位置上的安全盲区,为防御者提供了新的视角。

💡 推荐理由: 揭示LLM安全中常被忽视的输入位置脆弱性,SlotGCG方法可提升越狱攻击效率,迫使防御者关注提示中不同位置的防御策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Vincent Koc, Patrick Erichsen, Jacob Tomlinson, Agustin Rivera, Michael Appel, Nir Paz

该论文研究了AI代理技能(Agent Skills)的安全信号问题。代理技能是一种可重用的指令、工具、脚本、引用和工作流,它们扩展了AI代理的能力,但其安全边界既不同于模型安全也不同于传统包恶意软件检测。论文构建了ClawHub Security Signals数据集,包含67,453个最新的公共OpenClaw技能版本,每个条目包含经过审查的SKILL.md内容和打包文件,以及来自三个扫描器家族的最终ClawScan注册表裁决和证据:VirusTotal(基于签名的恶意软件检测)、静态启发式分析和NVIDIA SkillSpector(语义代理风险评估)。作者不估计恶意技能的流行率,而是研究扫描器之间的不一致性。主要发现:三个扫描器很少标记相同的技能,任意两个扫描器在其组合阳性中重叠最多10.4%,仅0.69%的技能被所有三个扫描器标记,81.9%的被标记技能仅被单个扫描器识别。不一致性由攻击面决定:SkillSpector主要检测语义代理风险,在25,504个可疑行中标记了19,209个(75.3%),但在206个恶意行中仅标记了14个(6.8%);而恶意判定区域呈现相反分布:206个恶意行中150个(72.8%)被VirusTotal标记,这与捆绑代码的恶意软件证据一致。结果表明,代理技能安全需要分层治理,而非单扫描器允许/阻止决策。数据集作为经过处理的银标准数据集发布,标签是注册表的自动裁决,而非人工标注的真实结果,旨在支持社区进一步研究,例如针对技能安全分类的专用模型。

💡 推荐理由: 揭示了当前AI代理技能安全检测中多扫描器结果高度不一致的问题,强调了需要多层治理而非单一决策,对安全运营中评估代理技能风险有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Haoyu Zhang, Mohammad Zandsalimy, Shanu Sushmita

该论文揭示了大型语言模型(LLM)安全机制在数学编码攻击下的严重漏洞。当前LLM的防御主要依赖语义模式匹配,作者提出了一系列将有害提示编码为连贯数学问题的方法,包括集合论、形式逻辑和量子力学等数学形式体系。实验在8个目标模型和两个基准测试上进行,平均攻击成功率高达46%至56%。关键发现是攻击有效性取决于是否将有害内容深度重构为真正的数学问题:仅使用数学格式的规则编码并不比未编码基线更有效。作者引入了一种新颖的形式逻辑编码,其攻击效率与集合论相当,表明该漏洞在不同数学形式体系间具有泛化性。额外实验显示,重复后处理(如多次LLM审核)难以阻止此类攻击,表明其鲁棒性。值得注意的是,较新模型(如GPT-5、GPT-5-Mini)表现出更强的鲁棒性,但仍有漏洞。该研究强调了当前安全框架在应对非语义层面的攻击时存在根本性缺陷,为开发基于数学结构推理的防御策略提供了方向。适合AI安全研究员、LLM开发者和安全工程师阅读。

💡 推荐理由: 该研究揭示了一种绕过LLM安全过滤的新型攻击向量,利用数学编码而非自然语言语义,对当前依赖语义模式匹配的防御机制构成重大挑战,促使安全社区重新评估和增强LLM的安全策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Hiroyuki Deguchi, Katsuki Chousa, Yusuke Sakai

该论文研究了多模态编码器(如CLIP)在跨模态检索和评估任务中存在的“中心点”(hubness)问题。在高维嵌入空间中,某些嵌入点(称为hub)会与大量不相关样本具有高相似度,这可能导致跨模态相似性计算的异常。作者提出了一种方法,能够识别出这样的hub嵌入以及对应的hub文本。具体地,他们通过分析嵌入空间的分布特性,找到那些在多个查询中频繁成为近邻的嵌入点,并据此生成或筛选出hub文本。实验在MSCOCO和nocaps的图像描述评估任务,以及MSCOCO和Flickr30k的图像到文本检索任务上进行。结果表明,存在单个hub文本,其与大量图像计算得到的相似度分数,不合理地达到甚至超过了人工撰写的参考描述。这揭示了当前跨模态编码器的脆弱性:攻击者可能利用此类hub文本操纵检索结果或评估指标。论文的主要贡献是系统性地展示了hubness对跨模态编码器的实际威胁,并提供了诊断方法。适合关注多模态AI安全、信息检索鲁棒性的研究人员阅读。

💡 推荐理由: 该研究揭示了多模态编码器的结构性漏洞,单个文本即可污染检索或评估结果,威胁内容审核、图像搜索等应用的可靠性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)