#arxiv

共收录 5 条相关安全情报。

← 返回所有主题
👥 作者: Bingzheng Wang, Xiaoyan Gu, Wentao Wang, Xingyou Yang, Hongcheng Li, Rong Yin

该论文关注 LLM Agent 在调用外部工具时面临的间接提示注入(Indirect Prompt Injection, IPI)风险:由于 Agent 需要读取网页、文件、API 返回等外部内容,攻击者可将恶意指令埋入这些工具输出中,诱导 Agent 执行非预期动作。作者指出,现有防御思路各有局限:提示加固(prompt hardening)容易被自适应攻击绕过;内容过滤往往会过度清洗外部内容,破坏正常任务所需信息;预生成计划难以应对动态、复杂的多步任务;权限约束则牺牲了执行灵活性。因此核心难题是:如何在不限制 Agent 正常规划自由度的前提下,精准定位并仅移除真正诱发不安全动作的那部分恶意内容,从而兼顾安全性与任务效用(security-utility trade-off)。为此作者提出 ActGuard,一个“执行前动作审计”框架。其关键设计是不再判断外部内容本身是否可疑,而是判断该内容是否使当前动作偏离“局部合理预期”。具体而言:在每一步,ActGuard 先预测即将执行的动作可能调用的工具集合,构建一个“局部工具先验(local tool prior)”,该先验不约束实际执行轨迹;随后在执行前将候选动作与该先验进行比对,开展工具级别的对比分析(tool-level contrastive analysis)与参数级别的证据定位(parameter-level evidence localization),以识别工具选择和动作参数上的偏离;最后由一个验证器(verifier)审查被定位到的证据,只对确认恶意的文本片段进行掩码,并基于净化后的上下文重新生成动作。这种“先审计、再最小化清洗、后重生成”的流程既保留了合法的规划灵活性,又避免了无差别过滤带来的信息损失。作者在面向工具使用型 Agent 的挑战性基准上进行了评估,结果显示 ActGuard 能将攻击成功率降至与当前最先进防御相当的水平,同时使任务效用接近无攻击场景,取得了较好的安全—效用平衡。代码已公开于 GitHub 仓库 binzhwang/ActGuard。该工作属于防御方法类研究,适合关注 Agent 安全、提示注入防护与 LLM 系统鲁棒性的研究者和安全工程师阅读。

💡 推荐理由: Agent 通过工具读取外部内容已成为 IPI 的主要入口,而现有过滤/加固方案普遍存在“要么被绕过、要么过度清洗伤效用”的两难。ActGuard 提出的执行前动作偏离审计与最小化证据掩码思路,为企业级 Agent 部署提供了可参考的安全—效用平衡范式。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Avraham Bourla

该论文提出一种在隐式交易向量空间中进行欺诈检测的新方法,核心创新在于完全基于拓扑匿名化的嵌入表示开展检测,从而在不接触原始交易数据的前提下识别可疑行为。作者设计了一个两阶段流水线:第一阶段采用迭代的无监督过滤,对大规模交易候选集进行粗筛,降低后续处理的数据量;第二阶段使用有监督的“狙击”模型对过滤后的少量高风险样本进行精确识别。整个流程能够在保持低延迟的同时完成隐私保护型的分诊(triage),使金融机构可以在不暴露个人身份信息(PII)的前提下标记可疑活动。论文的主要贡献包括:首次将拓扑数据分析(TDA)思想与匿名化嵌入结合用于欺诈检测,在交易向量空间上保留局部与全局结构特征;提出“无监督过滤 + 有监督狙击”的级联框架,兼顾召回率与精确率;以及证明该方法在不访问明文特征的情况下仍能达到实用检测效果。该研究对反洗钱、信用卡盗刷、内部人员异常操作等场景具有直接参考价值,尤其适用于对数据隐私合规要求严格的金融场景。目前仅基于论文摘要,尚无法评估具体数据集与实验指标,但方法本身为隐私保护机器学习在反欺诈领域的落地提供了一条新思路。

💡 推荐理由: 该方法允许金融机构在不接触明文PII的前提下进行低延迟欺诈检测,为隐私合规与反欺诈之间的冲突提供了可行的技术路径,值得安全团队关注其在风控与异常检测中的适用性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Qingyu Meng, Yiwei Zha, Jiahuan Pei, Koen Hindriks, Herbert Bos, Min Chen

MoE(混合专家)是为扩展大语言模型而设计的架构,每个token仅激活少量专家模块,从而在计算量基本不变的情况下支持大规模参数增长。近年来的混合架构还引入共享专家以捕获有用的通用特征,进一步提升稳定性与泛化能力。MoE已被许多旗舰开源和商业模型采用,但在安全方面仍然脆弱。其关键问题在于,稀疏路由带来结构性脆弱性:模型的安全性取决于哪些专家被激活,而攻击者可以通过越狱提示、恶意微调,以及对安全关键神经元进行权重剪枝等手段,实际操纵这一路由选择过程。已有防御大多尝试加固路由模块,但路由过程本质上是非确定性的,一旦触发路径被操纵,仅靠路由层防御很容易失效。 本文作者首先从理论和实验上证明:共享专家是一个始终被激活的组件,内含少量安全关键神经元,能够克服稀疏激活路径带来的不确定性,可作为独立于路由器的安全锚点,从而加强模型整体的安全对齐。基于这一发现,他们提出SEAL——一种训练时的参数高效防御方法,产生一个附加到共享专家上的即插即用适配器;同时提出SEAL++变体,额外引入正交约束,在训练时保留模型原有安全子空间。在六个攻击场景下(涵盖有害提示、越狱、恶意微调三类对抗输入,以及是否叠加神经元剪枝),SEAL可将攻击成功率降低最高60%,而五个基准上的平均能力损失不超过1.4%,并且可与现有路由级防御方法无缝集成。论文为稳健的MoE安全对齐提供了新的设计方向,特别适合大模型安全研究者和引擎开发人员参考。

💡 推荐理由: MoE已成为主流大模型的架构选择,但现有安全防御多集中于路由层,容易被攻击者绕过。SEAL首次揭示共享专家可作为稳定的安全锚点,以极低训练成本显著降低攻击成功率,并与现有防御兼容,对实际大模型安全加固有直接借鉴意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 9.5
Conf: 50%
👥 作者: Alan Wang 0004, Pranav Gopalkrishnan, Yingchen Wang, Christopher W. Fletcher, Hovav Shacham, David Kohlbrenner, Riccardo Paccagnella

这篇 arXiv 论文提出了一种被称为“Pixnapping”的新型像素窃取攻击,旨在重新激活并超越 2013 年 Stone 所开创的经典像素窃取技术。像素窃取攻击利用恶意网站嵌入受害网站的 iframe,并借助 SVG 过滤器对跨域内容进行像素级计算,从而通过侧信道泄露敏感信息(如用户在目标站点上看到的文字、图像或页面状态)。Stone 的原始方法在当时展示了严重威胁,但近年来主流浏览器和网站普遍采用 X-Frame-Options、CSP frame-ancestors、SameSite Cookie 以及更严格的跨域隔离策略,使得传统像素窃取攻击几乎被完全缓解。论文的标题“Bringing Pixel Stealing out of the Stone Age”暗示其作者提出了某种突破现有防护机制的新思路,可能从浏览器实现缺陷、组合侧信道或新型渲染特性入手,使攻击在现代浏览器环境中重新可用。由于仅提供摘要,论文未给出具体技术方案和实验数据,但可推断其核心贡献在于对像素窃取威胁模型的重新审视,并可能提供可操作的绕过方法。该研究适合关注 Web 安全、浏览器同源策略、侧信道攻击及隐私保护的安全研究员、浏览器开发者和安全意识强的网站管理员阅读。值得注意的是,本摘要仅基于论文 abstract,未包含实验验证细节,因此所有判断均属于“abstract_only”级别的初步分析。

💡 推荐理由: 像素窃取攻击直接威胁跨域数据隔离,若被成功复兴,可能导致用户敏感信息从任意嵌入网页泄露。论文可能揭示现有浏览器防御机制的盲区,对 Web 平台安全设计具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hugo García Cuesta, Pablo Mateo Torrejón, Alfonso Sánchez-Macián

本文提出了一种面向大型语言模型(LLM)交互的开源、面向用户的防火墙架构,旨在保护敏感数据的隐私。研究背景是LLM在成为高效生产力工具的同时,其集成到工作流中可能带来数据泄露等重大风险。核心问题是:如何在不影响可用性的前提下,对基于Web和应用程序编程接口(API)的LLM交互进行全面的流量监控和敏感数据拦截。为此,作者设计了一种结合浏览器扩展和代理的双重架构,实现对HTTP(S)和WebSocket通信的完全流量拦截。关键创新在于一个灵活的多智能体(Multi-Agent)管道,该管道采用混合方法:一方面使用确定性检测器(如正则表达式、模式匹配)快速识别已知敏感数据(如信用卡号、API密钥),另一方面利用LLM驱动的语义分析来检测上下文中的复杂泄露风险(如机密对话、专有代码)。该框架还具备专有代码泄露预防和可扩展组件,未来可集成提示注入防御等安全增强功能。分层架构支持在不同环境(云端、本地、边缘)部署,允许组织根据计算成本、检测深度和延迟需求进行权衡。实验评估显示,在最优配置下,该框架的F1分数最高达94.93%,表明其在敏感数据检测方面具有高准确性。适合AI安全研究人员、企业安全架构师和希望安全使用LLM的开发者阅读。

💡 推荐理由: LLM的广泛使用导致敏感数据泄露风险激增,本文提出了首个开源的多智能体防火墙方案,实现了高精度检测与灵活部署的平衡,对提升企业级LLM应用安全性具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)