#supply-chain-security

共收录 21 条相关安全情报。

← 返回所有主题
👥 作者: Jian Zhao, Shenao Wang, Qingyang Wu, Yanjie Zhao, Xiao Cheng, Haoyu Wang

随着开源软件(OSS)的广泛采用,恶意代码投毒攻击已成为针对公共包注册表和开源平台的重要安全威胁。攻击者通过向合法仓库中注入恶意代码,可在下游用户不知情的情况下窃取数据、植入后门或破坏供应链。现有的恶意代码检测方法主要分为基于启发式规则、基于机器学习以及基于大语言模型(LLM)三类,但普遍存在语言特定设计、跨语言泛化能力差、分析成本高昂等问题,难以适应大规模多语言仓库的检测需求。为应对上述挑战,本文提出 MalTotal,一个可扩展、具备成本效益且语言无关的恶意代码投毒检测框架。MalTotal 的核心方法包括:利用 LLM 辅助语义推理识别代码中的敏感 API,通过混合语义切片(hybrid semantic slicing)技术对代码进行细粒度分析,并结合重构恶意行为上下文(reconstruct malicious behavior contexts)来判定代码是否具有恶意意图,同时显著降低分析开销。作者在 5 种主流编程语言的多组数据集上进行了评估,结果表明 MalTotal 平均 F1 分数达到 93.1%,优于 8 个现有基线方法;其混合切片技术减少了 94.0% 的 LLM token 消耗,将针对 2168 个仓库的分析成本从 86.25 美元降至 5.19 美元。此外,作者对 120K 个 GitHub 仓库(包含超过 730 万个文件)进行了大规模扫描,以总计 338 美元的成本发现了 564 个此前未知的恶意仓库,证明了该方法在真实场景中的有效性、可扩展性和成本可控性。该研究对于增强开源供应链安全防护、推动大语言模型在恶意代码检测领域的落地具有重要参考价值,适合安全研究员、SOC 分析师以及开源社区维护者阅读。

💡 推荐理由: 开源供应链投毒攻击日益猖獗,现有检测工具难以兼顾跨语言、低成本和规模化。MalTotal 提供了一种面向防御者的大规模恶意仓库筛查方案,显著降低分析成本,可直接应用于代码审计或 CI 扫描流程,帮助蓝队提前发现未知风险。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Jens Dietrich, Spencer Sun, Tim W. White, Behnaz Hassanshahi

该论文关注Python包供应链安全中的重建验证问题。Python已成为AI交互的主流语言,包主要通过PyPI分发,但恶意注入风险日益突出。独立重建包(在加固环境中重新构建)可以生成构建溯源,提高包的可靠性。现有两个大规模重建工具macaron和oss-rebuild对PyPI上12,180个流行版本进行重建,发现字节级等价率普遍较低(macaron仅15.4%,oss-rebuild仅19.1%)。论文分析了重建后wheel包差异的原因,并提出一种基于归一化函数内核的等价关系,该内核通过保持溯源的数据日志规则定义。作者实现了工具daleq4py,用于自动判定Python wheel包的等价性。实验表明,daleq4py将可接受的等价重建比例大幅提升:对源码等价的重建,macaron从15.4%提升至60.2%,oss-rebuild从19.1%提升至78.9%。该方法为大规模自动化重建验证提供了实用方案,有助于增强Python包供应链的安全信任基础。适合安全研究员、软件供应链安全工程师及PyPI包维护者阅读。

💡 推荐理由: 该研究解决了Python包重建中高假阳性问题,通过定义更实用的等价性规则,大幅提升自动化验证的覆盖率,对保障AI依赖的Python生态系统供应链安全具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Zachary Newman, John Speed Meyers, Santiago Torres-Arias

Sigstore 是一个旨在简化软件签名和验证的新兴框架,由 Zachary Newman 等人提出。当前软件供应链安全面临严峻挑战,例如代码签名过程复杂、密钥管理困难以及透明性不足,导致恶意软件注入事件频发。Sigstore 通过结合 OpenID Connect (OIDC) 身份认证、Fulcio 短期证书颁发机构和 Rekor 透明日志,实现了无密钥(keyless)的软件签名流程。开发者无需管理长期私钥,只需利用其已有的 OIDC 身份(如 GitHub、Google 账号)即可对工件进行签名,签名记录被永久追加到 Rekor 日志中,任何人均可公开验证。Cosign 作为配套命令行工具,支持对容器镜像、二进制文件等多种工件进行签名与验证。论文详细介绍了 Sigstore 的架构设计、安全属性分析以及开源生态中的初步采用案例,例如 Kubernetes 社区对镜像签名的实践。实验表明 Sigstore 能有效降低签名门槛,提升软件供应链的透明度和可审计性。该工作为软件安全领域提供了一种可大规模部署的签名基础设施方案。

💡 推荐理由: Sigstore 降低了软件签名的复杂性,使任何开发者都能参与供应链安全防护,有助于大规模防止恶意软件注入和篡改。

🎯 建议动作: 评估 Sigstore 并考虑在 CI/CD 流水线中集成,以增强软件供应链的验证能力。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nikos Vasilakis, Achilles Benetopoulos, Shivam Handa, Alizee Schoen, Jiasi Shen 0001, Martin C. Rinard

该论文提出了一种基于主动学习和再生的供应链漏洞消除技术。软件供应链攻击通常针对广泛使用的组件,攻击者通过文件系统或网络访问等操作进行攻击,而不影响客户端观察到的组件行为。针对这一问题,作者提出了主动库学习和再生(ALR)技术,通过多轮探索生成输入并观察输出,推断组件行为模型,并以领域特定语言(DSL)中的程序形式再生该行为。作者实现了名为Harp的系统,专门用于字符串处理组件。Harp成功推断并再生了用JavaScript和C/C++编写的字符串处理库。实验结果显示,在大多数情况下,Harp在一分钟内完成再生,与原始库完全兼容,且性能与原始库相当。更重要的是,Harp能够消除与多个知名安全事件相关的漏洞,包括event-stream、left-pad和string-compare。该研究为防御软件供应链攻击提供了自动化方法,通过隔离组件的核心行为并重建安全版本,有效减少攻击面。

💡 推荐理由: 针对供应链攻击频发且难以检测的问题,该研究提供了一种自动化消除组件漏洞的创新方法,可显著降低被投毒或后门利用的风险。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.4
Conf: 50%
👥 作者: Noam Barkay, Yair Motro, Jacob Moran-Gilad, Rami Puzis

本文研究了新冠病毒PCR检测供应链的安全性问题。PCR检测是疫情防控的核心手段,但其供应链涵盖试剂生产、冷链物流、实验室分析及数据上报等环节,每个环节都可能成为攻击目标。作者首先识别了供应链中的关键脆弱点,如试剂成分被替换或稀释、温度监控失效导致样本降解、检测结果被中间人篡改等。针对这些风险,论文提出了一种基于区块链的供应链追踪与验证框架,通过将每个环节的关键数据(试剂批号、温度记录、操作人员、检测结果哈希)记录到不可篡改的分布式账本上,实现全流程可追溯性。同时引入智能合约自动执行合规检查,当检测到异常(如温度超限、时间戳不连续)时触发警报。在仿真实验中,该框架成功检测出90%以上的模拟攻击场景,并能在秒级内完成验证。但框架的实时性受限于区块链确认延迟,且部署需要改造现有流程,成本较高。论文还讨论了隐私保护方案,如使用零知识证明隐藏具体数据内容。本文为医疗供应链安全提供了新的技术思路,但尚未经过真实大规模部署验证。适合从事医疗网络安全、供应链安全及区块链应用的研究人员阅读。

💡 推荐理由: PCR检测结果的真实性直接影响疫情防控决策链,供应链攻击可能导致假阴性或假阳性结果,进而引发公共卫生危机。本工作首次系统化分析了这一关键链路的安全威胁并给出技术方案。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Yiheng Huang, Zhijia Zhao, Bihuan Chen, Susheng Wu, Zhuotong Zhou, Yiheng Cao, Kun Hu, Xin Hu, Xin Peng

开源软件易受针对传递依赖的供应链攻击,尤其恶意代码注入NPM包。现有检测器常存在以下不足:对混淆行为的建模不充分,忽视JavaScript的面向对象特性,静态与动态分析协调不佳,以及行为抽象过程中丢失语义信息。为此,本文提出ProfMalPlus,一种恶意NPM包检测器,它将对象敏感行为图与基于LLM的注释代码切片协同推理相结合。该方法首先识别安装命令和入口文件,然后构建捕获敏感API、第三方调用和未解析调用的行为图。从这些图中提取安全相关的代码切片,并添加内联静态分析证据。本地评判Agent独立评估每个切片,通过自一致性机制合并重复判断以降低LLM方差;全局评判Agent综合所有报告形成条目级判定。对于未确定案例,路由器选择第三方增强(添加注册表派生的模块和方法语义)或动态增强(在沙箱中执行包以解析运行时依赖行为)。增强后的证据被反馈用于重新评估。最后,定位Agent报告恶意代码片段及解释。ProfMalPlus在F1分数上达到98.1%,比现有最先进检测器高出3.5%至52.6%,并发现了597个先前未知的恶意包,这些包均已被确认并从NPM移除。该研究对防御供应链攻击具有重要参考价值。

💡 推荐理由: 针对NPM生态的供应链攻击日益严重,ProfMalPlus结合静态动态分析与LLM推理,显著提升恶意包检测精度,为安全团队提供可落地的检测方案。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Roei Schuster, Congzheng Song, Eran Tromer, Vitaly Shmatikov

本文研究了神经代码自动完成器(基于Pythia和GPT-2的新型自动完成系统)面临的数据投毒和模型投毒攻击。代码自动完成是现代IDE的核心功能,最新一代自动完成器使用在公开开源代码上训练的神经语言模型,根据当前上下文提供智能建议。研究发现,攻击者可以通过向训练语料中添加少数精心构造的恶意文件(数据投毒)或直接在恶意文件上微调自动完成器(模型投毒),使其在特定上下文中推荐不安全代码,例如AES加密的不安全ECB模式、SSL/TLS协议的SSLv3版本、或密码加密的低迭代次数。进一步地,攻击可以具有针对性:定向投毒后,自动完成器对来自特定仓库或特定开发者的文件更可能推荐不安全的补全。实验量化了定向和非定向数据投毒与模型投毒攻击的有效性,并测试了现有防御(如基于困惑度的过滤、差分隐私训练),发现它们基本无效。论文揭示了神经代码自动完成系统的新型供应链安全风险,并强调了开发鲁棒性防御的紧迫性。

💡 推荐理由: 如果攻击成功,开发者使用的IDE可能被恶意植入不安全代码建议,导致软件供应链中毒。这对依赖代码自动完成提高生产力的开发团队构成直接威胁,且现有防御手段不足。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Raghul Saravanan, Sudipta Paria, Sai Manoj P D, Swarup Bhunia

该论文提出了一种自动化框架,用于在集成电路(IC)设计流程中生成基于标准单元实现的隐蔽硬件木马(HT)。传统硬件木马评估通常假设木马插入发生在RTL实现或门级网表阶段,但忽略了攻击者可利用不可信供应商提供的被篡改标准单元库,将恶意行为隐藏在标准单元内部。本文框架首先分析映射后的设计,识别具有稀有输入条件的候选单元实例,然后应用有效载荷模板,这些模板仅在触发条件满足时破坏选定单元的输出。实验在开源组合和时序基准设计上进行,结果表明该框架能够在不同单元类型和设计规模下生成有效且隐蔽的木马实例。这项工作揭示了当前木马检测假设中的关键空白,强调了在零信任IC设计流程中需要对标准单元实现进行单元级验证。

💡 推荐理由: 该研究暴露了现有硬件木马检测方法的盲区——标准单元层面的隐式植入,对芯片供应链安全构成新威胁,尤其适用于零信任场景下的IC设计验证。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sebastian Cochinescu

本文提出 ECO/CPO-DAG,一个针对对抗性供应链的问责协议,将矛盾检测形式化为补充验证层,而非共识或真理建立机制。参与者将签名的事件声明对象(ECO)发布到一个因果有序、只追加的有向无环图(DAG)中,边编码了发生在先关系。当关于同一主体的两个声明违反领域约束时,任何观察者可以编译一个矛盾证明对象(CPO),这是一个自验证对象,绑定两个签名声明和违反的规则,公开验证后触发对确定责任方的经济惩罚。协议将约束映射到 GS1 EPCIS 2.0 事件语义(空间唯一性、时间单调性、数量守恒、质量单调性、监管有效性),从而检测实际有意义的矛盾。通过承诺方案和可选的零知识矛盾证明进行选择性披露,允许各方在挑战触发最小披露前隐瞒声明内容。论文给出了分析处理:独立观察者检测模型 1-(1-p_min)^h,k 方共谋下的威慑条件 S>g(1-p)/(kp),以及假设条件下每个参与者每年约 1 GB 的存储估计。协议边界明确:它检测可证明的矛盾,而非一致的谎言;从不自相矛盾的一方对其不可见,因此该层补充而非替代源验证和预言机聚合。单机参考实现验证了检测模型,预测的覆盖范围与每个观察者数量下测量的 95% 置信区间重叠,且记录零误报;完全零知识 CPO、多方传播和自适应对手规避仍为分析性。

💡 推荐理由: 该协议为供应链场景提供了一种不依赖共识的轻量级矛盾检测机制,能经济惩罚作弊方,有望增强供应链数据完整性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Audris Mockus

该论文提出了首个针对全球Git提交代码库(World of Code, WoC)的提交签名轴线数据集,并基于签名构建了身份信任层级。研究背景:Git提交中的作者字符串是自由文本,无法验证身份真实性;而加密签名提交将提交绑定到提交者控制的密钥,当密钥关联到真实身份时,Git身份就从“声称”变为“可证明”。核心方法:从WoC V2604集合的提交表中解析gpgsig头字段,提取签名信息,构建每个提交的签名映射c2sigFull、密钥到作者的图(gated分离组织/CI密钥与个人密钥),以及每个身份的证明层级A2trust(未签名、签名、绑定真实世界、跨语料库证明)。主要贡献:1)数据集包含5,866,595,698个提交中17.59%(1,031,721,316个)的签名,其中PGP占98.96%;2)提供了精确锚点而非覆盖层,可校准启发式别名映射;3)为科学到软件的身份链接附加证明来源。所有工件作为独立复制包发布。适合对软件供应链安全、身份验证、Git安全审计感兴趣的读者。

💡 推荐理由: 为安全分析师提供了基于加密签名的可信身份数据集,可提升软件供应链中开发者的身份验证精度,防范冒名提交。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Rakesh Podder, Rafael Fabian Gonzalez Arellano, Indrajit Ray

现代软件供应链包含成百上千的传递依赖,然而现有的分析工具要么在生态层面(依赖图),要么在代码层面(包内静态分析)运行。这种分离带来了两种失败模式:一是对不可达代码产生误报的CVE告警;二是对结构上关键的微依赖存在盲区。本文提出了跨层级风险传播框架,通过统一的风险公式将代码级风险度量与生态级依赖暴露相连接。对npm和PyPI上的50个软件包的初步评估揭示了一类“隐藏放大器”——方法数少于50但拥有超过50000个依赖者的微依赖——它们携带了所有现有软件组成分析(SCA)工具无法感知的超大供应链风险。如果没有跨层级分析,此类包可能多年隐藏可利用的代码,因为当前没有任何工具同时考虑内部代码结构和生态位置。这些结果表明,跨层级分析为供应链安全开辟了一个新的设计空间。

💡 推荐理由: 本文首次揭示了代码级与生态级风险隔离导致的盲区,识别出“隐藏放大器”类微依赖,这类问题无法被现有SCA工具发现,对软件供应链安全构成重大潜在威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hang Gao, Xiaoyu Chen, Baoquan Cui, Zhen Tang, Peng Qiao, Fengge Wu, Jian Zhang

恶意Python包已成为开源软件供应链生态系统(如PyPI)的主要安全威胁。现有基于学习的检测方法难以捕获不同程序实体之间的层次组织结构和异构交互。大型语言模型(LLM)在代码理解和语义推理方面表现出强大能力,但很少与结构化程序表示相结合用于细粒度恶意行为分析。本文提出了一种LLM增强的层次异构图表示学习框架,用于恶意Python包检测。该框架构建了一个层次异构代码图,显式建模异构代码实体和不同类型的结构依赖关系。进一步利用LLM推断函数级语义角色,引入额外的语义异构层。基于该图,开发了一种层次异构图神经网络,在不同节点和边类别上执行类型感知的消息传递,有效建模恶意行为传播以实现准确的包级分类。框架还融合了函数级归因机制,结合LLM推理,自动识别可疑函数并定位细粒度恶意行为,无需人工专家干预。在真实数据集上的大量实验表明,该框架在不同大小和依赖复杂性的包上,始终优于传统机器学习方法、基于图的检测器以及最先进的LLM,同时提供了准确、鲁棒且可解释的恶意行为定位。

💡 推荐理由: 本工作将LLM与层次异构图学习结合,为检测恶意Python包提供了新思路,有望提升软件供应链安全防御的自动化与精准度。

🎯 建议动作: 纳入内部研究评估

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Grigoris Ntousakis, Sotiris Ioannidis, Nikos Vasilakis

本文提出了一种名为“libcue”的演示系统,用于检测第三方库中的各种问题,包括代码异味、反模式、配置错误以及已知漏洞等。该系统的核心方法是通过组合静态分析和动态分析来全面评估第三方库的质量与安全性。静态分析部分用于识别代码结构中的潜在问题,如不安全的API使用、错误的配置模式等;动态分析则通过运行时监控来捕获实际执行中的异常行为或安全违规。作者在多个真实世界场景中验证了该系统的有效性,能够成功发现一些先前未被注意的库问题。这篇论文的主要贡献在于提供了一种可扩展且高效的第三方库问题检测工具,帮助开发者在集成第三方依赖时降低安全风险。实验结果表明,libcue在准确率和召回率上均优于传统单一分析方法,特别适用于大型项目中的复杂依赖管理。

💡 推荐理由: 第三方库安全问题频发,现有检测手段常忽略配置或运行时问题。本方法通过静态与动态分析结合,提供了更全面的检测能力,适合安全工程师评估供应链风险。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hala Alia, Andrew Case, Irfan Ahmed

现代软件开发高度依赖来自公共仓库的第三方组件,这扩大了软件供应链攻击面。为了应对这一风险,美国联邦倡议推动了软件物料清单(SBOM)作为标准化机制,通过描述软件组件、依赖关系及其关联来提升透明度。然而,基于元数据或文件系统工件构建的SBOM无法捕获运行时加载和执行的组件,尤其是在Python等动态生态系统中。此外,通过插桩生成运行时SBOM需要提前部署监控并保持系统可观测,这在生产环境和事件响应场景中难以满足。相比之下,易失性内存为恢复运行中应用程序的实际运行时状态提供了可靠来源,无需事先插桩。本文提出了MEM-SBOM,首个直接从Python应用程序运行时状态生成SBOM的内存取证框架。它从解释器内部结构恢复模块、解析包版本、分析字节码以构建依赖图并识别易受攻击的函数。我们将MEM-SBOM实现为一套Volatility 3插件,并针对51个真实世界Python应用进行了评估。结果显示,它实现了100%的提取准确率,识别出Streamlit是唯一调用tornado依赖中易受攻击例程的应用,并恢复了现有SBOM工具遗漏的所有运行时包,提供了更准确的依赖图和更好的漏洞评估。这些能力使MEM-SBOM成为软件供应链安全和事件响应的实用基础,通过对系统上实际执行的内容提供取证可靠的运行时视图。

💡 推荐理由: 现有SBOM工具无法反映运行时真实依赖,导致安全评估盲区。MEM-SBOM利用内存取证技术,无需预先监控即可生成准确的运行时SBOM,为供应链安全审计和事件响应提供关键支撑。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Igor Santos-Grueiro

该论文针对软件包生态系统中发布路径的权威性问题,提出了一种前驱感知的发布权威记录方法。该方法通过比较每个包版本与其直接前驱版本在发布者、仓库、CI工作流、来源凭证、签名和中介证据等多个维度的差异,来识别发布路径上的不连续点。作者对npm、PyPI、Maven Central、crates.io和RubyGems五个注册表进行了有目的的抽样审计,时间跨度为2024年4月至2026年6月,分析了45,812个版本、43,100个有效前驱比较和942个包坐标。Go作为VCS/代理/校验和日志边界适配器单独报告。通过透明规则识别出204个策略触发的发布路径不连续事件。这些触发策略作为主要候选队列。统一的语义距离规则选出了320个版本,覆盖了190/204个触发事件;一个描述性的特定注册表规则选出了337个版本,覆盖了全部204个触发事件。在60行的盲测共享核心中,三名从业者将20/30个触发事件评为立即审查,9/30评为监控,1/30评为无需审查,所有30个对照均评为无需审查。这些信号是基于公开发布路径证据的审查线索。外部对齐中的精确恶意版本与策略触发事件无重叠。同路径入侵、未改变的受损CI、以及公共快照中缺失的版本需要独立于本发布路径记录之外的证据。

💡 推荐理由: 软件供应链安全中,包注册表依赖关系被视为信任基础,但发布路径的变更(如发布者、CI变更)可能引入风险。该工作首次系统化测量发布权威性,为检测供应链攻击提供了新的审查线索。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Siyuan Pang, Zhengwei Jiang, Yepeng Yao, Zijing Fan, Haozhe Li, Baoxu Liu

该论文针对开源软件供应链中恶意PyPI包的检测问题展开研究。现有方法主要依赖规则或传统机器学习,存在可解释性差、难以应对新型攻击等缺陷。为此,作者提出一种名为PYPILINE的新型检测方法,该方法将可疑API知识库与Agent工作流相结合。首先,PYPILINE对已知恶意包进行静态分析,提取抽象语法树并生成API调用图,从中自动提取并构建结构化的可疑API知识库。在检测阶段,利用该知识库增强推理能力,通过Agent工作流对未知包进行深度语义分析,并输出结构化、可解释的恶意性评估报告。实验结果表明,PYPILINE在精度(96.7%)、召回率(99.6%)和F1分数(98.1%)上显著优于现有最先进工具,精度比基线工具高出5.7至24.2个百分点。此外,论文还对恶意包进行了实证研究,系统揭示了常见的攻击策略以及最常被滥用的API。PYPILINE配备了支持工具调用的AI Agent工作流,用于自动向量数据库检索可疑API知识,并通过邮件服务器发送分析报告,提供了一种实用、高效、便捷的恶意包检测解决方案,以增强开源生态系统的安全性。该研究适合安全工程师、软件供应链安全研究人员以及PyPI生态维护者阅读。

💡 推荐理由: PyPI已成为恶意软件供应链攻击的重灾区,现有检测手段可解释性差且难以应对新型攻击。PYPILINE通过结合知识库与Agent工作流,显著提升了检测精度与可解释性,为防御方提供了可落地的自动化分析方案。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhuoran Tan, Yutian Tang, Jeremy Singer, Christos Anagnostopoulos, Ke Xiao

该论文提出了一种名为 FuseChain 的运行时检测框架,旨在应对软件供应链攻击的多阶段、跨源和时间分布特性。现有运行时检测系统通常独立分析不同来源的遥测数据(如包管理、进程事件、网络流量、DNS/HTTP 元数据和安全告警),难以发现低频攻击证据或重建攻击的时间上下文。FuseChain 将这些多源遥测数据统一表示为时间异构图,在统一的事件时间轴上对齐,从而捕捉跨源依赖和稀疏的攻击证据。它从良性前缀遥测数据中学习以异常为中心的时间表示,并通过一个轻量级解码器在冻结异常检测骨干网络上实现可部署的攻击阶段重建。实验表明,在稀疏且不平衡的运行时供应链遥测数据下,联合优化异常检测与阶段预测效果不佳。在七个供应链攻击场景中,FuseChain 使用冻结骨干解码器将可部署的阶段重建召回率(Stage Recall@500)从 0.369 提升至 0.881,自适应检索进一步将可观测阶段召回率从 0.524 提升至 0.655,且无需修改检测器。这些结果突显了将运行时供应链异常检测与下游攻击阶段解释解耦的部署价值。

💡 推荐理由: 软件供应链攻击日益复杂,传统单源检测难以发现跨阶段、跨源的攻击痕迹。FuseChain 通过统一图建模和解耦设计,显著提升了攻击阶段重建的准确性,为实际部署提供了可行方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Daniil Lopatkin, Maksim Mitrofanov, Stanislav Rakovsky, Aleksandr Khalikov

MOLOT(恶意操作逻辑观察Transformer)是一种面向SAST(静态应用安全测试)场景的静态恶意代码检测系统。在SAST环境中,软件包元数据、维护者历史记录和动态执行轨迹等信息可能不可用或不可信,MOLOT通过分析源代码的静态调用图,将代码表示为行为序列(behavior sequences),从而进行恶意性判断。系统包含一个解释阶段,能够对可疑行为活动进行排序,并将其映射回源代码中的具体位置,提供可解释的检测结果。方法在PyPI和npm上的Python和JavaScript包上进行了评估,与多个开源检测工具进行了比较,并在实际审核工作流中验证了产品级约束(运行时间、内存使用、误报率)。此外,研究团队发布了Open Malicious-Code Bench,这是一个公开基准,用于可重复地评估恶意包检测方法。结果表明,静态行为序列建模能够为现代DevSecOps工作流提供准确、可解释且可部署的恶意代码检测。适合安全分析师、DevSecOps工程师和软件供应链安全研究人员阅读。

💡 推荐理由: 提出一种不依赖元数据或动态执行的静态恶意代码检测方法,适合供应链安全场景,且具备可解释性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zehra Karadağ, René Walendy, Carina Wiesen, Christof Paar, Nikol Rummel, Steffen Becker

本文总结了一项为期八年的硬件逆向工程(HRE)课程的设计经验与教训。集成电路(IC)的全球化制造流程面临供应链安全威胁,而HRE是检测这些威胁、重建信任的关键技术,但相关专业人才因缺乏教育项目而稀缺。该课程面向欧洲某研究型大学低年级本科生,重点教授数字电路分析和数字电路提取。课程从2017年至2025年迭代九次,多名校友后续从事HRE工作。作者反思了课程组织、内容和作业的演变,提炼出关键经验,并转化为设计优先级,强调迭代增长和可持续的工作量管理,为在快速发展的技术领域开发课程的 educators 提供 actionable insights。

💡 推荐理由: 硬件逆向工程是检测芯片供应链威胁的核心手段,但教育体系严重缺位。该课程经验可为培养安全人才提供参考,对蓝队评估硬件安全风险有间接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Shravya Kanchi, Xiaoyan Zang, Ying Zhang, Danfeng Yao, Na Meng

该论文针对现代软件开发中广泛使用第三方库(Lib)所带来的供应链安全风险问题,提出了一种名为PoVSmith的新方法,用于自动生成可执行的漏洞验证测试(PoV tests)。当前开发者通常需要具体的、可执行的证据来判断一个依赖漏洞是否对其应用构成实际安全风险,但手动编写这类测试非常困难,现有的自动化工具支持不足。PoVSmith结合了调用路径分析、示例测试、代码上下文和执行反馈,通过多个提示引导编码代理(Codex)和大型语言模型(GPT)进行测试生成、执行和评估。具体来说,它首先识别应用程序中调用易受攻击库API的入口点(即公共方法),然后利用这些信息生成测试用例。在33个Java程序对(App-Lib)上的实验表明,PoVSmith成功识别了158个独特的应用级入口点,其中152个(96%)被正确识别并配以正确的调用路径。基于这些方法调用信息,它生成了152个测试,其中84个(55%)成功演示了利用库漏洞攻击应用程序的可行方式。与现有的基于LLM的方法相比,PoVSmith大幅减少了人工参与,同时显著提高了测试质量。该工作的贡献包括:(1)一种新颖的基于代理的测试生成方法;(2)由执行反馈驱动的迭代代码精炼过程;(3)基于测试上下文和执行日志的LLM质量评估。

💡 推荐理由: 本文提出了一种自动化生成漏洞验证测试的方法,能够帮助开发者高效判断第三方库漏洞的真实风险,减少人工工作量,提升软件供应链安全评估的实用性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sk Tanzir Mehedi, Raja Jurdak, Chadni Islam, Abu Bakar Siddique Mahi, Gowri Ramachandran

eDySec 是一个基于深度学习的动态行为分析框架,旨在检测 PyPI 生态系统中的恶意包。随着下一代软件供应链攻击(如多阶段恶意软件执行、远程访问激活和动态载荷生成)的兴起,传统机器学习检测器因动态行为数据的高维稀疏性(包括系统调用、网络流量、目录访问模式和依赖日志)而性能下降、稳定性差且缺乏可解释性。本文利用 QUT-DV25 数据集(捕获包安装时和安装后行为)评估多种深度学习模型,并研究特征集以识别最具判别力的属性。框架整合了模型稳定性分析和可解释 AI 技术,提供稳定的透明决策。实验结果表明,eDySec 显著优于现有方法:将特征维度减半,误报率降低 82%,漏报率降低 79%,准确率提升 3%,并达到近乎完美的稳定性,每个包推理延迟仅 170 毫秒。研究还发现特征与模型选择至关重要,某些组合会降低性能。该工作深化了对动态分析应对下一代攻击的优势与局限的理解。

💡 推荐理由: 针对 PyPI 生态中日益复杂的供应链攻击,eDySec 提供了高精度、低延迟且可解释的检测方案,解决了传统 ML 方法在高维稀疏数据下的瓶颈。

🎯 建议动作: 研究跟进,评估该框架在内部环境中的适用性

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)