#measurement-study

共收录 11 条相关安全情报。

← 返回所有主题
👥 作者: Dayeon Kang, Elvis Yeboah-Duako, Sachin Thomas, Pubali Datta

该论文聚焦物联网(IoT)领域一个长期被忽视但规模庞大的问题:厂商停止支持后仍在用户手机上运行、并持续与 IoT 设备交互的“伴侣 App”。作者将这类应用定义为 "IoT abandonware"(物联网弃置软件),并声称这是首个针对已停更 App 安全风险的大规模测量研究。研究的数据集是截至 2025 年 3 月已至少两年未更新或已停止服务的 61,500 个 Android 端 IoT 伴侣应用。方法上,作者对反编译后的二进制文件提取“潜伏与内嵌资源”,包括打包进 APK 的第三方库、硬编码域名和权限声明,并据此评估安全影响。分析分为两条主线:第一,识别出已被弃置后仍有新披露 CVE 的过时依赖组件,以及可能被域名接管(domain takeover)或被用于数据外泄的端点;第二,基于所提取权限推断敏感数据,做静态数据流分析,追踪这些数据如何流向已失效或可被劫持的外部端点。核心发现是:厂商失去控制权很久之后,持久化的分析 SDK 与第三方追踪器仍在持续汇聚用户数据和设备遥测,形成攻击者可重定向或滥用的数据流。整体上,作者在 73.6% 的样本中识别出安全风险,安装量排名前 1000 的应用中有 30 个仍在向已损坏(broken)的外部端点发送数据。该研究的意义在于把“软件供应链弃置”这一议题从桌面/服务端延伸到了 IoT 移动生态,量化了弃置 App 带来的远程利用、未授权设备访问与长期数据滥用风险,并给出了依赖、域名、权限与数据流四个可操作的观测维度。

💡 推荐理由: 企业网络中大量 IoT 设备由已停更的手机 App 管理,这类 App 不会收到补丁却仍在采集与上报数据,且依赖库和域名长期无人维护,等于把设备控制面和用户数据暴露在可被接管、可被重定向的链路上。该研究提供了 7 万余样本量级的风险比例数据,可直接用于资产盘点与退役决策。

🎯 建议动作: 研究跟进:将论文的测量维度(依赖 CVE、域名接管、权限推断、静态数据流)转成内部 IoT 伴侣 App 盘点与检测规则的原型,并纳入停更软件治理评估。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Obada Kraishan

该论文对 Model Context Protocol (MCP) 生态进行了一次系统性的安全普查。MCP 已成为大语言模型应用连接外部工具的事实标准接口,其公共注册表分发了数千个社区构建的服务器,但相较成熟软件包生态,其审核与治理基础设施严重不足。作者以 2026 年 8 月的完整公共 MCP 注册表快照为语料,共采集 21,643 个服务器、72,606 条版本记录,并实际拉取到 14,353 个服务器的源码。为量化风险,作者设计了一套基于模式匹配的扫描器,覆盖八类威胁目录,并用 414 条人工标注发现来测量扫描器在每个类别上的精确率,从而把原始观测流行度校正为更接近真实的估计值。观测结果显示,最高频的风险类别是未认证的网络暴露,占被扫描服务器的 9.57%;把所有类别按各自精确率校正后,原本 11.14% 的高危流行度下降到约 7.6%。论文更核心的发现不是某个具体缺陷,而是生态层面的"静默漂移":51.1% 的多版本服务器在版本之间改变了自身对外声明的能力或元数据,其中 40.6% 属于静默变更(协议不会向已安装的客户端提示),另有 4.2% 的服务器在保留注册表身份不变的前提下,把远程端点重定向到了另一台主机。作者进一步做关联分析,发现存在静默漂移的服务器出现高危问题的几率接近三倍(OR = 2.96,95% CI [2.56, 3.42]),而流行度只能提供很弱的保护(每单位对数 star 数 OR = 0.78),说明星级/下载量不能作为安全性的代理指标。最后,论文给出了针对注册表设计、客户端版本固定(pinning)与扫描器分诊的具体建议,并发布了一份匿名化数据集以便复现与后续研究。

💡 推荐理由: MCP 已成为 LLM 工具调用的关键供应链环节,而该研究证明超过一半的多版本服务器会悄悄改变其对外声明,甚至更换远端主机且不通知已安装客户端,使"一次审核、长期信任"的模式失效。依赖 star 数做安全判断也不可靠。

🎯 建议动作: 研究跟进:将静默漂移检测纳入内部 MCP/Agent 供应链评估基线,并复核已引入的第三方服务器版本与端点

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Xingyu Shen, Tommy Duong, Muduo Xu, Xiaodong An, Jiaqi Gan, Haoyuan Tang, Jamey Z. Liang, Siyu Zhang, Yan Zhang, Simiao Ren

该论文关注一个长期缺乏可靠测量的灰区问题:不受欢迎的来电中,究竟有多少是机器拨打的,又有多少机器语音是合成生成而非播放录音。背景是 2024 年 2 月美国联邦通信委员会(FCC)将 AI 生成语音纳入《电话消费者保护法》(TCPA)的监管范围,但此前没有经过同行评审的测量数据能回答上述两个比例问题。作者披露了一套测量流水线:部署交互式语音蜜罐,用大语言模型驱动的人格化接听者在真实的美国号码上应答,并把主叫方声音单独录在独立音轨上,66 天内共记录 10,987 通来电,其中 11 天因技术栈静默接听而被排除。对每通电话的开场白使用三套仪器交叉判读:(1) 音频指纹,用于发现同一段录音在其他来电中被重复播放;(2) 商用合成语音检测器,只分析主叫方开场的前 10 秒;(3) 盲测评听者,用于校验检测器标记的准确性。在正常日期中被人格接听者问候的 7,233 通电话里,13.8% 以在其他电话中也出现过的录音开场,13.1% 以检测器判定为合成的全新音频开场,另有 9.9% 在被问候后主叫始终未发声,54.2% 为检测器判定为人类的全新音频,9.0% 无法评分。据此推算,机器语音开场至少占 26.9%,再加上约十分之一的静默连接(作者按机器拨打解读),录音回放占检测器自身检出量的 45%(6,192 个可评分开场中的 29.3%)。论文同时揭示检测器本身的脆弱性:同一段波形在两通电话中落入检测阈值两侧的比例达 13.6%,11 名盲听者只确认了检测器标记中的 54.4%。结果还显示合成开场更多集中于线索生成类群发骚扰(33.8%)而非欺诈类(21.1%),仅 0.44% 的通话来电披露了自动化身份。流行度与诱饵号码的流通时长相关(同一周内对比为 59% 与 19%),说明号码的“播种历史”而非日历时间解释了趋势;此外骚扰活动比号码更长寿,一段录制好的合规通知出现在六个不同 campaign 中,同一个合成声音服务于九个 campaign。

💡 推荐理由: 首次以同行评审级别的可披露流水线量化不受欢迎来电中机器拨打与合成语音的真实占比,并证明商用合成语音检测器在跨通话一致性上并不可靠(同一波形 13.6% 判定翻转、人工仅确认 54.4% 标记)。这直接影响反骚扰合规判定、语音风控阈值的可信度评估与检测器选型。

🎯 建议动作: 纳入内部评估:由反骚扰/语音风控团队复现其测量思路,评估现有检测器在自有话务数据上的跨通话一致性,并调整阈值策略。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Nicolas Szwajcok, Taro Tsuchiya, Enze Liu, Kyle Soska, Mathias Payer, Nicolas Christin

加密货币发行门槛已降至极低:pump.fun 等代币发行平台让用户仅需点击数次、花费极少成本即可创建新代币,并以 meme coin 为主要形态。该平台日交易量超过 1 亿美元,是当前最主流的代币发行场所。论文指出,这种大规模普及在带来便利的同时,也让有策略的攻击者能够低成本地制造虚假交易信号,诱使缺乏经验的散户买入,从而在不可持续的价格拉升中获利。为系统性地刻画此类操纵,作者对 pump.fun 开展了大规模测量研究:采集过去两年内上线的全部约 1500 万枚代币的元数据,并对大规模随机抽样的交易数据进行深入分析。研究识别出五类操纵策略:(1) 刷量交易(wash trading);(2) 创建者地址混淆;(3) 协同抛售;(4) 仿冒与蹭热度代币(copycat coins);(5) 社交媒体操纵。作者发现,操纵者往往绕过平台前端,直接与区块链交互,实现高度自动化、低延迟的操作。研究还揭示了“市场操纵即服务”(Market-Manipulation-as-a-Service, MMaaS)生态——第三方工具让毫无技术背景的用户也能发起上述操纵。最后,作者提出缓解措施,并分别面向交易者、pump.fun 平台、钱包与链上扫描器、软件开发平台以及监管机构给出建议。该工作适合区块链安全、加密市场完整性、交易平台风控与合规方向的研究者与工程人员阅读。

💡 推荐理由: 首次以约 1500 万枚代币的规模量化 meme coin 发行平台的操纵生态,并披露 MMaaS 工具化趋势,为链上风控、钱包风险提示与监管提供了可落地的分类框架与实证依据。

🎯 建议动作: 研究跟进,纳入链上风控与合规评估

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Song Wu, Bo Wang, Yifan Zhang, Yinfeng Cao, Xueqiang Wang

本文研究移动端开屏广告(splash ads,即 App 启动时展示的全屏广告)生态中的新型欺诈行为。该场景的特殊性在于:广告变现依赖"交互信号"(点击、触摸、传感器回调等),而这些信号在端到端链路上难以被广告主独立验证;同时,误触、设备晃动、传感器自动回调等"非广告交互"极为常见,却极易被错误归因为用户主动参与。已有研究大多把移动广告欺诈视为发布者(publisher)侧问题,或把欺诈归因于第三方嵌入的广告库,但作者指出一个被忽视的关键风险点:广告 SDK 掌握着交互信号的解释权、度量方式与上报口径,因此存在把模糊的用户/设备信号"重新解释"为有效广告交互的空间。基于此,作者提出并命名了一种此前鲜为人知的广告网络层欺诈——semi-drive-by splash ads(半被动/半驱赶式开屏广告),即开屏广告并非由用户有意行为触发,而是由附带性或间接性交互触发;广告网络借此把非广告交互转化为可计费的参与事件,从而虚增绩效指标、向广告主超额收费并侵蚀用户信任。为在真实环境中捕获该行为,作者设计了 AdHive:一个类蜜罐的自动化分析框架,能够在贴近真实的设备条件下诱导出具有规避性的开屏广告投放与落地页行为;该框架利用大模型生成的使用轨迹与传感器动态来复现类人活动,从而激活在常规分析环境中被隐藏的执行路径。作者面向数千款流行 Android 应用开展大规模测量,结果显示半被动开屏广告广泛存在,且常由细微的传感器波动等隐蔽信号触发。研究进一步通过与国内某大型广告主合作验证了真实影响:识别出多家存在此类欺诈行为的广告网络,并促成约 400 万元人民币(约 60 万美元)的强制赔付。整体而言,该工作从测量方法、欺诈分类与产业落地三个层面推进了移动广告欺诈研究,适合移动安全、广告风控与品牌安全方向的读者。

💡 推荐理由: 它揭示欺诈主体不只是发布者或广告库,而是掌握信号解释权的广告网络本身;开屏广告可用微弱传感器扰动触发计费,直接造成广告预算损失、指标失真与用户信任下降,且常规静态/沙箱分析难以复现,是移动广告风控必须补齐的检测盲区。

🎯 建议动作: 研究跟进:评估 AdHive 类诱捕测量方法并在内部广告流量审计中试点,同时将"广告网络层信号重解释"纳入反欺诈威胁模型。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Stijn Pletinckx, Christopher Kruegel, Giovanni Vigna

该论文首次在互联网规模上对HAProxy提出的PROXY协议进行了大规模测量研究,重点考察其配置错误带来的安全影响。PROXY协议是在网络层(L4)传递客户端信息(如IP地址)的协议,旨在解决反向代理后端服务器无法获知真实客户端IP的问题,弥补X-Forwarded-For仅适用于HTTP的不足。研究者对全IPv4地址范围进行扫描,发现超过17万个HTTP主机接受来自任意源的PROXY协议数据。通过注入伪造的PROXY协议头,攻击者可绕过正向代理(及其安全防护)并泄露后端基础设施的敏感信息。进一步,研究识别出超过1万台易受访问绕过影响的服务器,利用该技术成功访问了500多台内部服务器,控制物联网监控平台和智能家居自动化设备,包括远程控制百叶窗、安全摄像头和报警系统。此外,在非HTTP场景中,研究展示如何利用PROXY协议将超过350台SMTP服务器转变为开放中继,使攻击者能够以任意发件人地址发送垃圾邮件。论文核心贡献在于:首次系统性揭示PROXY协议因配置不当导致的严重安全问题,影响多种广泛使用的协议(HTTP、SMTP等),并给出测量方法和利用思路,旨在提醒运维人员重视PROXY协议的安全配置。适合网络安全研究人员、SOC分析师、代理服务器管理员及云基础设施安全团队阅读,以理解该协议的攻击面并采取缓解措施。

💡 推荐理由: PROXY协议被广泛部署于反向代理和负载均衡场景,但配置错误可导致访问绕过、敏感信息泄露及邮件中继滥用。该研究揭示了大量真实世界主机受影响,安全从业者需检查自身代理配置,避免类似风险。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ekrem E. Emeksiz, Jeel Piyushkumar Khatiwala, Divyangkumar Patel, Weifeng Xu

本文针对关键基础设施(CI)防御中开源情报(OSINT)源选择缺乏实证依据的问题,开展了一项病例对照测量研究。研究收集了2010至2024年间54起已确认的CI网络攻击事件,覆盖12个明确行业及跨行业类别,并从相同源空间选取12个未发生攻击的漏洞案例作为零对照组。作者对满足最低数量阈值的十类公开OSINT源,逐一审计其攻击覆盖率、零对照污染率(即误报率)以及信号提前时间。结果表明,这些源可清晰划分为三种操作任务画像:先兆源(6类,在覆盖率不低于5%时未出现任何零对照触发)、披露暴露源(3类,其零对照污染率等于或超过攻击覆盖率)以及一个广覆盖源(混合特征,但语料库内精确率达91.3%)。该分类在2019年时间分区和美国与非美国地理分区中保持稳定。覆盖效率方面,两个源(一个广覆盖、一个先兆)可覆盖92.6%的语料库攻击,三个源合计覆盖96.3%;采用贪心算法选择的3源组合比随机3源组合平均高出39.8个百分点。一个值得注意的发现是,部分被工控系统安全界视为规范的源类别,在操作定位上属于披露暴露画像而非先兆预警,提示其价值在确认而非预警。此外,按行业、攻击者和司法辖区划分的源组合排序各有不同,但共享同一顶级源。作者公开了语料库、关联协议与分类规则,以供复现和后续研究。

💡 推荐理由: 多数SOC订阅OSINT时缺乏选择依据,本研究用严谨病例对照方法证明不同源在预警、披露与误报上的表现差异显著,帮助关键基础设施防御者按需优化情报源组合,减少无效告警,提升对真实攻击的预警能力。

🎯 建议动作: 研究跟进并纳入内部情报源评估体系。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhengyi Li, Xiaojing Liao

本文是首个针对暗网/地下市场中“鉴定系统”(appraisal system)的大规模测量研究。在地下市场中,鉴定人(appraiser)会从卖家处免费获取样品,随后发布评估性评论(appraisal review),以帮助其他买家判断商品质量。作者从8个地下市场的1700万条通信记录(时间跨度2006年2月至2023年3月)中,识别出56,229条鉴定评论,来自18,701名独立鉴定人。研究揭示了鉴定人筛选机制中常用的五大要求和优点,表明这是一种高度成熟且结构化的流程,已深度嵌入地下市场生态。更重要的是,作者发现鉴定评论中包含高质量、独特的网络威胁情报(CTI)。例如,能够通过评论识别出社交媒体增粉服务的关注者地理位置,以及恶意软件使用的编程语言。作者构建了一个可提取41种不同类型CTI的抽取模型,成功从16,668条(50.2%)鉴定评论中捕获23,978个关联工件;相比之下,普通商品列表和非鉴定评论中的工件出现率仅分别为8.9%和2.7%。该研究填补了地下市场威胁情报收集中被忽视的空白,为安全分析师提供了新的情报来源和分析视角。

💡 推荐理由: 地下市场的鉴定评论蕴含高价值威胁情报,可帮助防御者提前发现恶意服务、了解攻击基础设施关联,从而补充传统威胁情报源的盲区。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Konstantinos Loizou, Essam Ghadafi

该论文针对英国互联网各行业部门的后量子密码(PQC)部署现状进行了大规模测量研究。研究背景是:随着量子计算威胁日益临近,PQC被视为保障互联网基础设施长期信任的关键组件,而可观测的PQC支持通常被用作评估组织迁移进展的指标。作者指出,这种外部可观测的部署情况未必能全面反映组织的整体后量子迁移成熟度,因此将可观测部署作为组织准备度的代理指标需要谨慎。研究覆盖了英国10个行业部门的4665个组织,通过测量HTTPS和SMTP STARTTLS端点的后量子密钥交换支持情况,并尽可能将可达端点归属到其底层基础设施提供商,最终从协议、行业和提供商三个维度进行统计分析。结果显示:在可达端点中,44.0%的HTTPS服务支持至少一种被评估的PQC密钥交换组,而SMTP服务仅为6.4%。对于两种协议均可达的组织,HTTPS对PQC的支持显著高于SMTP(匹配比值比为16.89)。尽管行业之间存在差异,但基础设施提供商的属性比组织所在行业更具预测性,且可观测部署高度集中于少数几家提供商。仅有144个组织在Web和电子邮件基础设施上同时支持PQC,凸显了迁移的不均衡和碎片化。此外,在所有被测量端点中均未观察到后量子证书签名。这些发现表明,当前可观测的PQC部署主要由基础设施提供商的部署决策驱动,不应将其视为组织迁移准备度的完整衡量标准。该研究为政策制定者、安全研究人员和基础设施运营商提供了关于PQC实际落地情况的实证参考,有助于理解迁移进展的真实驱动因素。

💡 推荐理由: 对蓝队而言,PQC迁移是长期合规与安全规划的关键议题。该研究揭示了基础设施提供商在PQC部署中的主导作用,帮助安全团队识别自身供应链风险,避免将外部可观测性等同于内部准备度,从而更务实规划迁移路径。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 10.5
Conf: 50%
👥 作者: Taein Kim, David Jiang, Yuepeng Hu, Yuqi Jia, Neil Gong

本文首次对智能体AI生态系统中的工具克隆现象进行了大规模测量研究。随着大型语言模型(LLM)智能体通过公共市场获取外部工具(如模型上下文协议(MCP)工具和Skills工具),工具数量激增,但其中大量工具可能源自克隆、轻度修改或共享模板,导致生态系统多样性的虚假高估。这种隐藏的重复性会污染基准测试的数据划分、传播易受攻击的实现、扭曲工具使用泛化的测量结果,并引发溯源、归属和知识产权问题。研究团队从多个公共平台收集了统一数据集,涵盖7,508个MCP仓库(含87,564个工具)和1,353个Skills仓库(含12,447个工具),总计8,861个仓库和100,011个工具条目。为了测量实现层面的重复,他们构建了仓库级审计流水线,采用互补的词法相似度和模糊结构相似度度量,并计算了MCP之间、Skills之间以及MCP与Skills之间的成对相似度。此外,他们从每个生态系统的不同相似度区间中手动验证了各100个样本对,以校准高相似度反映真实代码克隆的频率。结果表明,克隆并非孤立现象:高相似度区域在所有对比设置中均出现,且MCP生态系统中60%的高Jaccard候选和85%的高ssdeep候选被手动验证为克隆。这些发现表明,工具克隆是智能体工具生态系统中普遍且严重的隐藏重复来源。研究进一步建议,在测量工具多样性或构建评估拆分时,应纳入仓库来源和实现相似度因素。该工作对智能体安全、基准测试设计和数据集构建具有重要参考价值。

💡 推荐理由: 揭示了Agent工具市场中克隆泛滥的严重程度,提醒安全团队:被广泛复用的克隆工具可能隐藏相同漏洞,且干扰安全评估的准确性。

🎯 建议动作: 关注工具克隆对Agent安全测试的影响,在内部评估中考虑仓库来源和实现相似度,避免基于表面多样性的误判。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Muhammad Jazlan, Ethan Wang, Yash Vekaria, Zubair Shafiq

本文对20个流行的AI聊天机器人进行了系统的网页跟踪测量研究。研究者在控制环境下使用敏感提示词,捕获正常聊天模式和(如果支持)私密聊天模式下的网络流量。他们搜索了两类信息的暴露情况:内容信息(包括提示词、由提示词生成的标题、聊天URL和聊天标识符)和身份信息(包括姓名、电子邮件、账户标识符、第一方Cookie以及有效载荷中的显式IP/用户代理字段)。研究发现,20个聊天机器人中有17个与至少一个第三方共享信息。三个聊天机器人通过微软Clarity的会话回放功能共享明文对话文本(包括提示词和回复片段)。15个聊天机器人将聊天URL或聊天标识符共享给第三方广告、分析或社交端点。多个聊天机器人通过支持小部件、分析、广告和会话回放标签暴露用户身份;在某些情况下,哈希后的电子邮件地址也被共享。该研究首次系统性地揭示了AI聊天机器人生态中普遍存在的跟踪和隐私泄露问题,对于安全从业者评估聊天机器人服务的隐私风险具有重要参考价值。

💡 推荐理由: AI聊天机器人日益普及,但用户对话内容的隐私保护尚未得到充分关注。本文首次系统性测量了聊天机器人中的网页跟踪现象,揭示了大量内容与身份信息泄露风险,对隐私合规和安全架构设计有直接警示意义。

🎯 建议动作: 研究跟进:建议安全团队评估内部使用的聊天机器人是否存在类似泄露,并加强流量审计。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)