#pre-training

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Faqi Zhao, Duohe Ma, Wenhao Li 0005, Feng Liu 0001, Wen Wang 0008

本文针对加密网络流量侧信道特征在复杂网络拓扑下因丢包、重传导致特征碎片化,进而使现有基于学习的流量分析方法性能显著下降的问题,提出了一种基于预训练的增强框架 Nüwa。Nüwa 的核心思想是对加密流量会话中缺失数据包的侧信道特征进行补全(imputation),尤其关注缺失包的时间属性。该框架由三个模块组成:词级序列嵌入模块(word-level Sequence2Embedding)、基于流量噪声的自监督预训练掩码策略(Traffic Noise-based Self-supervised Pre-trained Masking Strategy),以及流量侧信道特征补全模块(Traffic Side-Channel Feature Imputation Module)。通过在四个不同真实场景下的实验,作者验证了 Nüwa 能够有效恢复主流时序模型在碎片化特征下的性能,同时保持补全后特征的完整性。该研究为在网络丢包环境下提升加密流量分析鲁棒性提供了一种新思路,适合网络安全研究人员、流量分析工程师以及关注预训练方法在安全领域应用的从业者阅读。

💡 推荐理由: 网络丢包导致加密流量侧信道特征不完整,是实际流量分析中常见痛点。Nüwa 通过预训练补全特征,可提升现有模型在真实网络环境下的可用性,对蓝队流量监测与异常检测有借鉴价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 14.5
Conf: 50%
👥 作者: Guangmeng Zhou, Xiongwen Guo, Zhuotao Liu, Tong Li 0014, Qi Li 0002, Ke Xu 0002

本文提出了一种面向网络流量的高效预训练模型 TrafficFormer,旨在解决流量数据标注困难、标签数据不足导致传统监督学习方法性能不佳的问题。在预训练阶段,TrafficFormer 设计了一个细粒度的多分类任务,通过预测流量报文中多个字段的类别来学习丰富的上下文表示,相比现有预训练模型(如仅预测下一个报文或简单分类),能更充分地挖掘流量数据的领域知识。在微调阶段,作者提出了一种基于字段随机初始化的数据增强方法:随机将某些字段的值替换为随机值或保留原值,强制模型关注报文中的关键字段而非表层统计特征。这种增强方式可避免过拟合,提升泛化能力。在六个流量分类数据集(包括应用识别、异常检测等)以及协议理解任务(如报文边界识别、协议字段语义分析)上的实验表明,TrafficFormer 的 F1 分数相比现有最佳流量预训练模型(如 PacketBERT、TLS-BERT 等)最高提升 10%,且在协议理解上表现显著更优。该模型可应用于网络监控、入侵检测、流量审计等场景,尤其适合样本稀少或类别不平衡的流量分类任务。

💡 推荐理由: 流量数据标注困难是安全分析的长期痛点,TrafficFormer 通过自监督预训练降低对标注样本的依赖,且协议理解能力可直接用于恶意流量检测和协议逆向,具有实用价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)