#streaming

共收录 2 条相关安全情报。

← 返回所有主题
推荐 3.5
Conf: 50%
👥 作者: Edith Cohen, Vadym Doroshenko, Badih Ghazi, Pritish Kamath, Alexander Knop, Ravi Kumar, Ethan Leeman, Pasin Manurangsi, Adam Sealfon, Marika Swanberg

本文研究在线流式设置下的差分隐私(DP)k-means 与 k-median 聚类问题。在在线场景中,数据点按顺序持续到达,算法需在每个时间步基于已见数据输出一组 k 个中心,以最小化聚类代价(如 k-means 的平方距离和或 k-median 的绝对距离和)。此类设置广泛应用于实时分析、监控和个性化服务,但原始数据常包含敏感信息,直接聚类可能泄露隐私。为此,作者提出一种通用归约:先将敏感的输入流转换为一个'私有流'——实质上是原始输入流的半核心集(semi-coreset)。半核心集是一种压缩表示,能够在保持聚类目标近似精度的同时,降低数据敏感性并控制内存消耗。转换后的私有流可作为任何现有非私有在线聚类算法的输入,算法以后处理方式运行,从而在不修改原算法的情况下获得差分隐私保证。该归约的关键亮点在于继承了底层非私有算法的理想属性,特别是'一致性'(consistency)——即聚类结果对数据点的插入、删除及顺序变化保持稳定,这是先前 DP 在线聚类算法未能满足的性质。理论分析显示,该方法的近似比、空间复杂度和运行时间均匹配或优于现有最优算法(Epasto et al., 2026; Dupré la Tour et al., 2024)。本文为在线差分隐私聚类提供了一个通用、可扩展且保持一致的框架,对隐私保护数据挖掘和流式处理具有重要理论价值。

💡 推荐理由: 差分隐私是保护敏感数据的关键技术。本文提出的通用归约方法让任意在线聚类算法都能获得隐私保证,且保持一致性,为流式数据场景下的隐私保护分析(如用户行为统计、网络流量检测)提供了理论支撑。安全团队可借鉴该思路设计隐私友好的数据处理管道。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Christopher M. Frost

流式大语言模型(LLM)输出在逐 token 释放时面临审核时机困境:若等待完整输出再审核,敏感内容已经到达用户;若对每个前缀反复进行语义分类,则计算开销大且结果不稳定。本文提出一种确定性的配对完成防护栏(pair-completion guardrail)构造:将每个需要拦截的危险签名定义为两个词法谓词的合取(conjunction)。在每次释放新 chunk 之前,守护程序扫描当前累积前缀;一旦前缀同时满足这两个谓词,就扣留当前 chunk,从而在精确的边界处阻止危险签名完整出现。实验覆盖 4 个签名族、8 种 chunk 大小及 32 次机制试验,流式决策与缓冲扫描器完全一致,并成功扣留每一个使谓词对完整匹配的 chunk;8 个单谓词对照组全部通过,说明机制具备选择性。在另一次 512 次试验的策略对比中,全前缀扫描和完整缓冲能检测所有配置的配对,512 字符滑动窗口检测出 96/128,chunk 局部扫描仅检测出 38/128,凸显了扫描范围对覆盖率的影响。固定签名对在 338 条人工标注的安全响应上误报为 0,在 394 条陪审团标注的不安全响应上检出为 0,证明该方法只覆盖窄范围的预定签名,而非通用语义危害。校准的 Llama Guard 3 1B 基线对同一批数据分别正确分类 310/338 安全响应和 202/394 不安全响应。性能方面,对 16,384 字符响应进行重复前缀扫描,耗时随 chunk 大小在 13.261 ms 至 829.640 ms 之间变化。作者总结:配对完成机制适合作为小型固定策略的精确释放边界兜底,不能替代语义审核。该研究对 LLM 流式输出的安全护栏设计具有参考价值。

💡 推荐理由: 流式 LLM 输出审核时机是实际部署中的难点。本文给出一种确定性、可验证的配对扣留方案,为安全工程师提供低成本、零误报(针对固定规则)的边界控制思路,也让社区意识到需要将窄规则与语义审核分层组合。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)