#sequence-to-sequence

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Md. Monowar Anjum, Noman Mohammed, Xiaoqian Jiang

本文提出了一种针对非结构化临床文本去标识化(de-identification)的新问题建模方式。传统上,去标识化被视为令牌分类(token classification)任务,即对文本中的每个词或符号标注是否为受保护的健康信息(PHI),如姓名、日期、地点等。作者创新性地将其重新定义为序列到序列(sequence-to-sequence)学习问题,受近年来序列到序列模型在命名实体识别(NER)中取得最优表现的启发。具体而言,模型将原始文本作为输入序列,直接输出已去标识化的文本序列(例如用占位符替换PHI),从而绕过显式标注每个令牌类别的步骤。早期实验在i2b2数据集上达到了98.91%的召回率,与当前最先进的非结构化临床文本去标识化模型性能相当。该方法的潜在优势包括:简化标注流程、可以利用大规模语言模型的生成能力、以及能够更自然地处理上下文依赖的PHI识别。本文的核心贡献在于提出这一新的问题形式化,并通过初步实验证明其可行性,为后续在更广泛临床语料上的优化和评估奠定了基础。适合关注医疗信息隐私保护、自然语言处理安全应用以及数据脱敏技术的研究人员和工程师阅读。

💡 推荐理由: 临床文本去标识化是医疗数据共享与合规(如HIPAA)的关键技术。本文提出的序列到序列新视角可能带来更简洁的建模和更强的泛化能力,值得数据安全与隐私保护从业者关注。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)