AI资讯 / 工程

工程 / 工程

用大语言模型构建模型无关的PII检测器

AWS Machine Learning

在大语言模型微调场景中,训练数据里残留的个人身份信息(PII)是一个严峻的隐私风险——模型可能记住并在推理时泄露真实用户的姓名、地址、银行账号等敏感数据。AWS机器学习团队近期发布了一套模型无关的PII检测方案,核心思路是将检测逻辑完全写入提示词,而非硬编码进模型权重。该检测器通过统一的推理接口对接Amazon Bedrock上的任意托管模型,也支持用户自行部署的开源模型。当需要识别新的实体类型时,只需修改提示词中的实体定义,无需重新标注数据或重新训练模型。该方案已在五个公开PII语料库上与包括OpenAI PrivacyFilter在内的九款LLM检测器进行了逐跨度对比评测,综合表现优于所有对比工具,相关代码以pii-detector包形式开源发布。

PII检测的核心难点在于,敏感信息很少以整齐的表单字段形式出现。它藏匿于客服对话记录、人力资源档案、聊天日志以及团队用于微调的自定义数据集的长文本列中,并以混乱的多语言格式呈现。传统的双向词元分类模型在训练时就固定了可识别的实体类型,一旦遇到员工工号、加密钱包地址等领域特定标识符,便无能为力,扩展它们意味着重新标注和重新训练,成本高昂。

大语言模型从根本上重构了这一问题。LLM在推理时读取指令,因此检测目标、输出格式和部署后端都变成了配置项而非代码。该检测器由四个核心部件构成:定义实体模式的提示词模板、运行模型的后端适配器、将模型响应转换为精确字符偏移量的解析层,以及串联整个流程的调用序列。这种架构使得检测器与具体模型完全解耦,可以在Amazon Bedrock托管模型和用户自建GPU服务器上的开源模型之间自由切换。

提示词模板是整个系统的核心。它包含十五个实体类别,每个类别附有单行定义、禁止标记的例外情况、可选的少样本示例以及待检测的输入文本。模型被要求以JSON列表格式返回检测结果,每个对象包含实体类型和原文中的精确文本值。由于LLM无法可靠地生成字符偏移量,这一步骤被推迟到后处理阶段,通过正则表达式在源文本中定位每个检测值的具体位置。

后处理模块还专门处理了LLM常见的标签漂移问题。模型有时会输出与提示词词汇表略有出入的标签,例如将DATE写成DATES,将CONTACT_INFO写成EMAIL。系统通过形态学规则和一张精心维护的别名映射表,将这些近似标签重新归入提示词定义的标准词汇,无法映射的标签则标记为UNK。这套机制显著提升了跨模型的标签一致性,是方案在多模型评测中保持稳定表现的关键之一。

在基准测试中,该检测器在五个公开PII语料库上与九款LLM检测器进行了逐跨度对比,包括OpenAI PrivacyFilter,综合表现超越所有对比工具。该方案同样适用于无法访问外部API的安全隔离环境,只需将后端适配器替换为部署在自有基础设施上的开源模型即可。完整代码以pii-detector包形式发布于sample-llm-pii-detection代码仓库,支持开箱即用地在自有数据上运行端到端检测流程。

要点

  • 检测逻辑完全驻留在提示词中,新增或删除实体类型只需一行编辑,无需重新训练或重新部署模型
  • 统一的推理接口使检测器可无缝切换Amazon Bedrock托管模型与用户自建开源模型,支持网络隔离的安全环境
  • 后处理层通过正则表达式定位字符偏移量,并用别名映射表修正LLM的标签漂移,保障跨模型输出一致性
  • 在五个公开语料库的评测中,该方案综合表现优于包括OpenAI PrivacyFilter在内的九款LLM检测器
  • 代码已开源,可直接安装pii-detector包在自有数据上运行端到端PII检测
查看原始来源

原始标题:Model-agnostic PII detection with LLMs

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。