# OpenAI 发布开源模型，可去除文本中的个人数据

- 来源：The Decoder：AI News（RSS）
- 作者：Maximilian Schreiner
- 发布时间：2026-04-23 21:53
- AIHOT 分数：72
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmobkh53b08j2sl1y7wce0zhb
- 原文链接：https://the-decoder.com/openai-releases-open-source-model-that-strips-personal-data-from-text

## 精选理由

OpenAI这个开源隐私过滤器能在本地自动脱敏8类个人数据，对需要清洗训练数据的团队是个实用的基建工具，不过它不保证合规，别当法律盾牌用。

## AI 摘要

OpenAI 推出开源模型 Privacy Filter，专门用于检测和编辑文本中的个人数据。该模型能自动识别敏感信息并进行处理，以帮助减少隐私泄露风险，适用于需要数据脱敏的场景。

## 正文

OpenAI 发布了“隐私过滤器”（Privacy Filter），这是一款开源的 AI 模型，可在本地运行，并在进一步处理文本之前自动删除其中的个人数据。

该模型能够检测八类数据，包括姓名、地址和密码，可处理长文档，并提供可调节的脱敏灵敏度。允许商业使用。

由于该模型无法保证符合法律要求的匿名化处理，且在处理非英文文本时存在困难，OpenAI 建议在敏感用例中进行人工审核。

OpenAI 发布了 Privacy Filter，这是一款旨在检测并删除文本中个人数据的开源模型。

据 OpenAI 称，Privacy Filter 专为那些需要在进一步处理前清洗大量文本的团队而设计，无论是用于训练自己的 AI 模型，还是与第三方共享数据。OpenAI 表示，该模型相对较小，仅有 15 亿参数，每次请求仅激活 5000 万参数，可在笔记本电脑甚至直接在浏览器中运行。该模型明确支持在本地硬件上运行，无需任何云端连接。

该模型可检测八类敏感内容：姓名、地址、电子邮件地址、电话号码、URL、日期、账号以及其他秘密信息（如密码或 API 密钥）。与传统聊天机器人不同，它不会生成新文本。相反，它会对输入内容进行一次遍历，并标记出哪些部分属于哪一类别。据 OpenAI 称，12.8 万个模型 token 的上下文窗口使其能够处理长文档而无需拆分。

用户可以调整设置，以控制模型是激进地脱敏（高召回率，更多误报）还是保守地脱敏（更少误报，但遗漏更多）。拥有自己数据集的团队还可以进一步微调该模型。

Privacy Filter 已在 GitHub 和 Hugging Face 上以 Apache 2.0 许可证发布，并允许商业使用。

敏感用例的明确限制

OpenAI 明确表示，隐私过滤器不提供任何法律意义上的匿名化或合规性保证。该模型仅旨在作为更广泛数据保护策略中的一个环节。OpenAI 自身列出了若干弱点：罕见或地域性不常见的姓名更易被遗漏，知名公众人物或组织有时会被错误编辑，且在处理非英语文本或非拉丁字母时性能会下降。

对于医疗、法律、金融或人力资源等敏感领域，OpenAI 明确建议保留人工审核环节。此外，标签类别无法在运行时更改，这意味着需要不同策略的团队必须对模型进行微调。
