OpenAI 发布开源模型,可去除文本中的个人数据

The Decoder:AI News(RSS)·2026-04-23 21:53·128天前·Maximilian Schreiner
AI 导读

OpenAI 推出开源模型 Privacy Filter,专门用于检测和编辑文本中的个人数据。该模型能自动识别敏感信息并进行处理,以帮助减少隐私泄露风险,适用于需要数据脱敏的场景。

The Decoder:AI News(RSS)
精选
72AI 编辑部评分,满分 100

OpenAI 发布开源模型,可去除文本中的个人数据

2026-04-23 21:53· 128天前· Maximilian Schreiner
AI 导读

OpenAI 推出开源模型 Privacy Filter,专门用于检测和编辑文本中的个人数据。该模型能自动识别敏感信息并进行处理,以帮助减少隐私泄露风险,适用于需要数据脱敏的场景。

推荐理由

OpenAI这个开源隐私过滤器能在本地自动脱敏8类个人数据,对需要清洗训练数据的团队是个实用的基建工具,不过它不保证合规,别当法律盾牌用。

正文 · AI 翻译

OpenAI 发布了“隐私过滤器”(Privacy Filter),这是一款开源的 AI 模型,可在本地运行,并在进一步处理文本之前自动删除其中的个人数据。

该模型能够检测八类数据,包括姓名、地址和密码,可处理长文档,并提供可调节的脱敏灵敏度。允许商业使用。

由于该模型无法保证符合法律要求的匿名化处理,且在处理非英文文本时存在困难,OpenAI 建议在敏感用例中进行人工审核。

OpenAI 发布了 Privacy Filter,这是一款旨在检测并删除文本中个人数据的开源模型。

据 OpenAI 称,Privacy Filter 专为那些需要在进一步处理前清洗大量文本的团队而设计,无论是用于训练自己的 AI 模型,还是与第三方共享数据。OpenAI 表示,该模型相对较小,仅有 15 亿参数,每次请求仅激活 5000 万参数,可在笔记本电脑甚至直接在浏览器中运行。该模型明确支持在本地硬件上运行,无需任何云端连接。

该模型可检测八类敏感内容:姓名、地址、电子邮件地址、电话号码、URL、日期、账号以及其他秘密信息(如密码或 API 密钥)。与传统聊天机器人不同,它不会生成新文本。相反,它会对输入内容进行一次遍历,并标记出哪些部分属于哪一类别。据 OpenAI 称,12.8 万个模型 token 的上下文窗口使其能够处理长文档而无需拆分。

用户可以调整设置,以控制模型是激进地脱敏(高召回率,更多误报)还是保守地脱敏(更少误报,但遗漏更多)。拥有自己数据集的团队还可以进一步微调该模型。

Privacy Filter 已在 GitHub 和 Hugging Face 上以 Apache 2.0 许可证发布,并允许商业使用。

敏感用例的明确限制

OpenAI 明确表示,隐私过滤器不提供任何法律意义上的匿名化或合规性保证。该模型仅旨在作为更广泛数据保护策略中的一个环节。OpenAI 自身列出了若干弱点:罕见或地域性不常见的姓名更易被遗漏,知名公众人物或组织有时会被错误编辑,且在处理非英语文本或非拉丁字母时性能会下降。

对于医疗、法律、金融或人力资源等敏感领域,OpenAI 明确建议保留人工审核环节。此外,标签类别无法在运行时更改,这意味着需要不同策略的团队必须对模型进行微调。

来源:The Decoder:AI News(RSS)· the-decoder.com