# Claude 文本水印机制如何运作

- 来源：Anthropic：Newsroom（网页）
- 发布时间：2026-08-15 03:22
- AIHOT 分数：65
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmstc3u8j02xhro0xf5o1ouas
- 原文链接：https://www.anthropic.com/news/claude-text-watermark

## 精选理由

SynthID-Text 只改变等概率候选词的随机来源，不影响生成质量，却能用密钥校验文本与 Claude 的关联概率，为内容溯源提供了一种非侵入式检测思路。

## AI 摘要

未来 Claude 模型生成的文本将包含水印，用于判断文本由 Claude 撰写的可能性，这是 Anthropic 为遵守欧盟《AI 法案》而实施的变更。该方法基于 Google DeepMind 的 SynthID-Text 技术，对输出质量、创造力和可读性无实际影响，读者无法区分水印文本与普通文本，且不增加额外 token 或成本。

## 正文

未来的 Claude 模型生成的文本将包含水印。这是一种判断文本由 Claude 参与撰写的可能性的方法。我们以及其他几家主要 AI 提供商正在实施这一变更，以符合欧盟《人工智能法案》的要求。

在本文中，我们分享了一些关于我们所选水印方法如何运作、是否会影响 Claude 的输出，以及我们为何做出这一变更等问题的解答。概括如下：

我们采用的水印方法对 Claude 输出的质量或内容没有任何实际影响；

带水印与不带水印的文本之间的差异，读者无法分辨；

文本中不会添加任何内容，也不包含隐藏字符；

水印不需要额外的 token，也不会增加成本；

水印不携带任何身份识别信息，无法追溯到特定个人、组织或对话；

水印并非 Claude 独有。自 8 月 2 日起，欧盟要求服务其市场的 AI 提供商对 AI 生成的内容进行标记。其他主要模型开发商也已签署同一份《行为准则》，并将实施各自的水印方案。

什么是水印？

像 Claude 这样的大语言模型的工作原理是逐词生成。每次模型决定下一个词时，它会从一系列候选词中进行选择，最终根据前文选出最合理或最有可能的那个词。以“The weather today was cold and…”这句话为例，下一个词几乎不可能是“sugary”，但很有可能是“overcast”或“grey”。在大多数情况下，模型最终选择这两个词中的哪一个，对读者来说并不重要——无论选哪个，句子的含义大体相同。在这种情况下，选择由随机数决定。

水印技术正是利用这类低风险选择——在生成文本中会出现许多次——在 Claude 的回复中留下一种模式。这种模式对读者来说无法察觉，但任何持有编码密钥的人都能检测到。使用水印时，选择仍然是随机的，但随机性的来源不同。它不是用任意随机数生成器来挑选下一个词，而是用密钥和前面几个词来决定模型应该选哪个词。也就是说，Claude 选出的词仍然是随机的，但现在人们可以检查词序列，看它是否与 Claude 在使用密钥时做出的选择一致。如果一致，就可以给出一段文本由 Claude 生成的概率。

重要的是，这并不意味着模型现在会一直偏向于选“阴天”或“灰蒙蒙”。与无水印文本一样，可能一个句子里选“阴天”，下一句选“灰蒙蒙”，这取决于前面的词。而且水印方法并不会推动 Claude 去选一个它本来不会考虑的词（例如，它不会让 Claude 选“nubilous”这种词——这是“阴天”或“灰蒙蒙”的一个生僻同义词，Claude 在正常情况下几乎肯定不会使用）。

这对 Claude 的输出有什么影响？

水印不会影响 Claude 的输出质量。对读者来说，带水印的回复与不带水印的回复无法区分（从这个意义上说，AI 水印与纸币、其他实物以及某些数字文档上的同名水印有很大不同，后者是肉眼可见的）。

在内部测试中，我们未发现水印对 Claude 文本的内容、创意水平或可读性产生任何影响。在引入我们所采用技术的 SynthID-Text 论文中，Google DeepMind 通过将使用水印的模型部署到其 Gemini 部分流量中，并比较点赞与点踩的评分来测试这一影响。他们发现，与未加水印的模型相比，没有统计学上的显著差异。在一项受控研究中，人类评估者并排比较水印与非水印的回答，也未发现质量上的差异。

一个有用的类比是，想象你在玩像《大富翁》这样的游戏。每轮中，每位玩家根据掷骰子的结果在棋盘上随机移动若干格。假设我们不用掷骰子来获得这种随机性，而是改用一本圆周率数字的书。我们从随机选定的一个数字开始（比如小数点后第 1,012,845 位，恰好是 6），从那一刻起，每位玩家只需依次使用序列中的下一个数字作为他们的下一次“掷骰”。

无论从哪个角度看，这些移动仍然是随机的：对玩家而言——或对游戏结果而言——随机性来自圆周率还是每次掷骰子并无区别。但如果我们能在游戏结束后看到所有移动的序列（并且我们知道圆周率的值），我们就能判断出这局游戏是否可能使用了圆周率来决定移动。使用圆周率的游戏，在某种意义上就是“带水印”的。

Claude 生成的文本也是如此。水印不会改变阅读者的意义或体验，但如果你事后想检查某段文本是否可能由 Claude 生成，水印就能让你做到这一点。

你们具体使用哪种水印方法？

Claude 的文本水印是 Google DeepMind 于 2024 年在《自然》杂志论文中发布的 SynthID-Text 方法的一个版本。它属于一个可追溯至 Scott Aaronson 于 2022 年提出的方案的方法家族，所有这些方法都遵循我们上面描述的相同设计原则——水印只改变用于在词语之间进行选择的随机性来源。

水印技术的有效性存在一定局限。使用我们的密钥，只能回答“这段文字有多大概率是 Claude 部分撰写的？”这一问题。它无法确认文本是否由人类撰写，也无法判断文本是否由其他 AI 生成（即使那个 AI 也使用水印，它也会有不同的密钥；甚至可能采用完全不同的水印方法）。此外，在样本量较小的情况下，水印检测效果也不理想，因为可供选择的词汇较少，可依据的信息也就更少。随着段落篇幅增加，对 Claude 参与程度的置信度也会相应提高。

在事实性段落中，水印的应用较为稀疏，因为在不降低文本准确性的前提下，可供选择的词汇较少。例如，句子“艾萨克·牛顿最著名的著作名为《原理》……”中，下一个词是“Mathematica”至关重要（这是唯一正确的答案），因此水印无从发挥作用。校对场景也是如此。如果你给 Claude 一篇文章，要求它只修改语法和标点，其他一概不动，那么水印只能存在于为数不多的几处修改中，而这些修改可能太少，难以被检测到。

那么，Claude 校对或编辑人类文本的情况又如何呢？

水印仅适用于 Claude 自主选择的词汇。当 Claude 校对人类撰写的文本时，它返回的内容通常只经过轻度编辑；由于几乎所有词汇都出自人类之手，水印几乎（甚至完全没有）可以附着的地方。根据文本长度和 Claude 编辑程度的差异，这些修改可能不足以使 Claude 的参与被检测出来。Claude 写得越多，它需要做出的决策就越多，水印可发挥的空间也就越大。

代码的情况呢？

正如我们上文所述，AI 水印利用的是那些两种词汇选择同样合适的决策场景。在需要精确输出的情况下——即没有选择余地，如果选用其他术语就会导致事实错误或代码无法运行——水印则不会应用。

例如，一旦模型写下了“2 + 2 =”，下一个 token 就存在一个非常明确的最佳选择（如果模型是在完成加法运算，那么没有任何答案能与“4”同样好；如果它是在谈论乔治·奥威尔的《一九八四》，那么也没有任何答案能与“5”同样好）。水印的“轻推”在这里不会生效。出于同样的原因，代码——在很多情况下必须精确无误——相比其他形式的文本，通常被添加水印的程度更低。

话虽如此，在代码中某些特定词语或术语存在任意选择空间的领域，水印是可以使用的，例如代码中的注释。但顾名思义，它对实际生成的代码产生的影响微乎其微。

这对用户意味着什么？

这会让模型变慢，或者使其成本更高吗？

不会。水印对模型速度的影响微乎其微，而且由于它不会产生额外的 token，模型的提供和使用成本保持不变。

水印能被追溯到我个人或我的组织吗？

不能。水印应用于 Claude 及其输出。它不识别与个人用户相关的任何信息。水印或其密钥中没有任何内容能让任何人恢复关于用户、用户所属组织或用户与 Claude 对话的任何信息。

为什么你们要对 Claude 的输出添加水印？

我们实施水印是为了遵守欧盟《人工智能法案》。Anthropic 与多家其他主要 AI 模型提供商以及总计约 190 家签署方，于 2026 年 7 月签署了欧盟《AI 生成内容透明度行为准则》。该准则要求 AI 系统提供商使用“标记”AI 生成文本的方法。我们在发布时就在全球范围内应用水印，是因为我们目前还没有一种持久的方法来按地区限定其适用范围。不过，我们将继续评估不同的方法，并在有进展时分享更新。

其他问题

我如何检查一段文本是否由 Claude 撰写？

我们很快将提供水印检测 API。我们目前正在制定其实施细节。

那图像和其他文件呢？

当 Claude 生成受支持类型的文件（如 .png、.jpg 或 .svg）时，它会在文件元数据中附加一条内容凭证，形式为一段经过加密签名的小型备注，说明该文件由 Claude 制作或处理。这是一个名为 C2PA 的开放行业标准——相机厂商和照片编辑软件也使用同一标准来记录图像来源。任何支持 C2PA 的工具都能读取该凭证；我们也会提供自己的工具，让用户拖入文件即可查验。

这种元数据标签与水印截然不同。文件本身没有任何变化——它既不是嵌入式的，也不是隐藏式的。与文本一样，该凭证只说明 Claude 参与了文件的制作，不包含任何身份识别信息。

难道不能直接编辑文本来绕过水印吗？

在某种程度上可以。轻度编辑可能无法完全去除水印；但如果彻底重写、替换每一个词，水印就会被去除。在后一种情况下，当然，这段文本是否还能被称为 AI 生成的内容，本身就值得商榷。

水印实际上能证明什么？

水印只能确定 Claude 可能在某个环节参与了内容的生成。它无法区分“这段文字是 Claude 写的”和“这段文字是 Claude 大量编辑过的”。

水印适用于翻译内容吗？

适用。Claude 生成的翻译带有水印，因为在这种情况下，每一个词都是由 Claude 选择的。

那较旧的 Claude 模型呢？

欧盟法律为 2026 年 8 月 2 日之前发布的 Anthropic 模型设置了过渡期，我们也在努力为这些模型添加水印功能。这项工作将在未来几个月内逐步推进。

这与 Pangram 等 AI 检测软件有何不同？

AI 检测软件使用的方法不同，因为提供这些服务的公司没有我们的密钥。这些服务除其他手段外，还会审视文本中那些常出现在 AI 措辞里的细微（以及不那么细微的）“破绽”。例如，AI 模型似乎偏爱“这不是 [X]，而是 [Y]”这样的句式，而且使用“quietly”一词的频率远超你的预期。捕捉这些模式与检查水印在本质上是不同的。

这是否会改变某个输出的所有权归属，或改变其法律责任主体？

不会。水印仅用于帮助检验 Claude 是否可能生成或处理了该内容。它不涉及所有权或作者身份的任何判定，也不会改变用户在我们条款下的权利。只有当 Claude 参与了内容或文件的处理时，我们才会应用水印。

脚注

或者，你也可以说 nubilous——这也是“晦涩”的同义词。

圆周率在技术上是可预测的，但从圆周率中间某处截取的一串数字，与一连串十面骰子的投掷结果并无区别。另外，暂且不论《大富翁》中的骰子点数范围是 1 到 6，而圆周率的某一位数字可以是 0 到 9；这个类比并不完美。

相关内容

改进 Fable 5 的生物学安全防护措施

Mariano-Florentino (Tino) Cuéllar 将加入 Anthropic，出任首席全球事务官

调查我们网络安全评估中的三起真实世界事件
