未来的 Claude 模型生成的文本将包含水印。这是一种判断文本由 Claude 参与撰写的可能性的方法。我们以及其他几家主要 AI 提供商正在实施这一变更,以符合欧盟《人工智能法案》的要求。
在本文中,我们分享了一些关于我们所选水印方法如何运作、是否会影响 Claude 的输出,以及我们为何做出这一变更等问题的解答。概括如下:
- 我们采用的水印方法对 Claude 输出的质量或内容没有任何实际影响;
- 带水印与不带水印的文本之间的差异,读者无法分辨;
- 文本中不会添加任何内容,也不包含隐藏字符;
- 水印不需要额外的 token,也不会增加成本;
- 水印不携带任何身份识别信息,无法追溯到特定个人、组织或对话;
- 水印并非 Claude 独有。自 8 月 2 日起,欧盟要求服务其市场的 AI 提供商对 AI 生成的内容进行标记。其他主要模型开发商也已签署同一份《行为准则》,并将实施各自的水印方案。
什么是水印?
像 Claude 这样的大语言模型的工作原理是逐词生成。每次模型决定下一个词时,它会从一系列候选词中进行选择,最终根据前文选出最合理或最有可能的那个词。以“The weather today was cold and…”这句话为例,下一个词几乎不可能是“sugary”,但很有可能是“overcast”或“grey”。在大多数情况下,模型最终选择这两个词中的哪一个,对读者来说并不重要——无论选哪个,句子的含义大体相同。在这种情况下,选择由随机数决定。
水印技术正是利用这类低风险选择——在生成文本中会出现许多次——在 Claude 的回复中留下一种模式。这种模式对读者来说无法察觉,但任何持有编码密钥的人都能检测到。使用水印时,选择仍然是随机的,但随机性的来源不同。它不是用任意随机数生成器来挑选下一个词,而是用密钥和前面几个词来决定模型应该选哪个词。也就是说,Claude 选出的词仍然是随机的,但现在人们可以检查词序列,看它是否与 Claude 在使用密钥时做出的选择一致。如果一致,就可以给出一段文本由 Claude 生成的概率。
重要的是,这并不意味着模型现在会一直偏向于选“阴天”或“灰蒙蒙”。与无水印文本一样,可能一个句子里选“阴天”,下一句选“灰蒙蒙”,这取决于前面的词。而且水印方法并不会推动 Claude 去选一个它本来不会考虑的词(例如,它不会让 Claude 选“nubilous”这种词——这是“阴天”或“灰蒙蒙”的一个生僻同义词,Claude 在正常情况下几乎肯定不会使用)。
这对 Claude 的输出有什么影响?
水印不会影响 Claude 的输出质量。对读者来说,带水印的回复与不带水印的回复无法区分(从这个意义上说,AI 水印与纸币、其他实物以及某些数字文档上的同名水印有很大不同,后者是肉眼可见的)。
在内部测试中,我们未发现水印对 Claude 文本的内容、创意水平或可读性产生任何影响。在引入我们所采用技术的 SynthID-Text 论文中,Google DeepMind 通过将使用水印的模型部署到其 Gemini 部分流量中,并比较点赞与点踩的评分来测试这一影响。他们发现,与未加水印的模型相比,没有统计学上的显著差异。在一项受控研究中,人类评估者并排比较水印与非水印的回答,也未发现质量上的差异。
一个有用的类比是,想象你在玩像《大富翁》这样的游戏。每轮中,每位玩家根据掷骰子的结果在棋盘上随机移动若干格。假设我们不用掷骰子来获得这种随机性,而是改用一本圆周率数字的书。我们从随机选定的一个数字开始(比如小数点后第 1,012,845 位,恰好是 6),从那一刻起,每位玩家只需依次使用序列中的下一个数字作为他们的下一次“掷骰”。
无论从哪个角度看,这些移动仍然是随机的:对玩家而言——或对游戏结果而言——随机性来自圆周率还是每次掷骰子并无区别。但如果我们能在游戏结束后看到所有移动的序列(并且我们知道圆周率的值),我们就能判断出这局游戏是否可能使用了圆周率来决定移动。使用圆周率的游戏,在某种意义上就是“带水印”的。
Claude 生成的文本也是如此。水印不会改变阅读者的意义或体验,但如果你事后想检查某段文本是否可能由 Claude 生成,水印就能让你做到这一点。
你们具体使用哪种水印方法?
Claude 的文本水印是 Google DeepMind 于 2024 年在《自然》杂志论文中发布的 SynthID-Text 方法的一个版本。它属于一个可追溯至 Scott Aaronson 于 2022 年提出的方案的方法家族,所有这些方法都遵循我们上面描述的相同设计原则——水印只改变用于在词语之间进行选择的随机性来源。
水印技术的有效性存在一定局限。使用我们的密钥,只能回答“这段文字有多大概率是 Claude 部分撰写的?”这一问题。它无法确认文本是否由人类撰写,也无法判断文本是否由其他 AI 生成(即使那个 AI 也使用水印,它也会有不同的密钥;甚至可能采用完全不同的水印方法)。此外,在样本量较小的情况下,水印检测效果也不理想,因为可供选择的词汇较少,可依据的信息也就更少。随着段落篇幅增加,对 Claude 参与程度的置信度也会相应提高。
在事实性段落中,水印的应用较为稀疏,因为在不降低文本准确性的前提下,可供选择的词汇较少。例如,句子“艾萨克·牛顿最著名的著作名为《原理》……”中,下一个词是“Mathematica”至关重要(这是唯一正确的答案),因此水印无从发挥作用。校对场景也是如此。如果你给 Claude 一篇文章,要求它只修改语法和标点,其他一概不动,那么水印只能存在于为数不多的几处修改中,而这些修改可能太少,难以被检测到。
那么,Claude 校对或编辑人类文本的情况又如何呢?
水印仅适用于 Claude 自主选择的词汇。当 Claude 校对人类撰写的文本时,它返回的内容通常只经过轻度编辑;由于几乎所有词汇都出自人类之手,水印几乎(甚至完全没有)可以附着的地方。根据文本长度和 Claude 编辑程度的差异,这些修改可能不足以使 Claude 的参与被检测出来。Claude 写得越多,它需要做出的决策就越多,水印可发挥的空间也就越大。
代码的情况呢?
正如我们上文所述,AI 水印利用的是那些两种词汇选择同样合适的决策场景。在需要精确输出的情况下——即没有选择余地,如果选用其他术语就会导致事实错误或代码无法运行——水印则不会应用。
例如,一旦模型写下了“2 + 2 =”,下一个 token 就存在一个非常明确的最佳选择(如果模型是在完成加法运算,那么没有任何答案能与“4”同样好;如果它是在谈论乔治·奥威尔的《一九八四》,那么也没有任何答案能与“5”同样好)。水印的“轻推”在这里不会生效。出于同样的原因,代码——在很多情况下必须精确无误——相比其他形式的文本,通常被添加水印的程度更低。
话虽如此,在代码中某些特定词语或术语存在任意选择空间的领域,水印是可以使用的,例如代码中的注释。但顾名思义,它对实际生成的代码产生的影响微乎其微。
这对用户意味着什么?
这会让模型变慢,或者使其成本更高吗?
不会。水印对模型速度的影响微乎其微,而且由于它不会产生额外的 token,模型的提供和使用成本保持不变。
水印能被追溯到我个人或我的组织吗?
不能。水印应用于 Claude 及其输出。它不识别与个人用户相关的任何信息。水印或其密钥中没有任何内容能让任何人恢复关于用户、用户所属组织或用户与 Claude 对话的任何信息。
为什么你们要对 Claude 的输出添加水印?
我们实施水印是为了遵守欧盟《人工智能法案》。Anthropic 与多家其他主要 AI 模型提供商以及总计约 190 家签署方,于 2026 年 7 月签署了欧盟《AI 生成内容透明度行为准则》。该准则要求 AI 系统提供商使用“标记”AI 生成文本的方法。我们在发布时就在全球范围内应用水印,是因为我们目前还没有一种持久的方法来按地区限定其适用范围。不过,我们将继续评估不同的方法,并在有进展时分享更新。
其他问题
我如何检查一段文本是否由 Claude 撰写?
我们很快将提供水印检测 API。我们目前正在制定其实施细节。
那图像和其他文件呢?
当 Claude 生成受支持类型的文件(如 .png、.jpg 或 .svg)时,它会在文件元数据中附加一条内容凭证,形式为一段经过加密签名的小型备注,说明该文件由 Claude 制作或处理。这是一个名为 C2PA 的开放行业标准——相机厂商和照片编辑软件也使用同一标准来记录图像来源。任何支持 C2PA 的工具都能读取该凭证;我们也会提供自己的工具,让用户拖入文件即可查验。
这种元数据标签与水印截然不同。文件本身没有任何变化——它既不是嵌入式的,也不是隐藏式的。与文本一样,该凭证只说明 Claude 参与了文件的制作,不包含任何身份识别信息。
难道不能直接编辑文本来绕过水印吗?
在某种程度上可以。轻度编辑可能无法完全去除水印;但如果彻底重写、替换每一个词,水印就会被去除。在后一种情况下,当然,这段文本是否还能被称为 AI 生成的内容,本身就值得商榷。
水印实际上能证明什么?
水印只能确定 Claude 可能在某个环节参与了内容的生成。它无法区分“这段文字是 Claude 写的”和“这段文字是 Claude 大量编辑过的”。
水印适用于翻译内容吗?
适用。Claude 生成的翻译带有水印,因为在这种情况下,每一个词都是由 Claude 选择的。
那较旧的 Claude 模型呢?
欧盟法律为 2026 年 8 月 2 日之前发布的 Anthropic 模型设置了过渡期,我们也在努力为这些模型添加水印功能。这项工作将在未来几个月内逐步推进。
这与 Pangram 等 AI 检测软件有何不同?
AI 检测软件使用的方法不同,因为提供这些服务的公司没有我们的密钥。这些服务除其他手段外,还会审视文本中那些常出现在 AI 措辞里的细微(以及不那么细微的)“破绽”。例如,AI 模型似乎偏爱“这不是 [X],而是 [Y]”这样的句式,而且使用“quietly”一词的频率远超你的预期。捕捉这些模式与检查水印在本质上是不同的。
这是否会改变某个输出的所有权归属,或改变其法律责任主体?
不会。水印仅用于帮助检验 Claude 是否可能生成或处理了该内容。它不涉及所有权或作者身份的任何判定,也不会改变用户在我们条款下的权利。只有当 Claude 参与了内容或文件的处理时,我们才会应用水印。
脚注
- 或者,你也可以说 nubilous——这也是“晦涩”的同义词。
- 圆周率在技术上是可预测的,但从圆周率中间某处截取的一串数字,与一连串十面骰子的投掷结果并无区别。另外,暂且不论《大富翁》中的骰子点数范围是 1 到 6,而圆周率的某一位数字可以是 0 到 9;这个类比并不完美。