文章摘要
近期,AI模型厂商Anthropic发布FAQ解答其模型文本水印疑问。实施水印是为遵守欧盟AI法案,不影响内容质量,普通用户难分辨。其核心是替换随机数来源,让选词序列形成特定模式。该技术源于行业公开研究,有局限性,如受文本长度等影响。2026年8月起,Claude长文本将自带水印,旧版模型也会补全功能。

近期,AI模型厂商Anthropic发布了官方FAQ,针对用户关于其模型文本水印的各类疑问进行了详细解答。

  • 实施水印的核心目的是遵守欧盟AI法案,目前其他主流AI模型开发商也已签署相关行为准则,将同步推进水印功能的落地。
  • 水印机制不会对模型输出的内容质量、语义表达产生任何实际影响。
  • 普通用户无法分辨一段文本是否带有水印。
  • 水印不会在文本中添加任何显性内容,也不存在隐藏字符。
  • 水印功能不会消耗额外的令牌,也不会产生额外的使用费用。
  • 水印无法被追溯到特定的个人、组织或是具体的聊天记录。

要理解这套水印的工作逻辑,首先需要明确大语言模型的生成逻辑:模型在生成文本时会逐个选择词汇,当遇到多个语义合理的候选词时,会通过随机数决定最终选择的词汇。比如当生成到“The weather today was cold and…”时,后续词汇几乎不会是“sugary”,但“overcast”和“grey”都符合语境,此时模型的选择由随机数决定,而最终句子的语义并不会因选择不同词汇产生明显变化。

这套水印的核心思路,就是替换这类场景下的随机数来源:普通生成模式下,模型使用通用随机数发生器进行选择;而水印模式下,随机数的生成将由密钥结合前文内容驱动,成为确定性的随机序列。模型依然会在候选词汇间随机选择,单次结果看起来和普通模式没有区别,但整体选词序列会形成可验证的特定模式,只有持有对应密钥的人员才能识别该模式,从而判断文本是否由对应AI模型生成。

有一个形象的类比可以解释这套机制:假设在桌面游戏中,不再使用普通骰子,而是用圆周率π的数字串作为随机源,从固定位置开始,每位玩家轮流使用下一位数字作为掷骰点数。对玩家来说,游戏体验不会有任何变化,这些“点数”依然看起来随机,但如果有人拿到完整的游戏走子序列,同时掌握π的数值,就可以验证出这场游戏使用的是π作为随机源。

这里需要澄清两个常见的误区:第一,水印不会让模型偏向某一个特定词汇,既不会让模型更倾向于选择某一个词,也不会强制模型使用平时极少出现的生僻词,它只会在模型原本就会考虑的候选词汇范围内进行选择;第二,这套水印并非实体物品上的可见标记,普通用户无论如何都无法通过肉眼分辨文本是否带有水印。

技术来源与核心逻辑

这套文本水印技术并非Anthropic原创,Claude所使用的方案是行业公开研究的改进版本,其核心设计思路最早可以追溯到2022年的相关学术提议,后续行业团队推出了成熟的实现方案,其核心原则始终保持一致:仅修改随机数的生成来源,而不改变模型对词汇的选择逻辑。

水印的局限性

不过这套水印机制也存在不少明确的限制。首先,水印的强度和文本长度强相关:模型生成的文本越长,水印的特征越明显,越容易被检测出来;反之,如果文本留给水印的空间有限,检测难度就会大幅提升。比如篇幅较短的文本,由于候选词汇的选择场景太少,检测结果并不准确;事实性较强的段落,比如涉及明确既定事实的内容,后续词汇几乎没有选择空间,水印无法有效嵌入;代码类文本大多要求严格的语法和语义,几乎没有可供水印嵌入的灵活选择场景,只有代码注释这类措辞自由的部分例外。如果用户将自己撰写的文本交给模型仅修改语法和标点,返回的文本中大部分词汇都是用户原创的,水印的特征可能弱到无法被检测到。

此外,这套水印还存在另一个关键局限:它无法区分模型原创的文本和经过模型重度编辑的文本,只能判断“这段文本可能有模型参与生成”,既无法确认文本完全由人类撰写,也无法识别其他AI模型生成的内容,因为不同厂商的密钥和实现方案并不通用。至于绕过水印的方式:轻度的编辑无法去除水印,但如果逐词完全重写文本,虽然可以绕过检测,但此时的文本是否还能被算作“AI生成”就存在争议了。

落地计划

从2026年8月开始,所有通过Claude生成的长文本都将自带这套不可见的水印,即使是2026年8月2日之前发布的旧版本模型,也会在过渡期内逐步完成水印功能的补全。

以上内容不代表本平台立场,仅供读者参考