模型 / 官方
如何在不影响质量的前提下标记 AI 生成内容
Anthropic 宣布未来版本的 Claude 将在生成文本中嵌入水印,以符合欧盟 AI 法案自 2026 年 8 月 2 日起生效的强制要求。该水印方案基于 Google DeepMind 于 2024 年在《自然》期刊发表的 SynthID-Text 技术,核心原理是在模型选词时将随机数来源从任意随机数生成器替换为由密钥驱动的确定性序列,从而在文本中留下可检测的统计模式。整个过程不添加任何隐藏字符,不增加 token 消耗,不携带用户身份信息,读者也无法凭肉眼区分水印文本与普通文本。Anthropic 内部测试及 Google DeepMind 的对照实验均显示,水印对输出质量、创意水平和可读性无统计显著影响。该水印只能回答「此文本由 Claude 生成的可能性有多大」,无法识别其他 AI 模型的输出,且在短文本或高度事实性段落中检测效果有限。
Anthropic 宣布,未来的 Claude 模型将在生成文本中嵌入不可见水印。这一变化源于欧盟 AI 法案的合规要求——自 2026 年 8 月 2 日起,向欧盟市场提供服务的 AI 提供商必须对 AI 生成内容进行标记。包括 Anthropic 在内的多家主要模型开发商已签署同一行为准则,并将各自实施水印方案。Anthropic 强调,此次变化不会对 Claude 的输出质量、内容或用户体验产生任何实质影响。
从技术原理来看,大型语言模型每次生成文本时都需要从候选词列表中选出下一个词。在语义相近的候选词之间(例如「阴天」与「灰蒙蒙」),选择结果通常由随机数决定。水印技术的核心就在于此:将这个随机数的来源从任意随机数生成器替换为由密钥和前文词语共同驱动的确定性序列。这样一来,词语的选择仍然表现为随机,但持有密钥的人可以事后验证文本中的词序是否与该密钥的选择模式一致,从而推断出 Claude 参与写作的概率。
Anthropic 用一个直观的类比来解释这一机制:想象玩大富翁游戏时,用圆周率 π 的数字序列代替骰子来决定每步移动的格数。对玩家而言,游戏体验和结果与掷骰子毫无区别;但如果事后知道使用了 π,就可以通过验证移动序列来判断这局游戏是否「用了 π」。Claude 的水印原理与此相同——读者感知不到任何差异,但验证者可以通过密钥检测文本是否由 Claude 生成。
Claude 采用的具体方案是 SynthID-Text,该技术由 Google DeepMind 于 2024 年发表于《自然》期刊,其思路可追溯至 Scott Aaronson 于 2022 年提出的早期框架。在质量验证方面,Google DeepMind 曾将水印模型部署于部分 Gemini 流量并对比用户好评率,结果显示与未加水印模型无统计显著差异;人工评估员在并排对比中同样未能区分两者的质量高低。Anthropic 内部测试也得出了一致结论。
水印技术存在若干固有局限性,Anthropic 对此保持透明。首先,水印只能回答「该文本由 Claude 生成的可能性」,无法判断文本是否由人类撰写,也无法识别其他 AI 模型的输出——不同提供商使用不同密钥,甚至不同的水印方法。其次,短文本中可供检测的词语选择点较少,置信度较低;随着文本长度增加,检测准确性才会提升。此外,高度事实性的段落(如专有名词、唯一正确答案的填空)几乎没有可供水印作用的选词空间,水印密度因此较低。
值得关注的是,该水印方案在隐私保护方面做了明确设计:水印不携带任何可识别信息,无法追溯到特定用户、组织或对话记录。同时,水印不会推动 Claude 选择它通常不会使用的生僻词汇,也不会对某类词语产生系统性偏好。Anthropic 表示,这一机制是行业层面应对 AI 内容溯源挑战的重要探索,但也坦承水印并非万能——它是概率性工具,而非确定性证明。
要点
- Claude 水印通过替换选词时的随机数来源实现,不添加隐藏字符,不增加 token 成本,读者无法感知任何差异。
- 该方案基于 Google DeepMind 的 SynthID-Text 技术,内部测试及第三方对照实验均显示对输出质量无统计显著影响。
- 水印不携带用户身份信息,无法追溯到特定个人、组织或对话,隐私安全有保障。
- 水印检测存在局限:仅能给出概率性判断,对短文本和高度事实性段落效果有限,且无法识别其他 AI 模型的输出。
- 此举源于欧盟 AI 法案的强制要求,多家主要 AI 提供商已签署同一行为准则并将各自实施水印方案。
原始标题:How Claude's text watermarking works
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。