Anthropic 8 月 14 日发布的官方博客《How Claude's text watermarking works》确认,未来 Claude 模型生成的文本将携带基于 SynthID-Text 思路的不可见水印,目的只有一个:在事后判断一段文本有多大可能是 Claude 参与的产物。这是为了满足欧盟 AI Act 第 50 条对 AI 生成内容透明度的要求,也是 2026 年 7 月 Anthropic 与约 190 家机构共同签署《AI 生成内容透明度实践守则》之后的落地动作。
水印到底加在哪
Anthropic 用的是 Google DeepMind 在 2024 年 Nature 论文(SynthID-Text)里提出的方法,思路最早可以追溯到 Scott Aaronson 2022 年的提案。这一类水印的设计原则只有一条:不改变模型选择 token 的语义,只改变它的随机源。
具体一点说,大模型在生成下一个词时,通常在多个语义等价的候选里随机挑一个。水印的做法是用一个密钥加前几个 token,代替原来的随机数,来决定从哪个候选里选。结果是:对读者来说,watermarked 与 unwatermarked 文本完全不可区分(没有隐藏字符、没有可见标记);但拿着密钥的人可以回过头来检测序列是否与 Claude 的选择一致,从而给出"这段文本多大可能是 Claude 写"的概率判断。
对用户体验有什么影响
Anthropic 在文章里把这件事说得很明确:
- 输出质量、可读性、创意水平,内部测试看不到统计显著的差异;
- 没有多余 token,模型推理速度与价格不变;
- 密钥不携带任何用户身份信息,不能反推到某个人、某个组织或某次会话;
- 用户从 Claude 复制粘贴出去的文本仍然带水印;
- 轻度编辑不会把水印洗掉,但全词替换的彻底改写可以让水印消失——此时这段文本本来也不再像是"AI 生成的"。
不同场景下,水印强度不一样
水印的有效性高度依赖于"低风险选择"的密度。Anthropic 自己在文章里举了几个例子:
- 校对场景。如果用户拿一段人写好的文本让 Claude 只改语法和标点,Claude 自己选的词非常少,水印几乎没有附着点,检测可信度会下降。
- 事实性强的句子。"Isaac Newton 最著名的著作是《Principia》"这种句子,下一个词几乎没有选择空间,水印就不起作用。
- 代码场景。代码在大量位置必须精确,水印密度天然低于自然语言;但在注释里仍有空间。
- 翻译场景。整段都是 Claude 选词,水印强度反而最高。
这意味着同一份内容的水印可检测性,会随内容类型大幅波动。Anthropic 提示:文本越长、可信度越高;对短文、纯校对、固定表达,不要指望水印给出结论。
图片与文件走 C2PA,不嵌水印
文件类输出(包括 .png、.jpg、.svg 等)Anthropic 不嵌水印,而是用 C2PA(Content Credentials)——这是相机厂商和图像编辑软件已经在用的开放标准,在文件 metadata 里加一个密码学签名的"小纸条",任何 C2PA 兼容工具都能读出来。文件本身一个 byte 都不动。
和文本水印一样,C2PA 也只声明"Claude 参与了",不带任何用户或会话信息。两者合起来,Anthropic 给出了一套"文本用 SynthID,文件用 C2PA"的双轨方案。
监管推动,但全球上线
EU AI Act 的强制要求是 2026 年 8 月 2 日之后在欧盟市场上线的新模型必须满足。Anthropic 在文章里坦白说,因为目前没有可靠的方式按地域区分,所以一上线就是全球用户都生效,而不是只对欧洲用户生效。文章承诺会持续评估不同方案,有进展会公开。
过渡期方面,8 月 2 日之前已经发布的旧 Claude 模型也将在未来几个月内陆续加上水印。这意味着从现在起,任何 Claude 输出的文本,从聊天复制到邮件、报告、博客,在原作者不在意的情况下,都可能被第三方用 Anthropic 的检测 API 算出"是否 Claude 参与"的概率。
还有几个开放问题
Anthropic 在文末提到了几个仍未完全解答的问题:
- 水印检测 API 还没上线,只说"很快"会推出。这意味着现在还没有公开工具能让用户自查自己的文本"是不是 Claude 写的"。
- 翻译场景、混合人机写作场景下,水印强度如何,文章没有给量化数据。
- 编辑、裁剪、跨语言重写后的水印鲁棒性,文章只说"部分有效",没有给具体数字。
- 与 AI 检测软件(如 Pangram)的关系。两者方法不同——水印用密钥,检测软件靠统计模式。Anthropic 明确说这是两种不同的信号,不能用检测软件的结果来"反推"水印。
所以呢
把这件事放在更大的图景里:SynthID-Text 不再是 Google 的独门技术。从 2026 年 5 月 Chrome 内置 SynthID + C2PA、OpenAI 与 NVIDIA 接入 SynthID,到这次 Anthropic 把文本水印写成产品功能,整个行业正在从"能不能标"过渡到"全行业都标"。对普通用户来说,这意味着 AI 生成的文本在可预期的几个月内会普遍带上"行业一致"的可验证指纹,事后追溯会比以前容易得多;对编辑、出版、教育、招聘这类下游环节,这才是真正的可执行信号——比依赖 Pangram、GPTZero 这类基于风格统计的检测可靠得多。
参考资料:Anthropic 官方博客《How Claude's text watermarking works》(https://www.anthropic.com/news/claude-text-watermark);Solidot 8 月 11 日转载(https://www.solidot.org/story?sid=85063);EU Code of Practice on Transparency of AI-Generated Content 签署名单(https://digital-strategy.ec.europa.eu/en/news/strong-backing-code-practice-transparency-ai-generated-content);SynthID-Text 原论文 Nature 2024(https://www.nature.com/articles/s41586-024-08025-4)。