Anthropic 在 8 月 14 日发文详细解释了 Claude 文本水印的工作原理,并称这是为了贴合欧盟 AI Act 第 50 条对生成式 AI 文本可被机器识别做出的合规要求。Anthropic 采用的不是自研方案,而是 Google DeepMind 在 2024 年发表于 Nature 的 SynthID-Text 路线,源头还要追溯到 Scott Aaronson 2022 年在 OpenAI 任职时提出的设想 [^1]。这条水印的精妙之处在于:它不在文本里塞任何额外字符,而是改动了语言模型选词时那枚随机数的「来源」。模型原本会从伪随机数生成器里取下一个 token,水印方案则改用一把密钥加上前几个 token 去决定选词;这意味着最终生成的句子看起来和没有水印时几乎一模一样,但只要拿到密钥,就能根据词序反推「这段文字大概有百分之多少概率是 Claude 写的」。Anthropic 在内部测试以及引用 DeepMind 论文里的 Gemini 实验中都发现,水印没有显著影响回复质量或可读性。
但这种「概率签名」天生有一个结构性的软肋——它不是加密学意义上的密码,而是一道概率指纹。任何能大幅扰动词序、改写句子结构的中间步骤,都会同时擦掉那道指纹。WIRED 8 月 19 日报道,Anthropic 官宣上线不到四小时,开发者 Guillaume Meyer 就把一个开源去除工具放到了 GitHub,几天内就拿到超过 100 位贡献者和 X 上 2 万多次书签 [^2]。它的核心做法非常朴素:用另一个不带水印的大模型对 Claude 的输出做多次改写,替换同义词、重组句式,统计签名就被稀释到无法识别的程度 [^2]。开发者 Erik Hughes 用 Claude 自己花了约 15 分钟拼出一个名为「unwatermarker」的小工具,专门剥离隐形字符、混淆替换、重组段落 [^2]。牛津大学的访问学者 Leon Chlon 则演示了另一种绕过路径:把 Claude 的回复翻译成阿拉伯语这类与英语语义结构差异很大的方言,再翻回来,统计模式就被打散 [^2]。这一点 Anthropic 自己也在支持文档里承认——「重度编辑、改写或翻译过的内容,可能不再携带可被检测的水印」 [^1]。
Crypto Briefing 8 月 19 日的跟进报道里提到,多位开发者的工具已经在 GitHub 与社交平台上扩散,截至该稿发布时 Anthropic 仍未放出对应的检测 API,因此独立验证这些去除工具究竟把签名削掉了多少,仍然做不到 [^3]。换句话说,这场「军备竞赛」目前还处在攻防双方都没把底牌亮完的阶段。Overchat 的实测复盘也给出了独立印证:只要被改写后原文只剩 30% 左右,水印就开始无法识别;删除隐形 Unicode 字符只能解决「字符级伪影」,擦不掉词序里的统计信号 [^4]。
更值得注意的是欧盟规则层面的设计。AI Act 要求服务商必须让合成文本「可被机器识别」,违规处罚最高可达年营业额 3% [^2]。Anthropic 强调此次水印是「全球上线」而非仅限欧盟,原因是没有可靠的区域隔离方式 [^1]。但合规要求本身是「文本可识别」,而不是「必须能识别出是 Claude」——这把检测难题直接转嫁给了检测工具方。Anthropic 计划随后上线一个文本检测 API,让用户自己上传文本判断「有多少概率是 Claude 写的」,但目前密钥和检测器都还没发布 [^1]。这条路线是否能长期成立,取决于水印方案对轻度改写、翻译、跨模型改写的鲁棒性。从目前来看,任何「足以让读者觉得有用的改写」都能顺带擦掉水印,这是统计签名方案的天然代价,也是为什么 OpenAI 当年最终没有把 Aaronson 那套方案落地——公司担心会影响产品体验 [^2]。
所以这次事件的真正信号是:水印技术走到 SynthID 这一代,性质已经从「防伪」变成「概率标记」。它对长篇、由 Claude 主导生成的文本依然有效;对重度改写、翻译、再生成的内容几乎无能为力。监管者要的不是「绝对防伪」,而是要让「AI 生成」这件事变得可标记、可声明、可追责。Anthropic 这次的合规姿态是给行业打了个样,但样本只跑了四天,就已经看到绕过工具以开源协作的速度跟进。下一步值得关注的,是检测 API 正式上线后是否会让这场攻防出现新的平衡点,还是 SynthID 这种纯统计水印本来就要被下一代基于密文或多媒体指纹的方案替换掉。
[^1]: Anthropic 官方文章《How Claude's text watermark works》,2026-08-14,https://www.anthropic.com/news/claude-text-watermark
[^2]: WIRED《Coders Say They Already Found Workarounds to Claude's Invisible Watermarks》,2026-08-19,https://www.wired.com/story/coders-say-they-already-found-workarounds-to-claudes-invisible-watermarks/
[^3]: Crypto Briefing《Coders Find Workarounds to Anthropic's Invisible Watermarks Within Hours of Launch》,2026-08-19,https://cryptobriefing.com/anthropic-watermark-workarounds-coders/
[^4]: Overchat AI《Claude Watermark: What It Is and How to Remove It from Text》,2026-08-14,https://overchat.ai/ai-hub/claude-watermark