上周 Anthropic 宣布为遵守欧盟 AI Act,给 Claude 生成的所有文本嵌入不可见水印。官宣后仅 4 小时,开发者 Guillaume Meyer 的开源去除工具就上线了。这场水印攻防战的开局速度,比大多数人预想的快得多。
4 小时,一个开源项目引爆
据 WIRED 报道,Meyer 的去水印代码在 GitHub 上病毒式传播,在 X 上被收藏超过 2 万次,吸引了 100 多名贡献者,还有更多人把这套技术直接集成进自己的项目。
有意思的是参与者的动机。Meyer 告诉 WIRED,有些人规避水印是因为压根不同意「AI 生成内容都该被标注」;他自己则说是纯粹享受技术挑战。更现实的信号是:已有自由撰稿人和社交媒体创作者主动联系 Meyer 请他帮忙处理水印——这些人靠内容吃饭,AI 标签直接影响接单。
水印是怎么被洗掉的
Anthropic 的水印基于 Google 的 SynthID 技术(2023 年起 Google 已用于自家 AI 内容):在 Claude 的选词造句中留下统计模式,人眼无法察觉,但知道怎么找的机器可以检测出来。计算机科学家 Scott Aaronson 曾在 OpenAI 提出过类似方案,但 OpenAI 始终没有部署——据他自己说,公司担心水印会吓跑客户。
Meyer 的去除思路很直接:用一个不带水印的 LLM 对 Claude 文本生成多个改写版本,换同义词、微调结构,水印赖以存在的选词分布就被打散了。其他人的方法更轻量:
- 软件工程师 Erik Hughes 用 Claude 花 15 分钟写了个工具:清除不可见字符、段落内重排句子、同义词替换;
- 牛津大学访问学者 Leon Chlon 的路子是把 Claude 的回复压缩后翻译成阿拉伯语再翻回英语——语义结构差异足够大,水印随之消失;
- Anthropic 自己也承认,重度编辑、改写或翻译后的内容可能不再带水印。
监管的尴尬之处
EU AI Act 的新规本月早些时候生效:模型提供商必须给合成内容加机器可检测的标注,违者最高罚款年营业额的 3%。规则禁止提供商「营销规避工具」——但对独立开发者的工具,没有任何法律约束。Meyer 们的项目恰好卡在这个缝隙里。
而且对抗的弹药库还在收窄:据 WIRED,已有 190 家组织(包括 OpenAI、微软、Meta)签署了欧盟透明度行为准则,新模型从 8 月起必须带水印,现有模型 12 月前完成集成。也就是说,「找一个不带水印的 LLM 来改写」这个前提,半年内可能就不成立了——除非你用本地模型。
Anthropic 对 WIRED 的回应相当克制:水印「不改变 Claude 回复的意义、质量或可读性」,并计划推出文本检测 API 让开发者自己验证。但检测工具还没发布,所以现在谁也无法严格证明各路去除方法是否真的天衣无缝。
水印战争的实质
Meyer 的担忧并非抬杠:水印只能给出「文本被 Claude 触碰过」的概率,区分不了「AI 写的」和「AI 帮忙改了两个错别字」。对一个习惯用 Claude 和 Grammarly 润色写作的人来说,一个概率性的标记可能导致雇主拒绝候选人、研究者被质疑学术不端。误报的代价由个人承担,收益归监管体系——这个不对称才是社区反弹的根源。
硅谷 sovereign AI 创业公司 Haimaker 联合创始人 Wayne Pan 把 Meyer 的工具集成进了自家平台,他的判断很直白:「我想他们是善意在做,但我不认为存在能抵御一切的水印。」
所以,真正的问题不是「水印能不能被绕过」——答案已经揭晓,是 4 小时。问题是当水印变成概率证据,谁有权拿它做决定。事件详情见 WIRED 报道原文:https://www.wired.com/story/coders-say-they-already-found-workarounds-to-claudes-invisible-watermarks/