你用Claude写的东西,即将能被全世界查出来!
就在刚刚,Anthropic发了一篇博客,首次公开解释了Claude文本水印的技术细节。
最新一批模型已经全部内置,老模型也在适配的路上。
从此,你的助手就成了Anthropic安插的卧底。

Anthropic这篇官博很长,核心就这几条:

标记怎么藏进去的
这么说吧。
Claude写字是一个词一个词蹦的。每蹦一个词之前,先算出一堆候选词,每个带一个概率。
当好几个词概率差不多的时候,选谁都行。「阴沉的天空」和「灰蒙蒙的天空」意思一样,选哪个纯看随机数怎么掷。
水印动的就是这个随机数。
以前这个随机数没有规律,谁也预测不了。现在Anthropic用密钥算出一串有规律的数把它给替掉了。
最狠的是,Claude不会因此写出别扭的句子,也不会突然蹦出一个你没见过的生僻词。
但拿着密钥的人,可以直接从你的文字里把规律给验出来。

打个比方。
餐厅里红烧肉和糖醋排骨都68块,口味一样好,服务员推荐哪个看心情。
现在餐厅给服务员发了一本暗号本,上一桌点了鱼就推荐红烧肉,点了鸡就推荐糖醋排骨。
一周下来,两道菜卖出去的总量没什么变化。但经理翻一遍点单记录,就知道哪些推荐是按暗号本来的。

这个思路最早是Scott Aaronson 2022年还在OpenAI时提出的。谷歌DeepMind接过去做成了产品级方案SynthID-Text,2024年发在Nature上。
谷歌曾拿自家Gemini做过实测。他们给一部分真实用户悄悄开了水印,然后对比有水印和没水印的用户反馈,结果发现点赞和点踩在统计上并没有显著差异。
值得一提的是,这跟市面上Pangram之类的AI检测工具完全不同。
那些工具没有密钥,只能靠猜文风,猜错是常态。但有了水印之后,就不用猜了,直接拿验密钥就行。

这个卧底比你想的更不靠谱
Anthropic官博里有这么一句:水印只作用于Claude「选择」的词。
想想这意味着什么。
先说翻译。
你写了一篇中文文章让Claude翻成英文。每个英文词都是Claude选的,水印信号拉满。但思想和观点全是你的。

代码也有问题。
大部分位置需要精确输出,水印插不进去。但注释和变量命名有自由度,水印能嵌进去。
至于会不会产生bug,Anthropic说可以忽略不计。
但对工程师来说,「可以忽略」从来不等于「没有」。

短文本好不到哪去。
写个一两百字的邮件回复,可选择的词就那么几个,水印根本留不下什么。
纯事实更是死角。
「牛顿最著名的著作叫做Principia……」后面只能跟Mathematica,没有第二个选项。越是精确表达,水印越没有发挥空间。
到了校对,水印几乎失灵。
你写了三千字的文章丢给Claude改错别字。它改了二十来个地方,整篇文章99%是你写的。那二十个改动里,水印确实留不下多少痕迹。
但问题是,你怎么证明那99%是你自己写的?

硅谷知名科技博主Ben Thompson直接开炮:「我很庆幸自己从来没养成把校对稿直接复制粘贴的习惯。」
而且就算水印测出来了,它也回答不了一个关键问题:这段话是Claude从头写的,还是你写了初稿、Claude帮你大改的?
Anthropic自己承认,水印只能判断Claude「可能参与过」,再细就分不了了。
换句话说就是,用过Claude的人,一律得准备自证清白。

4美分擦掉一切
2026年7月的一项研究发现,这种水印的移除率,高达98.3%。
具体来说,研究者把带水印的文本丢进AI释义工具,让AI换个说法重写一遍。
其中,59篇被检出水印的文本里,跑完之后58篇的水印直接消失。
按当前定价,处理一篇千字文章大约4美分。

而且检测API一旦公开,矛盾还会进一步加深。
因为任何人都能拿它反向优化,改一个词跑一次检测,直到水印信号降到安全线以下。
密码学里管这叫「逃避预言机」。
所以Anthropic的检测API至今「即将推出」,细节「仍在确定中」。
圆珠笔不是作者
不过,就算把这些技术问题全部解决,也依然绕不开一个更根本的问题:
你不会因为用Word写文章,就把Word列为共同作者。
而Anthropic的这种水印,无异于要求一支圆珠笔宣传自己是作者。
一段文字被追溯到Claude,然后呢?
按照Anthropic官方的说法,水印不改变作品所有权,也不改变法律责任归属。

所以现实就是:你的助手留下了记号,但这个记号既证明不了你有罪,也保护不了你清白。
参考资料:
https://www.anthropic.com/news/claude-text-watermark
文章来自于微信公众号 “新智元”,作者 “新智元”