刚刚,Anthropic给Claude装了隐形卧底!全球生效

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
刚刚,Anthropic给Claude装了隐形卧底!全球生效
8752点击    2026-08-16 00:14

你用Claude写的东西,即将能被全世界查出来!


就在刚刚,Anthropic发了一篇博客,首次公开解释了Claude文本水印的技术细节。


最新一批模型已经全部内置,老模型也在适配的路上。


从此,你的助手就成了Anthropic安插的卧底。


刚刚,Anthropic给Claude装了隐形卧底!全球生效


Anthropic这篇官博很长,核心就这几条:


  • 怎么加的?在选词环节动了手脚,把随机数换成了密钥推导的数。你读不出来,但拿着密钥的人验得出来。
  • 对输出有影响吗?官方说没有。Google拿Gemini做过AB测试,用户打分没有差异。
  • 被谁逼的?欧盟AI法案要求标记AI生成内容,全球适用。
  • 有什么坑?帮你校对的时候测不出来,帮你翻译的时候全是水印。短文本和纯事实几乎无效,而且分不清是Claude写的还是Claude改的。
  • 能洗掉吗?有研究称用释义工具跑一遍就能移除98.3%的水印,成本只要4美分。
  • 检测API?Anthropic说「即将推出」,但细节至今未定。


刚刚,Anthropic给Claude装了隐形卧底!全球生效


标记怎么藏进去的


这么说吧。


Claude写字是一个词一个词蹦的。每蹦一个词之前,先算出一堆候选词,每个带一个概率。


当好几个词概率差不多的时候,选谁都行。「阴沉的天空」和「灰蒙蒙的天空」意思一样,选哪个纯看随机数怎么掷。


水印动的就是这个随机数。


以前这个随机数没有规律,谁也预测不了。现在Anthropic用密钥算出一串有规律的数把它给替掉了。


最狠的是,Claude不会因此写出别扭的句子,也不会突然蹦出一个你没见过的生僻词。


但拿着密钥的人,可以直接从你的文字里把规律给验出来。


刚刚,Anthropic给Claude装了隐形卧底!全球生效


打个比方。


餐厅里红烧肉和糖醋排骨都68块,口味一样好,服务员推荐哪个看心情。


现在餐厅给服务员发了一本暗号本,上一桌点了鱼就推荐红烧肉,点了鸡就推荐糖醋排骨。


一周下来,两道菜卖出去的总量没什么变化。但经理翻一遍点单记录,就知道哪些推荐是按暗号本来的。


刚刚,Anthropic给Claude装了隐形卧底!全球生效


这个思路最早是Scott Aaronson 2022年还在OpenAI时提出的。谷歌DeepMind接过去做成了产品级方案SynthID-Text,2024年发在Nature上。


谷歌曾拿自家Gemini做过实测。他们给一部分真实用户悄悄开了水印,然后对比有水印和没水印的用户反馈,结果发现点赞和点踩在统计上并没有显著差异。


值得一提的是,这跟市面上Pangram之类的AI检测工具完全不同。


那些工具没有密钥,只能靠猜文风,猜错是常态。但有了水印之后,就不用猜了,直接拿验密钥就行。


刚刚,Anthropic给Claude装了隐形卧底!全球生效


这个卧底比你想的更不靠谱


Anthropic官博里有这么一句:水印只作用于Claude「选择」的词。


想想这意味着什么。


先说翻译。


你写了一篇中文文章让Claude翻成英文。每个英文词都是Claude选的,水印信号拉满。但思想和观点全是你的。


刚刚,Anthropic给Claude装了隐形卧底!全球生效


代码也有问题。


大部分位置需要精确输出,水印插不进去。但注释和变量命名有自由度,水印能嵌进去。


至于会不会产生bug,Anthropic说可以忽略不计。


但对工程师来说,「可以忽略」从来不等于「没有」。


刚刚,Anthropic给Claude装了隐形卧底!全球生效


短文本好不到哪去。


写个一两百字的邮件回复,可选择的词就那么几个,水印根本留不下什么。


纯事实更是死角。


「牛顿最著名的著作叫做Principia……」后面只能跟Mathematica,没有第二个选项。越是精确表达,水印越没有发挥空间。


到了校对,水印几乎失灵。


你写了三千字的文章丢给Claude改错别字。它改了二十来个地方,整篇文章99%是你写的。那二十个改动里,水印确实留不下多少痕迹。


但问题是,你怎么证明那99%是你自己写的?


刚刚,Anthropic给Claude装了隐形卧底!全球生效


硅谷知名科技博主Ben Thompson直接开炮:「我很庆幸自己从来没养成把校对稿直接复制粘贴的习惯。」


而且就算水印测出来了,它也回答不了一个关键问题:这段话是Claude从头写的,还是你写了初稿、Claude帮你大改的?


Anthropic自己承认,水印只能判断Claude「可能参与过」,再细就分不了了。


换句话说就是,用过Claude的人,一律得准备自证清白。


刚刚,Anthropic给Claude装了隐形卧底!全球生效


4美分擦掉一切


2026年7月的一项研究发现,这种水印的移除率,高达98.3%。


具体来说,研究者把带水印的文本丢进AI释义工具,让AI换个说法重写一遍。


其中,59篇被检出水印的文本里,跑完之后58篇的水印直接消失。


按当前定价,处理一篇千字文章大约4美分。


刚刚,Anthropic给Claude装了隐形卧底!全球生效


而且检测API一旦公开,矛盾还会进一步加深。


因为任何人都能拿它反向优化,改一个词跑一次检测,直到水印信号降到安全线以下。


密码学里管这叫「逃避预言机」。


所以Anthropic的检测API至今「即将推出」,细节「仍在确定中」。


圆珠笔不是作者


不过,就算把这些技术问题全部解决,也依然绕不开一个更根本的问题:


你不会因为用Word写文章,就把Word列为共同作者。


而Anthropic的这种水印,无异于要求一支圆珠笔宣传自己是作者。


一段文字被追溯到Claude,然后呢?


按照Anthropic官方的说法,水印不改变作品所有权,也不改变法律责任归属。


刚刚,Anthropic给Claude装了隐形卧底!全球生效


所以现实就是:你的助手留下了记号,但这个记号既证明不了你有罪,也保护不了你清白。


参考资料:


https://www.anthropic.com/news/claude-text-watermark



文章来自于微信公众号 “新智元”,作者 “新智元”

关键词: AI新闻 , Anthropic , Claude , AI水印
AI转型,免费服务,就找AITNT