Claude给文字加上隐形水印,AI写作作者先看清这三个漏洞再慌

源自9位全网作者

06:36

8月12日,#不可证明的AI写作时代结束了#冲上微博热搜,写小说的、写网文的、蹲投稿的,都被震了一下。震源是Anthropic在8月11日的官宣:Claude生成的文字,今后会默认嵌入机器可读的"隐形水印"。消息传开后,有人连夜翻自己的存稿,甚至有用户开始回头怀疑,Claude输出里那些中英混杂的标点,是不是早就埋下的水印痕迹。小红书先别急着慌,也别急着买各种"去水印教程"。这水印到底罩得住谁、查得出多少、漏洞在哪,把下面三件事看完再决定慌不慌。按媒体实测的说法,复制粘贴、简单修改,都去不掉水印。36氪

到底发生了什么

官方帮助页写得很清楚:就在昨天,Anthropic更新了一则官方说明,8月2日之后发布的Claude新模型,会支持一种机器可读的内容标记,生成的文本会被嵌入水印。知乎这是Anthropic为履行欧盟AI法案第50(2)条透明度义务签下的承诺,但标记范围没有圈在欧盟,而是全球生效,覆盖Claude Platform(API)、Claude、Claude Code、Claude Cowork和Claude Tag。8月2日之前发布的旧模型有过渡期,正在陆续补上标记支持。

Claude给文字加上隐形水印,AI写作作者先看清这三个漏洞再慌

标记分两层:文本本身嵌入肉眼不可见的水印;生成的.svg、.png、.jpg这类文件,则附加带数字签名的出处元数据,走的是C2PA行业标准。官方的原话是:水印不会改变文字的意思、质量和可读性,复制粘贴时它会跟着文字走,经过一些编辑之后仍可能保留。

水印是怎么藏进文字里的

这条技术路线其实不新。文字水印从原理上看,是使用了一套近义词替代策略,用替代的概率、比例、顺序、上下文等信息做矢量比对。微博说白了,模型生成时按预设规则在选词上做偏向,信号分散在整篇文本里,没有任何单个字是水印,但统计下来就能看出"这段文字不随机"。类似的思路早已落地:Google DeepMind后来发表在Nature上的论文显示,他们拿SynthID-Text做过接近2000万次真实交互的线上实验,结果发现水印没有对回复质量产生明显影响。知乎Gemini从2024年就在用SynthID标记文本输出,所以也别想着"原封不动手打一遍"能绕过去——水印在选词里,文字不变,抄一遍还是带着标记。

Claude给文字加上隐形水印,AI写作作者先看清这三个漏洞再慌

漏洞一:这张网只罩Claude

第一个漏洞很明确:水印只存在于Claude自家的模型里。官宣没几天就有知乎作者点破,水印只在Claude上生效,ChatGPT和DeepSeek目前没有类似机制。知乎换成开源模型、本地部署模型,从源头就没有水印。微博上爱可可-爱生活的评价很直接:这张网,孔大鱼小,真正被拦住的,是那些随手粘贴、从没想过被查的人,学生、员工、投稿作者,用得坦坦荡荡但忘了申报。微博他提醒的那句更值得记住:机构用上检测工具后,最危险的错误安全感,是把"没查到水印"当成"人写的证明"。

漏洞二:反制工具来得飞快

第二个漏洞是军备竞赛的速度。Anthropic刚官宣,开源社区开发者们速度就上了一个开源工具,号称可以清理Claude、Gemini和OpenAI内容中的文字水印。小红书工具把水印分成三类处理:不可见Unicode字符可以直接清掉;C2PA这类文件元数据也能剥离,代价是丢掉来源签名;统计型水印没法"删除",只能靠大幅改写来稀释。而官方帮助文档的"局限性"部分也写得直白:文字被大幅编辑、改写、翻译,或者和其他文字混在一起,水印就可能检测不到,文本太短同样不行。注意这里的一体两面:改写到水印检测不出来,AI味基本也一起没了,这两件事本质是同一件事。

漏洞三:它能证明的事很有限

第三个漏洞最容易被误解:水印能证明的,只是"这段内容经过Claude生成或处理",不是"谁写的",更不是"内容真假"。你拿别人的作品让Claude改写,出来的文字照样带着Claude的标记,水印不分辨这些。Anthropic自己也特意强调,检测到Claude水印,只能作为这份内容可能被Claude处理过的一个信号,并不能证明整篇东西就是Claude从头到尾写的。知乎

Claude给文字加上隐形水印,AI写作作者先看清这三个漏洞再慌

也别低估信号本身的强度,相关研究给出的实验数据很直观:短至25个词的文本,检测的Z分数能从0.31拉到7.4,p值一路掉到10的负14次方量级——数字越大,越不像巧合。但检测端目前还没就位,官方口径只有"将支持用户和第三方检测,详细文档随后发布",也就是说,现在并没有公开可用的官方检测API。第三方检测器拿不到密钥之前,这枚"暗底"更多是自律工具,还不是查账手段。

谁真正该慌

对AI写作人群,分三类说。

直接复制粘贴投稿党:这张网就是为你织的。平台端的动作已经在路上,知网下架的那批"AI一作"论文改完重新上架,AI从作者名单中移除,披露声明从附录变成了正文的一部分。知乎部分985院校的教务系统本月已经开始试水,学生提交论文时后台自动扫描水印信号。侥幸的窗口在快速收窄。

AI初稿+深度改写党:真不用太慌。深度改写之后,统计水印被稀释,AI味也跟着降,未来真正让你被标记的,多半是AI味而不是水印。改动是真改,就踏实接着写。

纯手写作者:你反而是最容易被误伤的。建议养成习惯:留草稿、留修改记录、留素材笔记。将来万一需要自证"这是我写的",这些比任何解释都管用。

再补两个坑。第一,别买所谓"去AI味服务"“包过检测”,统计水印的原理决定了,能把它彻底抹掉的改写量,约等于把文章重写一遍,这钱花的是信息差。第二,别赌"现在查不到",检测能力在持续补全,今天查不到,不代表下个月还查不到。

接下来盯什么

三个观察信号。第一,Anthropic什么时候放出检测文档和API,那是水印从自律承诺变成真正可查的工具的时刻。第二,国内内容平台会不会接入同类检测与披露机制,学术圈已经先动起来了。第三,国产大模型会不会跟进水印,Gemini从2024年就用上了SynthID,这是行业方向,不是一家公司的实验。

最后说个反直觉的实验。一项发表在《判断与决策》期刊上的研究,找了1682个人读短篇小说,3篇人写的,3篇ChatGPT写的,读者觉得AI写的更有吸引力,可一旦让他们分辨哪篇是AI写的,正确率大概40%,比瞎猜还低。知乎更微妙的是,一旦被告知"这篇是人写的",评分又会往上走。

所以读者其实分不出来,他们在意的是作品本身,以及背后那份信任。水印的终点不是抓谁,而是让"AI参与"变成一件可以坦诚说明的事。对认真写字的人来说,这不一定是坏事。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章