一、攻防时间线:上线、曝光、破解、1.3万Star
8月中旬,Anthropic宣布:新发布的Claude模型会在生成的文字里嵌入隐形水印。不是挂在文件属性里的元数据,这些"墨水"直接成为文本的一部分,复制粘贴会把它带走,经过一定程度的编辑后,仍有可能保留下来。36氪消息一出,全网炸锅。
这事最直接的推手,是Anthropic签署了欧盟《AI生成内容透明度行为准则》。包括OpenAI、Google、Meta、Microsoft在内的190多家机构都在签署名单里,承诺推进AI生成内容的标记与检测。36氪落到Claude身上,这一机制适用于2026年8月2日起及之后发布的所有模型,全球统一施行;Claude API、Claude Code,乃至通过AWS、Google Cloud访问的云端客户,全覆盖。36氪
微博科技博主Tech森那句"不可证明的AI写作时代结束了"拿到两千多赞,但评论区质疑声更大,“有毛用啊,AI生成完,自己再去文档里抄写一遍不就得了”"隐形水印防君子不防小人"都获得了高赞。微博
剧情顺着质疑的方向发展得飞快:上线没几天,开源去水印项目watermarks-remover在GitHub爆火,Star数几天内从0冲到1.1万。36氪又过几天,直接突破1.38万。36氪一个帮AI内容"毁尸灭迹"的工具,撑起了当周开源社区热度的半边天。

二、这个水印,不是你以为的"隐藏字符"
很多人第一反应是:不就是往文字里塞零宽字符吗?粘到记事本里就现原形了。这次不一样,Claude的文本水印采用的是Google DeepMind开发的SynthID,属于统计型水印。36氪
大模型写字是词语接龙:每一步都在一堆候选词里按概率挑下一个。SynthID的做法,是在挑选之前,根据官方密钥悄悄微调一部分候选词被选中的概率。有个直观比喻:就像玩大富翁不再掷骰子,而是照着圆周率的小数位决定走几步——每一步看起来都随机,但只要官方手里有"那本圆周率",核对你的步数轨迹,就能认出这盘棋是谁下的。36氪
所以它没有隐藏字符,也不存在一张固定的"Claude水印词表"。36氪单独看任何一个词都没有异常,真正能被检测的,是大量选择累积之后留下的统计倾向。Anthropic的说法是:轻微编辑洗不掉,也不影响生成质量。36氪36氪
但Anthropic也白纸黑字写明了局限:检测到标记只说明内容经过Claude处理,不能证明Claude就是原作者——你拿Claude校对、翻译、做摘要,底层想法和数据可能来自人。36氪反过来,没检测到标记也不等于内容一定不是AI生成的,旧模型、重度改写、段落太短、格式转换把信息剥掉,都可能漏检。说白了,这是"处理痕迹",不是"亲子鉴定"。
三、三天后,它真的被破了
watermarks-remover就是社区交出的开源答案。这是一个MIT开源协议的项目,分三层动刀。36氪Layer A,清理隐形Unicode字符、特殊空白符、双向控制字符这类物理级痕迹,完全无损。Layer B是核心杀招:引入一个非源头模型当清洗引擎,比如本地用Ollama跑Llama3,在尽量保留原意的前提下逐句重写——水印藏在token的选择里,那我把整盘选择重新做一遍,统计信号自然作废。36氪Layer C,把图片、PDF、文档里的C2PA、EXIF、XMP元数据连根拔起。
注意,没有免费午餐。项目作者自己也承认:Layer B的重写会给文本带来一定程度的降级。36氪这正是这场攻防的核心矛盾——水印寄生在"怎么写"里,想去掉它,就必须动"怎么写"。微博上有人一句话总结:隐形水印虽强,但稍微改写或二次生成就可能失效,猫鼠游戏才刚开始。微博

四、技术圈在攻防,写作圈早就变形了
其实不等水印落地,写作链条上的人已经各自开始行动。
同人圈先动手的是人工鉴定。8月底,成御only3.0一位摊主公开发帖,怀疑摊上寄售的同人本《海岛杀人事件》AI味过浓、作者使用了AI辅助写作,帖子很快攒下1400多个赞——在靠爱发电的圈子里,"是不是AI写的"已经上升到需要公开对质的程度。微博
学术圈的暴露点更接地气。B站一条《为什么导师打开护眼模式,就知道你的论文是AI写的?》播放量115万、收藏4.5万。哔哩哔哩评论区迅速破案:很多人从AI对话界面复制时连格式一起带过去,白底、下拉箭头这些痕迹就是铁证;解决办法免费——“仅粘贴文本”,或者先过一遍记事本。最高赞的调侃更扎心:“初稿AI率很低,老师改完之后AI率飙升。”
还有人反向操作"装人"。已经有人做出名叫Error-Prone的Skill,专门让AI写得差一点:塞错别字、漏标点、句子不那么规整,免得内容干净得一眼AI。36氪知乎"如何去除AI写作里的AI味儿"的高浏览回答说得直白:除AI味就像治狐臭,只能淡化,没法根除,写得越整齐越有条理,反而越容易被判定是AI。知乎以前人们用工具纠错,现在为了证明自己是人,开始让AI帮忙犯错。
另外两条反向消息值得放在一起看。美国维拉诺瓦大学的新研究发现,人们其实普遍更喜欢AI写的故事,认为质量更高、更有吸引力——尤其当故事被谎称是人类写的时候,评价更高。微博另一边,《纽约时报》专栏作家Bret Stephens写下近乎恳求的专栏,题目就是《我求你一件事:永远不要用AI写作》。微博读者的身体很诚实,写作者的立场很决绝,AI写作的价值判断,至今没有共识。
五、三类人怎么办,以及避坑清单
对用Claude做内容生产的自媒体和创作者(这次受影响最直接的人群),三个判断:
第一,先别慌。水印机制目前适用于2026年8月2日及之后发布的模型,存量模型如何补加还在研究中,官方检测工具也还在开发、没有发布。36氪眼下没有人能拿着一纸水印鉴定当众处刑你。
第二,别花冤枉钱。去水印这件事在GitHub上是免费的开源项目,核心原理一句话:换一个模型把原文洗一遍。36氪任何按次收费的"去水印""降AI率"服务,卖的都是你自己就能免费做到的事,纯智商税。
第三,认清成本。洗掉统计水印的代价是重写,重写就会动到你的表达。36氪如果文本质量本身重要,为去水印把稿子洗降级,属于买椟还珠。
对学生党:眼下最容易被抓的不是水印,是格式残留和写作习惯。学会"仅粘贴文本",把时间花在真改稿上,比花钱买降AI率服务实在得多。哔哩哔哩
对想鉴别AI的普通读者:不必为一次检测付几十块,那些给出"AI率百分比"却说不清依据的工具,数字看看就好。36氪
接下来值得持续盯的信号:Anthropic官方检测工具的发布时间、欧盟行为准则的执行细则;国内侧,《人工智能生成合成内容标识办法》去年9月1日已施行,AI内容要带"身份证",抖音、小红书、B站都已支持主动标注,但核验能力还在补课。36氪

六、终局不是藏,而是明牌
把时间线拉长看:从凭感觉猜"这段像不像AI",到统计水印、去水印工具、民间鉴定、制度标注,文字的真假之争正在从玄学走向工程。水印会被绕过,但"AI内容需要被标记"这个方向,已经被欧盟、中国的监管和190多家公司的签字钉死了。36氪
对认真写东西的人来说,这反而是好事:当机器内容有了标记,人的内容才重新有了价格。