当前位置:
AIGC文章详情

Claude给全部文本加了隐形水印,去水印工具一周涨破15000 Star:AI内容还能被溯源吗?

源自61位全网作者

04:14

这两天发生了两件事,看起来不相关,其实是同一根藤上的瓜。

第一件:Anthropic给Claude全部文本加了隐形水印,结果不到一周就被"破解"——一款去水印工具一周时间涨了15000+ Star。知乎

第二件:配音演员的声音正被AI批量"偷走"。有网友反映,热播剧中一段药品广告和番外剧中,人物声音与配音演员马正阳的声线高度相似,涉事制作方回应称系AI生成。微博另一位配音演员史泽鲲的维权,已经拖过一百多天。微博

大洋彼岸,日本声优津田健次郎正式起诉TikTok,指控其未经授权使用生成式AI复制其声音,这是日本声优行业首例针对AI声音侵权的重大诉讼。微博

两件事指向同一个问题:当AI内容能以假乱真,我们怎么证明"这是AI做的"?Claude水印事件,就是这场攻防战目前最激烈的战场。今天把它这十天的攻防,完整捋一遍。

不是隐形字符,是"口癖"

很多人对"文本水印"的第一反应是:往文字里塞几个看不见的字符?格局小了。Claude的文本水印,采用的是Google DeepMind开发的SynthID-Text方案。知乎它的原理比藏字符高级得多:直接改变大模型的写作习惯。

大模型生成文本,本质上是在不停做选择题——很多词都能当下一词,意思差不多。水印系统就在这类"无关紧要的选择"上动手脚:用一个密钥和前面的几个词来决定选哪个词,在文本中留下一个统计模式。知乎读者完全感知不到差异,但持有同一把密钥的检测器,一扫就能通过统计检验识别出来。

打个更通俗的比方:Claude现在写每一个词,都被要求带点固定的"口癖"。在几个同样合适的候选词里,某些段落依据密钥略微偏向这一个,某些段落略微偏向那一个,检测器认的就是这个偏向。

这个算法最早由得克萨斯大学奥斯汀分校的物理学家Scott Aaronson发明,他的本职工作是研究量子计算,2022年学术休假加入OpenAI工作了两年。知乎

它的结实程度超过常识:水印强度只随改写比例的平方下降——哪怕改掉80%的内容,原本50个词就能判定的文本,750个词仍可检出。知乎所以轻度编辑、润色、复制粘贴,真的洗不掉它。

为什么是现在:欧盟罚单要来了

Claude这波的直接推手,是欧盟《人工智能法案》第50条:生成式AI必须给合成内容加机器可读标记。这项透明度义务已于2026年8月2日正式生效,违规最高罚1500万欧元,或全球年营业额的3%。知乎

这也不是拍脑袋的临时起意。早在去年6月,生成式水印就被当成了大势——世界经济论坛在天津夏季达沃斯发布《2025年十大新兴技术》,「生成式水印」位列第二。36氪

Claude给全部文本加了隐形水印,去水印工具一周涨破15000 Star:AI内容还能被溯源吗?

相关的《AI生成内容透明度行为准则》已有约190家机构签署,包括Google、Meta、Microsoft、OpenAI。知乎

Claude给全部文本加了隐形水印,去水印工具一周涨破15000 Star:AI内容还能被溯源吗?

其中Anthropic的响应最彻底:

  • 8月2日后发布的新Claude模型全部默认嵌入水印,8月11日正式官宣

  • 全产品线覆盖:网页版、API、Claude Code、Cowork,连通过AWS、Google Cloud等云平台接入也不例外

  • 生成的图片等文件,额外附带C2PA标准的数字签名元数据

  • 旧模型也会在今年12月2日前完成适配

而且这套水印全球统一施行,不分区域,用户不能关闭——Anthropic自己也承认,目前还没有一种持久可靠的方法,可以按地区限定其适用范围。知乎

反响可谓冰火两重天。据Business Insider报道,数十名用户在X上表示已取消订阅;技术人员约翰·格鲁伯批评此举"破坏写作语义";还有人指出,AI公司用盗版内容训练模型后再对输出加水印,本身存在明显的虚伪性。知乎

还有一个更现实的尴尬:哪怕文章全是你自己写的,只是丢给Claude检查一下标点,返回的内容也会被打上Claude生成的标签。知乎“检测到水印"和"Claude创作了该内容”,本来就是两回事。

十日攻防:从官宣到Star爆发

8月11日,Anthropic正式宣布:自8月2日起发布的新版Claude模型,将在生成文本中直接嵌入人眼不可见、机器可读的隐形水印。36氪接下来十天,节奏快得惊人:

  • 8月11日:官宣当天舆论炸锅,争议集中在"会不会影响质量"和"能不能洗掉"

  • 8月12日前后:开源项目remove-claude-marks悄然出现在GitHub;翻译成正文再翻回来、句式改造、同义替换这类"洗水印"攻略开始流传

  • 8月17日:该项目发布五天已冲到11000 Star,随后改名watermarks-remover

  • 8月20日:Star数突破15000

Claude给全部文本加了隐形水印,去水印工具一周涨破15000 Star:AI内容还能被溯源吗?

一个去除AI水印的开源项目,在发布五天就已在GitHub冲到11k Star,水印去除可以覆盖Claude、Gemini、OpenAI三大主流厂商的AI服务。知乎项目采用MIT协议,作者给它的定位很直接,用来检查和清理多家AI产品留下的来源标记。知乎它叫watermarks-remover,提供Agent技能和Python服务两种使用方式,支持把多家AI厂商埋进文本和文件里的水印清掉。知乎

期间还有一个流传很广的插曲:有人想让Claude把这个去水印工具作为skill安装,Claude连续拒绝,理由是付费客户不希望自己的输出被打标。最终,GLM 5.2 接手了这份工作,顺利完成了 skill 安装。很讽刺的一点是,这个去除水印的 Skill ,代码很有可能来自于 Claude 自己。知乎

真被"破解"了吗?水印的用处可能和你想的不一样

这是最容易被标题误导的部分。“破解"和"破解”,不是一回事。

第一层:改写式洗除。翻译、句式改造、同义替换,相当于论文降重。这条路Anthropic官宣时就承认了——Google介绍SynthID Text时也承认,轻度改写后信号仍可能存在;彻底重写或翻译,会明显降低检测置信度。知乎所以这不算"破解",是官方承认的边界。

第二层:工具化改写。watermarks-remover干的就是把第一层自动化,将"手动降重"变成一键操作。它降低了门槛、放大了规模,但原理并不新。而且项目作者自己也标得很清楚:没有官方检测器和密钥,就没人能诚实地保证清理结果一定过关。知乎

第三层:密码学级破解。找到水印算法本身的统计漏洞,不重写文本就能检测或精确移除。目前没有人做到。

所以更准确的说法是:水印没被打破,但洗掉它的成本被工具打下来了。

这正是水印设计者预期的局面。研究界早就把话说透了:从来没有绝对安全,防守的意义在于给攻击制造尽可能大的代价,攻防的本质是代价博弈,水印亦然。36氪

学界甚至已经在用数学证明"无损"这条路的可行性:中科大团队提出GaussianShading(CVPR2024),把加密随机化后的水印映射为与正常生成不可区分的高斯潜变量,再经扩散过程作用于整个潜空间,无需训练、即插即用、可证明性能无损。36氪

Claude给全部文本加了隐形水印,去水印工具一周涨破15000 Star:AI内容还能被溯源吗?

那水印到底有什么用?先泼三盆冷水,Anthropic自己就承认了三点局限:检测到水印,不等于Claude是原作者,用户可能只是拿它润色、翻译、做摘要;没检测到水印,也不等于内容不是AI,可能是旧模型所为,也可能被重度改写;而且水印确实可以被洗掉。知乎

更进一步,水印不携带任何个人信息,无法追溯到具体的人、组织或对话,至少官方口径如此。知乎检测密钥握在Anthropic手里,普通用户无法自证。它本质上更像一个给平台和监管准备的溯源接口,而不是交到用户手里的检测器。

那它真正防的是什么?防的是"零成本撒谎":大规模AI内容洗稿平台、深度伪造产业链,以及出事后一句否认就完事。在这些场景里,一个可追溯的技术底座,价值远大于判定单篇文章的真假。还有件更悖论的事:去水印工具越流行,越证明水印"有东西需要去除",反过来又强化了监管加码的理由。知乎

标识规则,国内早就有牙齿,也与你有关

别以为这只是欧美的事。中国的规则生效得更早:2025年9月1日起实施的《人工智能生成合成内容标识办法》,明确要求对AI生成内容进行显著标识。中国新闻网马上到9月1日,办法施行就满一年了,标识义务还在写进更具体的场景——按规定,用AI生成的人物图像或视频做直播,必须履行明确的标识义务,不得隐瞒技术属性误导消费者。中国新闻网

规则不是纸面文章。今年4月,“剪映”"猫箱"App及"即梦AI"网站,就被网信部门发现存在未有效落实人工智能生成合成内容标识规定要求等问题,国家网信办指导属地网信部门,依法对上述网站平台采取约谈、责令改正、警告、从严处理责任人等处置处罚措施。新华网再看这周盗声事件的密度,标识和溯源只会越来越紧。

顺带给"检测AI"派再泼一盆冷水:第三方AI检测工具远没有想象中靠谱。Turnitin在2023年识别AI内容的准确率曾高达98%,到2026年,却因为多次误判学生论文AI率100%,而被十余家欧美顶尖高校停用。36氪

那么这场攻防,和你到底有什么关系?说点实际的,分人:

如果你经常用AI写作。不用恐慌,至少官方口径下,水印追溯不到个人。但注意三件事:一是不少平台已要求主动声明AI生成内容,声明永远是最稳的操作;二是学术论文、求职材料、正式商务文书这类高审查场景,“被误判成AI"的风险真实存在,保留创作过程记录(大纲、草稿、修改历史)比任何辩解都可靠;三是别以为"没水印就安全”,旧模型的适配截止日是今年12月2日。

如果你需要判断内容是不是AI。有个检查顺序:先看显式标识和平台备注→图片视频查C2PA元数据签名(网上有免费验证工具)→AI检测工具只当参考,检测结果显示"像AI",并不等于就证明"是AI写的"。36氪最后才是人的经验。记住一条铁律:没有任何标记,只能证明"没找到标记",不能证明"这是人写的"。

如果你关注行业。有三个信号值得追踪:欧盟第一张第50条罚单什么时候落地;12月2日旧模型适配完成后会发生什么;以及国产大模型跟进同类方案时,水印攻防会演变成什么样。

这场攻防很久都不会有赢家。但有一件事已经确定:AI内容再也不会在"发出去就完事"的时代里了,可溯源,正在变成入场券。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章