当前位置:
AIGC文章详情

Claude正式给文字加水印,"AI文案会被限流"的恐慌又爆了:核对完水印实验数据和几十篇限流亲历帖,我发现真被限的不是AI

源自37位全网作者

06:54

这两周,用AI写文案的圈子集体失眠了一次。

8月10日前后,Anthropic正式宣布:8月2日之后发布的新Claude模型,生成的所有文本都会默认嵌入一种"不可见水印",更早发布的旧模型也会逐步补上这套标记。微博消息传到国内创作圈,第一反应几乎都是同一个问题——我以后用AI写文案,是不是要被平台一眼识破,然后限流?

小红书上"AI限流"的帖子本周密集涌现:有晒后台数据说发文就被卡几十阅读的,有卖"AI限流检查工具"的,还有图文代做服务商打出"比纯AI稿少90%限流风险"的广告。小红书恐慌已经变成了一门生意。

我花了两轮时间,把水印技术的公开实验数据、国内平台的规则时间线、知乎和小红书上几十篇限流亲历帖全部核对了一遍。结论可能和你想的不一样:真正被平台盯上的,从来不是"用了AI"这件事本身。

先搞清楚,这个水印到底是什么

很多传言说水印是"藏在文字里的零宽字符"“复制粘贴到记事本再粘回来就能洗掉”。这些全是错的。

按Anthropic的官方技术说明和多家媒体的核对,Claude用的是Google DeepMind发表在《Nature》上的SynthID-Text方案:模型每次选下一个词的时候,按一套带密钥的算法微调候选词的概率分布。水印不在字符里,而在"每次选了哪个词、没选哪个词"的统计规律里。所以你复制粘贴甩不掉它,轻度编辑也抹不掉,默认开启、关不掉。微博

Claude正式给文字加水印,

一个背景值得知道:Anthropic自己说这不是自愿的,主要是为了应对欧盟AI法案的合规要求。微博知乎上有帖子提到,消息出来后有用户直接退订抗议。知乎

听起来很绝望?别急,接下来这组数据才是重点。

实验数据给恐慌泼了第一盆冷水

水印听着吓人,但它的实战强度远没有传言里那么神。36氪8月中旬一篇梳理文章里引用了两组第三方实验数据,我认为是目前公开信息里最有参考价值的:

第一个是2025年的WaterPark基准测试,系统评估了10种水印方案、12种攻击类型。结果:SynthID在完全没动过的原始文本上,检出率高达99.8%;但只要经过中等程度的改写,检出率直接掉到49.8%;只要过一轮AI改写工具,所有被测方案的检出率全部跌破30%。36氪

第二个更狠:今年7月一项实验研究,对包括SynthID在内的3种主流方案做了846次改写攻击测试,SynthID的水印移除率超过98%,另外两种被100%移除。36氪

更值得注意的是误报问题:SynthID在人类写的文本上会产生5.4%的误报率。知乎和微博上都有真实案例——作者自己写的初稿,只是把几段资料交给Claude翻译、润色了一下,结果整篇被检测出"Claude水印"。连Anthropic自己都警告过:检测器提示"这段内容经过Claude处理",不能推断出"这篇文章的思想来自AI"。

所以36氪那篇文章里有个判断我相当认同:生成级水印真正打击的,是把AI输出原样复制粘贴、批量自动化发布的黑产和矩阵号;而那些认真修改润色AI初稿的人,反而不太容易被检测到。36氪换句话说,如果你用AI的姿势是"让它出草稿、我来判断和改",水印这事对你的实际威胁,远小于你的心理威胁。

国内平台限流你的,根本不是"检测到AI"

再来看国内。很多人的认知是"平台有个开关,检测到AI就限流"。核对完规则和案例后,我可以负责任地说:不存在这样一个开关。真实的机制是三层,各有各的触发条件。

Claude正式给文字加水印,

第一层:标识义务。《人工智能生成合成内容标识办法》2025年9月1日就施行了,抖音、快手、小红书、B站、微博当天同步上线AI内容标识。36氪小红书这一年动作最密:2025年6月发过整治AI技术滥用的公告,12月新规则要求AI内容必须报备,今年8月7日又升级了一次——AI主动标识的要求从"笔记"延伸到了"账号",用AI虚拟人形象运营的账号必须在资料页开标签。知乎注意,违反标识义务会挨处理,但"主动标识了"本身不是扣分项,是护身符。

Claude正式给文字加水印,

第二层:同质化检测。这是8月小红书社区讨论最集中的点。大量创作者反映收到"同质化违规"提示、笔记降权。多篇运营帖描述的方向基本一致:平台开始同时比对标题结构、正文框架、图片素材和信息增量,洗稿、换词不换意、多账号发同款都算同质化。小红书要说明的是,网传的"相似度超60%就标记""标题占30%、正文占30%"这类具体数字,都是自媒体推测,平台没公开过官方阈值,看看方向就好,别当成精确标准。

第三层:行为维度。这是最容易被忽略、也最致命的一层。知乎一位做AI内容智能体的运营者写了篇实测复盘:他搭了条全自动链路——AI选题、写稿、排版、定时发布,前两周数据正常,第三周展现量直接腰斩,新内容卡在几十个阅读就不动了,后台没有任何违规提示。他的结论是:系统不只看你写的内容,还看你发布的方式——发文频率太规律、风格太统一、模式太单一,这些"不像真人"的行为特征本身就会被标记。知乎

把三层叠起来看,真相就很清楚了:平台打击的是"无标识的AI内容+批量同质化生产+机器化运营节奏"这个组合,而不是"文案里有AI味"。

谁该慌,谁不用慌

对照上面的机制,可以直接做个分类。

三种用法是真的会出事的:

  1. AI生成后一字不改直接发,还发得多——撞水印、撞同质化、撞行为检测,三层全中;

  2. 全自动定时发布、矩阵号批量铺内容——今年4月网信办"清朗·整治AI应用乱象"专项行动之后,这类是明面上的打击对象。36氪TikTok那边今年第一季度删了8600万个虚假账号。微博

  3. 该标识不标识,还拿AI内容冒充真实体验做种草、带货——这不只是限流问题,是合规问题。

Claude正式给文字加水印,

三类人其实不用太焦虑:

  1. 用AI出初稿、自己判断和修改的——前面说了,水印和检测对这种用法基本失效,平台规则也没说要禁;

  2. 拿AI做润色、翻译、整理素材等辅助工作的——正常使用,唯一要留意的是别用可疑的"去水印服务";

  3. 老老实实做AI标识的——标识是护身符不是案底。

两样东西千万别买:

一是所谓"AI限流检查工具"。平台从来没有开放过"你这条内容有没有被限流"的数据接口,这类工具查不出任何东西,赚的就是你的恐慌钱;二是号称"包过检测""少90%限流风险"的纯AI批量代做——它交付的东西恰好就是三层机制全撞的形态,等于花钱给自己的账号埋雷。

顺带一提,GitHub上那些刚上线就拿了上万星的"水印去除工具",也别碰。知乎一方面它们游走在合规边缘,另一方面,Anthropic这次明确说过会提供检测API,去除水印和检测API之间会长期攻防,押注在这种工具上等于把账号押在别人的更新速度上。

可以直接照做的清单

如果你就是想让AI帮你写文案,又不想踩雷,这是我从亲历帖和规则里提炼出来的最小安全动作集:

  • AI负责初稿和重复劳动,四个节点必须人来把关:选题、开头结尾、核心观点、发布时间;

  • 不要定时定量发布,真人创作本来就有快有慢,别把账号运营成节拍器;

  • 同一选题只发一篇,把内容做厚,别做五个账号发同一个模板;

  • AI生成的图片、视频,该打标识就打,小红书现在查得最细;

  • 发布前自查一遍:有没有只有你才知道的细节、有没有真实数据或截图、删掉AI还没删干净——这条是老规矩,和水印没关系,但一直是能不能过审的关键。

接下来值得盯的三个信号

最后给几个可以继续观察的线索:

一是9月1日,《标识办法》施行满一年,监管节点前后平台大概率会有新一轮动作,值得留意各平台的规则公告;
二是Anthropic承诺会开放Claude水印的检测API,这个API一旦落地,既会被学校、企业拿去查,也会反过来成为"去水印"工具的校准器,攻防会明显升级;
三是国内平台的治理重心正在从"内容标识"走向"账号标识",小红书8月7日这次升级就是信号,做AI相关账号的,资料页的合规动作要提前做。

恐慌的尽头是分辨力。AI文案没有原罪,原罪是把AI当替身而不是打字员。水印时代真正被筛掉的,是那些本来就没有信息增量的内容——这对认真写字的人,反而是好消息。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章