OpenAI给文字加了个"看不见的水印":洗不掉是假话,但最容易被冤枉的,是认真改稿的人

源自41位全网作者

10-07 19:41

10月5日,OpenAI公布了一个叫 textGrain 的文本水印方案:未来几周,欧盟地区的 ChatGPT 和 Codex,输出文字会带上一种肉眼看不见的水印。消息这两天在小红书、B站刷屏,评论区最扎心的不是"怎么洗掉",而是这条被顶到最高赞(767赞)的提问——“我熬夜自己写完论文,只让它翻了下摘要、顺了段语法,这算谁的?”

先把结论摆在最前面,后面逐条拆:这套水印能证明的是"某个模型参与写过",证明不了"整篇是AI写的",更证明不了你贡献了多少。对国内用户,它暂时没默认开;但"给AI内容打机器可读标记"这件事,已经从法案走进了产品,而且国内外监管都在动真格。真正值得提前想清楚的,不是怎么对抗检测,而是怎么不被一张检测截图冤枉。

一、时间线:这把"隐形锁"不是今天才装上的

把四件事排开看,节奏其实很密:

  • 2026年8月2日:Anthropic 宣布,从这天起发布的新 Claude 模型默认给输出文本嵌入不可见水印,生成的文件还会附加数字签名元数据,动机直接写在公告里——遵守欧盟《AI法案》第50条的透明度义务。微博

  • 签署范围:OpenAI、Anthropic、Google、Meta、Microsoft、Mistral 六家都签了欧盟《AI生成内容透明度行为守则》,机器可识别标记从图片扩展到文本只是时间问题;Google 的 Gemini 早在2024年就用 SynthID 做文本检测标记。微博

  • 2026年10月5日:OpenAI 官宣 textGrain:未来几周先在欧盟为 ChatGPT 和 Codex 的适用文字输出分批加入隐形水印,全球 API 客户可自行选择开启,默认仍是关的。小红书

  • 配套检测工具则只向审核通过的研究人员和专业机构开放,公众暂时完全用不上。

  • 中国这边:《人工智能生成合成内容标识办法》2025年9月1日已经施行,要求显式标识之外还要加隐式标识。不是纸面规定——今年4月,网信办公开通报"剪映""猫箱"App及"即梦AI"网站因未有效落实生成合成内容标识要求被约谈、责令改正、警告。新华网

所以对中国用户的现实影响是:你手里的 ChatGPT 网页版暂时不会默认带水印,Claude 新版默认带;但平台侧"AI生成要留痕"已经是合规动作,不是狼来了。OpenAI 官方账号当天的官宣帖,也把"先欧盟、API可选、检测限机构"这三层边界写得相当直白。

OpenAI给文字加了个

二、原理:水印不在字里,在"选字"这个动作里

这是整件事最反常识、也最密码学的一点。

大模型写东西,本质是一步步"抽签"选下一个词:每个位置有几个候选词,按概率抽,温度参数决定抽签有多随机。文本水印的做法(学界叫绿名单/红名单方案,Google 公开 SynthID 原理时讲的就是这套):持有一把密钥,密钥决定哪些词进"绿名单",抽签时系统轻微偏向绿名单词。偏向小到肉眼和语感都察觉不出,但一整段文字摊开,绿词占比会系统性偏离正常分布——检测器反向做一次统计检验,就能读出"这局骰子被人做过手脚"。哔哩哔哩

由此推出三个立刻能用的判断:

  1. 删零宽字符、复制到Word、换字体,统统没用。 水印不是藏在文字里的编码字符,也不是文件元数据(签名元数据是另一层,另说),它就是选词偏好本身。8月 Claude 方案公布后,网上冒出一堆"实操去水印教程",第一步基本都是删不可见字符——方向就错了。小红书

  2. 复制粘贴带得走。 标记跟着文本内容走,不跟着载体走。

  3. 钥匙在别人手里。 检测要密钥,目前只有模型厂商和它放行的机构有。普通人拿到的任何"AI检测网站/小程序",只要号称能测 Claude、ChatGPT 水印,基本可以直接判定是蹭热度或诈骗。

下图是学界对大模型文本水印方法谱系的总览:上半是人类写作时代的水印思路,下半进入LLM时代——推理期水印正是从输出采样环节(logits 上的绿红偏置)留信号,与前文机制一一对应。

OpenAI给文字加了个

三、社区最关心的三个问题,逐个给答案

Q1:多少字才测得出来?
小红书那篇1379赞的笔记翻了数篇原始论文后给过一组很直观的数:干净、一个字没改的AI文本,50 个 token 就有统计信号;被认真改写过的,要 800 个 token 才可靠,差16倍。 注意口径:这是针对学界公开的主流方案,不是对Claude/textGrain内部实现的实测——两家厂商都没公开自己的技术细节。小红书

Q2:翻译成英文再"中中翻译"洗一遍,能洗掉吗?
B站评论区里这套玩法被反复提:“随便找个本地小模型转述一遍”“中译英再译回中”。答案分两半:会显著降低检出率——OpenAI 官方也承认大幅改写、转述、翻译会削弱水印,而且没检出不等于出自人手。 "洗掉"是抬门槛,不是清零,代价是你的文章先被翻译腔洗了一遍。洗水印救不了作弊者的心虚,但会给无辜者制造"查无此印"的假清白。小红书

"信号强度"和"可读性"的此消彼长,正是绿红名单方案的开创论文用一组散点实验画开过的:检测统计量越高,文本困惑度越差,句子越干;要保住写作质量,检测就只能退到长文本的统计尾部。这也是为什么它天生是"检出难度、文章质量、洗除成本"三者的相互交换,而不是单向的监控升级。

OpenAI给文字加了个

Q3:代码和数学题呢?
这是社区公认最难的场景:水印必须在不影响正确性的前提下留信号——代码改一个字符就报错。目前两家的重点都在普通文本,相关能力官方口径都很谨慎,先别按"万物皆可溯源"理解。

四、真正该担心的不是"被查出",是"被栽赃"

把恐惧清单排个序,你会发现顺序应该是反的:

第一怕:把"风格检测器"当成"水印检测器"。 GPTZero、Turnitin 这类工具不查水印,它们靠语言习惯找"AI家族相似性",误伤人类早有案底;畅销小说被检出"60%像AI"仍能一路否认,说明这类结果离"定罪"差得远。 现在市面上大量"测测你的文章AI率",和这次的水印是两套系统,别混为一谈,更别拿它们的截图定人罪。中国新闻网

第二怕:只让AI搭了把手,被打成"AI写的"。 "自己写完只让它顺语法"的那条提问能拿到767赞,就是因为它描述的是最常见的真实用法。OpenAI 自己承认:水印不能衡量人的贡献,判断不了一篇内容里人做了多少。 “检测到AI参与"在传播里滑成"AI代笔”,只差一个截图的距离。技术科普社区总结得更直白:真正该怕的不是被洗掉,是被栽赃。小红书小红书

第三怕:伪造栽赃。 前面那篇笔记还引了苏黎世联邦理工的攻击研究:只靠查询公开 API,洗除和伪造的成功率都超过 80%,成本不到 50 美元——伪造意味着你可以把别人的人写文本"种"出一份带水印的版本。 同样注意口径:这是针对公开方案的学术攻击实验,不代表有人真能低成本栽赃你,但它说明"检测到水印"天然不能当法庭证据。小红书

最不该怕的:被它抓到。 真想批量灌水的垃圾号,换一个无水印的开源模型重写一遍就干净了。这套水印的火力覆盖范围,从头到尾都是"正常用AI的老实人"。这才是它最别扭的地方:合规成本摊在守规矩的人头上,绕开它反而只要一次转述。小红书

水印检测本质是一次统计检验:检测得分近似服从一条分布,人写的和AI写的分布尾部有重叠——误判和栽赃就发生在重叠区,这也是为什么"检测到水印"只能是线索、不能是判决书(下图为典型检测得分分布示意,出自前文引用的鲁棒性研究)。

OpenAI给文字加了个

五、分层行动清单:不同角色现在做什么

  • 内容工作者/文案:①别花钱买"付费去水印"服务,删零宽字符没用,声称能测大厂水印的检测器是假的;②重要的稿子保留从提纲到终稿的修改记录和版本时间戳——真遇到"AI率"争议,过程痕迹是你唯一能拿出的证据链;③被平台误判时,要求对方说明用的是哪套检测、阈值多少,而不是对着一个百分比申诉。

  • 硕博生/论文写作者:学校查重/查AI用的系统跟 textGrain 目前不是一回事,先别自己吓自己;但该做的功课提前做:记录文献阅读笔记、数据分析过程、AI使用的具体环节和范围,按学校要求如实声明AI辅助。10月7日那篇1365赞的《命苦硕博生该怎么办》给的方向是对的:让AI参与"分析争议、找切入点",而不是"生成一段直接贴"——“打开GPT→输入题目→生成一段文字→修改几个词→放进论文”,恰恰是风险最大的用法。小红书

  • 开发者/企业用户:API 侧 OpenAI 默认关、可自选开;Anthropic 新模型默认开。选型清单里加一项"输出是否携带机器可读标记",涉及对外内容分发时,这直接影响你欧盟业务的合规形态。

  • 普通读者:以后看到"这篇文章100%是AI写的"的鉴定截图,默认存疑——它大概率是风格检测器;水印检测的钥匙在厂商手里,公众能拿到的强结论,多半是生意。

六、接下来盯什么

  1. textGrain 是否走出欧盟、是否改为全局默认开启——这是 OpenAI 用户最直接的临界点;

  2. 检测工具会不会向平台(查重系统、内容社区、招聘方)开放授权——一旦开放,"检测到水印"的滥用才会真正规模化;

  3. 国内标识执法会不会从"平台自查"延伸到跨平台内容核验;

  4. 攻防迭代:洗除/伪造论文之后,厂商是否换更稳的方案、改写代价是否会反过来伤到"AI味"的清除。

最后说句圈层内的话:文本水印本质是密码学里的"可检测的隐蔽信号"问题——把一把钥匙藏进概率分布里。它擅长回答"这是不是某模型写的",天生回答不了"这是谁的文章"。锁越造越好,但拿锁截图定罪的冲动,才是更该检测的东西。

你用过或见过哪些"AI检测/去水印"的离谱操作?评论区聊聊,真实案例比检测器有用。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章