ChatGPT文本将带隐形水印:改写一遍还能查出来吗
10 月 5 日,OpenAI 宣布了一件不太显眼的事:未来几周,欧盟用户拿到的 ChatGPT 和 Codex 文本会被加上机器可识别的隐形水印,技术名字叫 textGrain。你在屏幕上什么都看不到,但检测器能认出来。
这件事的关键不是"加了个标记",而是它到底加在哪里。

水印不在文末,藏在选词里
一句话说清:它不是往文本里塞一段隐藏字符,而是让模型在挑词的时候带上一点统计上的偏好。
模型每写一个词,都是在若干近义候选里做一次选择。textGrain 会在这些选择上按一段密钥施加极小的偏移,单看一句话完全看不出差别,但一段 400 个 token 的文字累积下来,选词分布就会呈现出某种"笔迹"。检测器读的正是这段分布,判断它是否来自带水印的 OpenAI 模型。
这也解释了一个反常识的现象:水印的检出率跟文本长度、用词自由度直接挂钩。心理学这类可以换着说法写的内容,信号最容易积起来;数学推导里能替换的词本来就少,检出率会明显往下掉。
官方给出的几个数字,比新闻标题有意思
OpenAI 公布的测试结果是:200 个 token 的心理学文本,检出率约 80%;同样的内容写到 400 个 token,约 95%。
把 10% 的词换成近义词,检出率从约 92% 掉到 66%。
换掉 25% 的词,检出率只剩大约 17%。
翻译一遍、或者大改一遍,同样会削弱信号。也就是说,这个水印能回答"这段文字像不像 OpenAI 写的",回答不了"整篇是不是 AI 写的",更量不出人到底改了多少。
还有一条边界容易被忽略:检测器的结果只有"命中"和"未命中",它不会告诉你这句话是谁问的、提示词写了什么、对话里聊过什么。OpenAI 自己也承认当前的文本水印技术有明显局限,检测器可能误报,也可能漏掉真实存在的水印。
为什么只在欧盟推,还推得这么小心
原因写在公告里:为了遵守欧盟《人工智能法案》的透明度要求。
更值得琢磨的是节奏。Anthropic 两个月前就宣布给 Claude 文本加水印,而且是全球范围,当时有用户抗议,理由是"指令、上下文和决定都是我做的,AI 只是工具"。OpenAI 其实更早做过文本水印,压着没发,据报道是担心用户转头去用不加水印的竞品。所以这次的方案做得很克制:欧盟区所有套餐默认加上,全球 API 客户改成自愿开关、默认关闭,检测器先向申请的研究机构开放。
这套路径国内并不陌生。去年 9 月 1 日生效的《人工智能生成合成内容标识办法》,要求 AI 生成内容同时具备显式标识和隐式标识,隐式标识就包含元数据、数字水印这类"看不见的记号"。
两个容易想错的地方
最容易想错的一点,是以为"有了水印就能查到具体是谁发的"。这个想法有它的来由:水印听起来就是标记来源,而现实中平台也确实在用它做溯源。但从目前公布的能力看,检测器只回答是否命中,不返回账号、提示词或对话内容,源头追溯与身份识别是两件事。
另一个误解是"把话改一改,水印就删干净了"。改几个词确实没什么用,可一旦换掉四分之一的用词,检出率会掉到 17% 左右。反过来看同样成立:即使检出命中,也不能证明整段都出自 AI,误报是 OpenAI 公开承认存在的。
对普通读者和内容作者意味着什么
如果你用 API 给欧盟客户交付内容,往后可能需要在交付说明里加一句:这份输出有没有开启水印。用 ChatGPT 写稿、改稿的人暂时感受不到差别,但信号很清楚,"AI 味"这件事正在从编辑的口味,变成服务器能验证的东西。
真正需要提前想清楚的是验证方。平台、甲方、学校如果拿这类检测当证据,就会同时踩到误报和漏检两个坑,它适合当线索,不适合当判决。
水印改变的是责任的落点:从"你怎么用 AI",挪到"内容有没有来源标识"。而这个标识现在还不够牢靠,这大概也是 OpenAI 只敢在欧盟先试、不敢全球默认的原因。
你会介意自己发出去的 AI 文本被悄悄打上记号吗?如果你有更好的一招证明"这段是我自己写的",留言教教我。
作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
