Claude所有生成文本将嵌入隐形水印

源自14位全网作者

09:12

精选参考来源

1
Claude 宣布给文字打上隐形水印,你用 AI 写的每个字都藏不住了
2
Anthropic 宣布将给 Claude 的输出内容加上机器可读的标记,包括文本中嵌入的隐形水印,以及生成文件中附加的数字签名元数据。8 月 2 日起(也就是上周),所有新发布的 Claude 模型已经开始执行这套标记机制。这是 Anthropic 为遵守欧盟 AI 法案第 50 条签署的透明度行为准则。但执行范围不限于欧盟,全球所有使用 Claude 的地方都会生效。具体来说有两层标记。第一层是文本水印:Claude 生成文字时,会在文本中织入人眼不可见的水印,不影响阅读体验和内容质量。这个水印的特点是“跟着文字走”,你把 Claude 写的一段话复制粘贴到邮件、文档或博客里,水印依然在,一定程度的编辑修改后也可能保留。第二层是文件元数据:Claude 生成 SVG、PNG、JPG 等文件时,会附加符合 C2PA 标准的签名元数据。C2PA 是 Adobe、微软、Google 等公司共同推动的内容溯源开放协议,OpenAI 和 Google 的图像生成工具已经在用。覆盖面很广。API、Claude 官网、Claude Code、Claude Cowork、Claude Tag,所有产品线都适用。通过 AWS、Google Cloud 或 Microsoft Foundry 调用 Claude 时,文本水印同样生效,但文件元数据取决于各云平台的功能支持。在此之前,Claude 一直没有公开部署过文本水印。OpenAI 此前开发过文本水印方案,但出于各种考虑一直没上线。Anthropic 这次直接在文本层面落地水印,算是 AI 大模型厂商中走得比较靠前的一步。对于用 Claude 写东西的人来说,一个直接的影响是:你用 Claude 起草的邮件、报告、文章,里面都会携带可被机器检测的水印。Anthropic 表示正在开发配套的检测工具,未来第三方也能检测。不过限制也很实际。检测到水印只能说明内容“可能经过 Claude 处理”,不能确认 Claude 是原始作者,因为很多人用它润色、翻译、总结已有内容。反过来也一样,检测不到水印不代表内容不是 AI 写的,文本被大量改写后水印会消失,太短的文本信号不够可靠,文件经过格式转换或截图也会丢失元数据。8 月 2 日之前发布的现有 Claude 模型,Anthropic 正在补充标记功能,具体时间表还没公布。如果你基于 Claude API 构建产品,Anthropic 建议你独立评估欧盟 AI 法案第 50 条对自己的合规要求。相关文档:网页链接
全部
来源
内容由AI生成

精选参考来源

1. Claude 宣布给文字打上隐形水印,你用 AI 写的每个字都藏不住了

2. Anthropic 宣布将给 Claude 的输出内容加上机器可读的标记,包括文本中嵌入的隐形水印,以及生成文件中附加的数字签名元数据。8 月 2 日起(也就是上周),所有新发布的 Claude 模型已经开始执行这套标记机制。这是 Anthropic 为遵守欧盟 AI 法案第 50 条签署的透明度行为准则。但执行范围不限于欧盟,全球所有使用 Claude 的地方都会生效。具体来说有两层标记。第一层是文本水印:Claude 生成文字时,会在文本中织入人眼不可见的水印,不影响阅读体验和内容质量。这个水印的特点是“跟着文字走”,你把 Claude 写的一段话复制粘贴到邮件、文档或博客里,水印依然在,一定程度的编辑修改后也可能保留。第二层是文件元数据:Claude 生成 SVG、PNG、JPG 等文件时,会附加符合 C2PA 标准的签名元数据。C2PA 是 Adobe、微软、Google 等公司共同推动的内容溯源开放协议,OpenAI 和 Google 的图像生成工具已经在用。覆盖面很广。API、Claude 官网、Claude Code、Claude Cowork、Claude Tag,所有产品线都适用。通过 AWS、Google Cloud 或 Microsoft Foundry 调用 Claude 时,文本水印同样生效,但文件元数据取决于各云平台的功能支持。在此之前,Claude 一直没有公开部署过文本水印。OpenAI 此前开发过文本水印方案,但出于各种考虑一直没上线。Anthropic 这次直接在文本层面落地水印,算是 AI 大模型厂商中走得比较靠前的一步。对于用 Claude 写东西的人来说,一个直接的影响是:你用 Claude 起草的邮件、报告、文章,里面都会携带可被机器检测的水印。Anthropic 表示正在开发配套的检测工具,未来第三方也能检测。不过限制也很实际。检测到水印只能说明内容“可能经过 Claude 处理”,不能确认 Claude 是原始作者,因为很多人用它润色、翻译、总结已有内容。反过来也一样,检测不到水印不代表内容不是 AI 写的,文本被大量改写后水印会消失,太短的文本信号不够可靠,文件经过格式转换或截图也会丢失元数据。8 月 2 日之前发布的现有 Claude 模型,Anthropic 正在补充标记功能,具体时间表还没公布。如果你基于 Claude API 构建产品,Anthropic 建议你独立评估欧盟 AI 法案第 50 条对自己的合规要求。相关文档:网页链接

3. 这篇推文关于文本水印 网页链接 原理讲的很清楚。生成文本的时候,模型每要输出下一个 token,就拿前面已经生成的所有词加上一个密钥,算出一个哈希值。这个哈希值会把词表里的词随机分成两组,比方说绿组和红组。然后模型在选下一个词时,悄悄提高绿组词被选中的概率。最终输出的文本看起来完全正常,但统计上会偏向绿组词。检测的时候反过来。拿着同一个密钥,对文本里的每个词重新算一遍哈希,还原出当时的绿组和红组。如果整篇文本中绿组词的占比显著超过 50%,就判定这段文本带有水印。几个常见疑问:1. 改写能破解水印吗?大部分情况下可以。因为你一改词,前面的 token 序列变了,哈希也跟着变,绿组红组就对不上了。但也有改进方案用统计模型而不是确定性函数来生成哈希,让水印对改写有一定的适应能力。2. 水印会降低文本质量吗?理论上会,因为模型不再完全自由地选最优词,而是被约束在绿组里选。但 Google 在两万条文本的人类反馈实验中称,大多数人感知不到质量下降,因为表达同一个意思的词有很多种组合。不过在短文本或者高度确定的输出上(比如1+1=2),水印确实会失效。3. 密钥会被逆向破解吗?理论上需要指数级数量的样本才能还原绿组红组的划分,所以直接暴力破解不现实。但如果检测器公开了,攻击者可以通过不断试探来摸索出规律。工程难点第一,大模型是流式输出文本的,一个词一个词往外蹦,没法像学术方案那样等整段写完再调整。第二,如果密钥泄露,水印就废了,所以需要多组密钥轮换。第三,代码类输出不能随意换词,否则代码会出错,水印只能加在注释、变量名这类可替换的部分。如果 Anthropic 公开检测器,等于给了攻击者一个免费的练习靶,水印会被快速找到绕过策略。如果像 Google 的 SynthID 那样把检测器留在内部,更安全一些,但学术界已经有论文展示了不需要检测器也能零样本破解水印的方法。密集改写(同义词替换加句法重组)可以有效消除水印,免费的改写工具就能绕过 Google 的 SynthID。前沿实验室对此心里有数,也没指望水印能拦住刻意绕过的人。大多数普通用户不会专门去除水印,而欧盟监管方也只需要足够好就行。水印更多是一种应对欧盟监管的合规动作。推文地址:x.com/alexcdot/status/2087078010524406137

4. 【不可见的签名:Claude 正在给每一行文本打上“思想烙印”】Anthropic 正式确认在所有 Claude 生成的文本和文件中嵌入隐形水印。文字水印通过在 Transformer 预测概率时进行微小的 Token 偏移来实现统计学可读,而文件则采用 C2PA 标准嵌入元数据。这意味着无论你是通过 Web 界面还是 API 调用,生成的每一句话都携带了无法肉眼察觉的溯源证据。社区评论对此反应剧烈,认为这种道德监管式的做法是对付费用户的背叛,且强制偏移 Token 可能会导致表达质量下降。从行业深处看,这不仅是版权防御,更是 Anthropic 为未来企业级合规建立的隐形护城河。当合规审计要求强制披露内容来源时,这种签名将成为合法的入场券。但这同时也加速了核心用户向不受控的开源模型流失。如果你在乎输出的绝对拥有权和表达的纯净度,这枚隐形的标签或许就是你转投开源的最后一根稻草。

5. //@刘群MT-to-Death:很多人不理解文本水印是怎么回事。文本水印是嵌入到语言生成中的一种印记,比如可以用A/B两个同义词的时候总是选择B、可以用两种表达方式C/D的时候总是选择次高概率的D,这样文本看起来没有任何问题,但实际上是可以检测到的。由于水印是加在文本内容上的,转变成图像再用OCR扫描出文本也没有任何用处。这种水平的添加和检测都是由大模型来做的,人很难感知到。当然修改文本有可能破坏这种水印,但由于人不知道这些水印会加在那些词上,所以水印也很难全部破坏掉。

6. Anthropic宣布,新版Claude模型将在AI生成的文本中直接嵌入一种“无法察觉的水印”,这种水印“不会改变文本的含义或可读性”,即使用户复制、粘贴文本,水印也会保留,并且“经过部分编辑后仍可能存在”。“水印”不是加在文字上的,而是混在内容之中的一些特定编码字符,相当于一种高级的藏头诗。这个作法很Anthropic,非常的恶心,特别是在代码安全上,正常的公司肯定不能再用claude来写代码了。它可以植入水印,就可以植入后门,非常危险。这将导致内容的严重污染。号称Ai安全的Anthropic纯放屁一样。在技术实现上有两种方法:一、置入特殊的unicode编码,比如不可见字符插入到行间。二、token采样偏置,在生成内容时会混入一个特定词库的概率,然后在全文统计时能够扫描出来,确定这个搭配组合绝对是某个模型生成的“暗语”。Anthropic公司真是个奇葩,狂得没边了。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章