Claude 写稿变差:裁判是 AI,它写给 AI 看

Claude 写稿变差:裁判是 AI,它写给 AI 看

2026-09-24 21:31:07 0点赞 0收藏 0评论

用 Claude 写的稿子,最近常被人一眼认出来:句子都通顺,读起来却像在啃说明书。9 月 23 日,一位负责 Claude 微调的 Anthropic 工程师给出了解释:不是模型忘了怎么说人话,是它被训练得越来越擅长写给 AI 看。

同一家公司的同一条产品线,为什么数学和代码一路变强,写作却在往回走?答案不在模型大小上,在它被打分的方式上。看懂这一层,你也就知道该往指令里补什么。

Claude 写稿变差:裁判是 AI,它写给 AI 看

他说的其实很具体

按这位工程师的说法,Opus 4.6 是 Claude 最后一款写作表现出色的模型。之后的版本,优化重点挪到了数学和代码上。

更关键的是训练数据:新模型接受了大量面向其他 AI 模型撰写技术解释的训练。他把这称为让模型适应 LLM 的"心理",结果是它学会了写给 AI 看,而不是写给人看。这种文风有个绰号,叫 Claude 腔。

他把根源归到强化学习的奖励机制上,并称 Anthropic 在 Opus 5.5 上找到了更好的平衡。但他没把话说满:这不等于 5.5 已经超过 4.6。

为什么不止是 Claude 的事

写作退步不是一家的问题。数学、编程、推理都有现成榜单,进步多少能排出来;写作很难被这样量化。资源有限的时候,把算力投给能上榜的能力,是任何团队都会做的选择。

真正被改变的是默认读者。以前一篇文档的读者是人;现在同一份说明可能先被 Agent 调取、被另一个模型当素材用。当"机器读得顺"变成高频需求,文本自然会朝那边长。

写作这件事,缺一个自动判分器

一句话说清:训练模型得有东西给它打分,而"一篇文章写得好不好"恰恰是机器判不了的事。

拆开看,数学题能自动验对错,代码能跑起来,这类任务的奖励可以反复刷分。写作没有标准答案,只能让另一个训练出来的模型来当裁判。麻烦在于,这个裁判有自己的偏好。公开研究记录过两条:这类裁判偏爱更长的答案,也偏爱更像自己写出来的文本,两条都有专门实验测过。

放到场景里更清楚:同一段解释,人读三遍才明白,另一个模型一次就能抽出全部要点。在裁判眼里,后者是更好的输出。模型于是朝那个方向跑。它不是变差了,是靶子换了。

影响这件事的变量有三个:奖励模型用什么数据练、打分的是人还是 AI、数学和代码训练占多大比例。

两个容易看错的地方

误读一,是把它读成"模型变笨了"。这个说法有道理的地方在于体感,同一句话现在确实要读两遍。但它解释不了同时发生的另一件事:数学和代码还在涨,输出的信息密度也明显变高。变笨应该是一起掉,不会一个涨一个掉。更准确的理解是,能力没掉,是目标错位了,分数指向"机器读得快",它就把文本压成机器舒服的形状。

误读二,是觉得换个提示词就能修好。加一句"说人话",语气和长度确实会立刻收敛。可它压住的是表面:先堆信息、最后才给结论,这个顺序来自训练,一句话改不动。更准确的理解是,提示词改不了它的默认读者,你得在指令里把读者写成具体的人。

能做的事,以及它的边界

写解释类内容时,比较稳的做法是在指令里交代三件事:读者是谁(三年经验的运营,不是同行)、读完后要做什么决定、先给结论再给理由。验收也别交给 AI,用人的标准:读完能不能一句话复述。这套只对解释和沟通类文本有效,代码不必套。

这条官方解释本身也有它的立场。写作能力上不了榜单,给现象一个训练侧的原因,比承认资源没往这边投要好听。5.5 到底回来多少,还得用一段时间看。

但有一点是确定的:模型往哪走,取决于谁在打分、按什么标准打。

它没忘记怎么好好说话,只学会了说给谁听更划算。

如果这篇把"AI 为什么越写越难读"说清了一点,点个在看,顺手转发给也在用 AI 写东西的朋友;想第一时间收到推送,可以星标我⭐。

关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。

作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松