当前位置:
AIGC文章详情

Claude Code“降智”风波第二弹:75%的砍法是谣言,但真正的坑比谣言更气人

源自219位全网作者

06:09

周末这两天,Claude Code 的用户圈又炸了。

周五晚上开始,Reddit 传回一条消息:从 CC 2.1.237 起,Anthropic 偷偷改了推理强度的数值映射,你设置的 high 档对应的数值从 40 被砍到 10——正好是以前 low 档的值。小红书B站视频标题起得更直接:“AI也摸鱼?Claude Code被曝偷偷降智,脑力一刀砍75%”。B站到周日,微博科技媒体已经用上"Anthropic滑跪认错,Claude暗中降智实锤"的说法。微博

你是不是已经在搜怎么退订了?先等等。我把这两天微博、小红书、B站、知乎的讨论都翻了一遍,把几个关键信源逐条对过,结论是:这场风波一半是谣言,另一半比谣言更值得你警惕。

一、先说实锤的部分

  1. 服务端确实动了。按小红书用户"人间漂流"装 235/236/237 三个版本的实测,Claude Code 服务端现在会往系统提示词里注入类似 `40` 的标签来控制推理强度。这个标签在 2.1.235 里完全不存在,从 2.1.236 开始出现——注意,比传言说的 237 还早一个版本。小红书

  2. 改动完全发生在服务端。对比 236 和 237 的客户端二进制,effort 相关字符串的数量一模一样(1144 对 1144、58 对 58、105 对 105)。也就是说,升降级本地客户端不改变任何事,安装包本身查不出线索。

  3. 团队确实回应了。据新智元报道(36氪授权转载),Claude Code 工程师 Thariq Shihipar 公开回应:团队有时会先在 Claude Code 里测试 API 的服务配置,再决定是否全量推送;这个实验只是改了 effort 的数值映射,“有些人会看到 Claude 说自己是 10”,但这个刻度不是 0 到 100,数字单看没有意义,你选的 effort 就是你拿到的 effort;团队评测确认这不影响模型性能。36氪另外,面对 Opus 5 的降智质疑,Thariq 承认 Opus 5 是个"表现很不稳定"的模型。

Claude Code“降智”风波第二弹:75%的砍法是谣言,但真正的坑比谣言更气人

实锤的是:改动存在、更新日志没写、事前零公告。

二、被实测推翻的部分

传言的核心主张"high 被砍到 10、脑力-75%",目前没有硬证据,最详细的实测恰恰指向反面。

"人间漂流"实测到的档位表:low=10,medium=20,high=40,xhigh=120,max 没有标签。小红书这张表直接推翻了传言的三个说法:

  • 不是百分制。xhigh=120 超过了 100,"100 分里砍到 10 分"这个框架自己就塌了;

  • 档位没有被压平。10→20→40→120 单调递增,high 仍是 low 的 4 倍;

  • 起始版本是 236,不是 237。

官方工程师的回应也和这份实测对得上:实验改的只是数值映射方式,你选的 effort 就是你拿到的 effort。36氪

但也要如实交代对立证据:小红书用户"老农 API"说,有开发者在 API 日志里亲眼看到 high effort 只写了 10/100,且 2.1.237 起 Fable 5 被塞进 A/B 实验、压缩 effort 刻度,老版本和 Opus 5 不在实验里。小红书一边实测 40,一边日志看到 10——两个观察未必矛盾:如果服务端真在做 A/B,进了实验组的用户确实可能拿到更低的值,但"所有人被一刀砍 75%"就是夸大了。你可能命中了实验组,也可能没有,这正是"有人觉得明显变笨、有人毫无感觉"的原因。

三、最魔幻的部分:有些"实锤"是模型自己说的

这次很多人判断降智的第一步,是直接在对话里问模型"你现在是什么档位"。结果发 high,模型说自己是 Low;发 xhigh,它说 Medium;发 max,它说 High——听着像实锤,其实是幻觉。

机制不复杂:模型在系统提示词里只拿到一个裸数字 40,没有任何"数字-档位"对照表。你问它什么档,它只能猜,还经常猜错。这一点连官方回应都侧面印证了——工程师 Thariq 解释"有些人会看到 Claude 说自己是 10",并强调那个数字单看没有任何意义。36氪所以那篇实测帖留下一句值得所有 AI 用户记住的话:

模型对自身配置的自述,永远不能当证据。

判断降没降智,看客观量:API 日志里的 effort 值、thinking tokens、响应 id 前缀、header 指纹,都比问模型本人靠谱。小红书

四、为什么这次群情激愤?因为有前科

谣言辟掉了,这事能翻篇吗?不能。愤怒是有理由的,因为今年已经是第二次。

按微博转述的 Anthropic 官方说明梳理的时间线:

  • 3 月 4 日,Claude Code 把默认推理强度从 high 调成 medium,当时给的理由只是"减少延迟"。微博

  • 用户骂了一个多月,4 月 7 日官方表示收到反馈;

  • 4 月 23 日官方博客承认:清空空闲会话"thinking"的 bug 导致持久上下文丢失,外加错误的默认推理设置和系统提示词改动,补偿是给全部订阅用户重置额度。道歉当天 GPT-5.5 发布,社区嘲讽"时机选得好"。<#&!53#&!>微博

Claude Code“降智”风波第二弹:75%的砍法是谣言,但真正的坑比谣言更气人

Claude Code“降智”风波第二弹:75%的砍法是谣言,但真正的坑比谣言更气人

有这个前科在,服务端再次悄悄动 effort 映射、changelog 只字不提,社区的信任崩塌是 Anthropic 自己应付的成本。真正该追问的是三件事:到底改了什么、为什么不公告、这次有没有补偿。

五、普通用户怎么办?五个自查动作比生气有用

  1. 先排除本地问题。这周知乎用户 Ward 写了篇《删了试试,AI降智秒解》:他以为所有模型都降智了,最后发现是自己攒的 CLAUDE.md/AGENTS.md 已经膨胀到 6594 行、挤占了有效上下文,瘦身到 736 行就好了。知乎骂服务端之前,先清一遍自己的配置、skill 和 MCP。

  2. 查 API 日志。看真实请求里的 effort 值和 thinking tokens,这是目前最直接的证据。

  3. 别问模型自己什么档位。这样验证出来的结果一律无效。

  4. 盯第三方监测,别靠体感。marginlab.ai/trackers/claude-code/ 每天跑一小批 SWE-Bench-Pro 子集并做统计检验,支持邮件订阅,比"感觉变笨了"可靠得多。微博

Claude Code“降智”风波第二弹:75%的砍法是谣言,但真正的坑比谣言更气人

  1. 锁版本和迁移,都等官方详细说明再决定。锁 2.1.235 只改客户端,不保证服务端不下发;赌气迁移更没必要——现有证据不支持"high 变成 low"。

最后一句想对所有为 AI 编程工具付费的人说:模型能力波动大家都有心理预期,但订阅制产品在用户付费购买的参数上悄悄做 A/B、更新日志只字不提——这才是这场风波里最被低估的消费者权益风险。这事还没完,官方补偿和第三方复测的结果,值得继续蹲。

内容由AI生成

精选参考来源

1. Claude降智传言 我装三版实测

2. AI也摸鱼?ClaudeCode被曝偷偷降智,脑力一刀砍75%

3. 【Anthropic滑跪认错,Claude暗中降智实锤】 昨天开发者发现Claude Code从2.1.237开始推理程度异常,更新日志却未说明,引发全网热议,Opus 5也被指“降智”,凸显大模型更新不透明问题。... 网页链接

4. Anthropic滑跪认错,Claude暗中降智实锤

5. Claude 暗中降智,团队认错

6. Anthropic 关于 Claude Code 「降智」的官方说明:- 3 月 4 日,Claude Code 的默认推理强度从 high 调整为 medium,目的是减少部分用户在 high 模式下遇到的过长延迟——这类延迟严重到会让 UI 界面看起来像是卡住了。Anthropic 表示,这一权衡决策是错误的。在收到用户反馈表示他们更希望默认使用更高智能水平、仅在处理简单任务时主动选择低强度模式后,其已于 4 月 7 日撤销了本次调整。Sonnet 4.6 与 Opus 4.6 两个版本均受到过本次变更的影响。- 3 月 26 日,Anthropic 上线了一项变更,用于清除闲置时长超过 1 小时的会话中 Claude 的早期思考记录,以降低用户恢复这些会话时的延迟。该变更存在一处漏洞,导致相关清理操作并非仅执行一次,而是会在会话后续的每一轮交互中重复触发,使得 Claude 表现得健忘且内容重复。Anthropic 已于 4 月 10 日修复了该问题,受影响的版本为 Sonnet 4.6 和 Opus 4.6。- 4 月 16 日,Anthropic 新增了一条旨在减少表述冗余的系统提示指令。该指令结合其他提示调整后对代码生成质量造成了负面影响,因此已于 4 月 20 日回滚。问题的影响范围包括 Sonnet 4.6、Opus 4.6 以及 Opus 4.7 版本。补偿措施:自 4 月 23 日起,Anthropic 将为所有订阅用户重置使用限额。

7. 你说这扯不扯。GPT 5.5刚发,Claude就立刻修复了降智的bug🤣三月份开始大家就明显感觉到 Claude 有点降智。尤其在一些场景里,回答质量、稳定性、连贯性都不太对。一开始我还以为是自己错觉。结果今天 OpenAI 刚发 GPT 5.5,Anthropic 就立刻发 blog,承认他们确实有问题。在Claude Code里把High模式,设置成了medium,目前已经修了问题。而且这好像还不是第一次。有网友翻出他们之前也有过类似操作。上次 OpenAI 刚发新模型没多久,Anthropic 那边也马上出来修 bug,连节奏都像复刻了一遍。所以这些问题到底是今天才发现的?还是早就知道,只是一直没修,直到对面发新模型了才突然加速处理?用户先感受到变笨,官方过段时间再出来发 postmortem。一次是巧合,两次还叫巧合吗?#人工智能#人工智能#互联网##程序员#

8. 删了试试,AI降智秒解(上篇)

9. 一个监测Claude Code有没有降智的网站。marginlab.ai/trackers/claude-code/它每天跑一小批 SWE-Bench-Pro的子集测试,记录 Claude Code(用 Opus 4.5、直接在 Claude Code CLI 里跑,不是自建评测脚手架)的通过率,然后用统计检验判断最近一段时间有没有出现“显著的性能下降”。还可以订阅邮件提醒:一旦检测到显著下降就通知你。#HOW I AI#

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章