周末这两天,Claude Code 的用户圈又炸了。
周五晚上开始,Reddit 传回一条消息:从 CC 2.1.237 起,Anthropic 偷偷改了推理强度的数值映射,你设置的 high 档对应的数值从 40 被砍到 10——正好是以前 low 档的值。小红书B站视频标题起得更直接:“AI也摸鱼?Claude Code被曝偷偷降智,脑力一刀砍75%”。B站到周日,微博科技媒体已经用上"Anthropic滑跪认错,Claude暗中降智实锤"的说法。微博
你是不是已经在搜怎么退订了?先等等。我把这两天微博、小红书、B站、知乎的讨论都翻了一遍,把几个关键信源逐条对过,结论是:这场风波一半是谣言,另一半比谣言更值得你警惕。
一、先说实锤的部分
服务端确实动了。按小红书用户"人间漂流"装 235/236/237 三个版本的实测,Claude Code 服务端现在会往系统提示词里注入类似 `
40 ` 的标签来控制推理强度。这个标签在 2.1.235 里完全不存在,从 2.1.236 开始出现——注意,比传言说的 237 还早一个版本。小红书改动完全发生在服务端。对比 236 和 237 的客户端二进制,effort 相关字符串的数量一模一样(1144 对 1144、58 对 58、105 对 105)。也就是说,升降级本地客户端不改变任何事,安装包本身查不出线索。
团队确实回应了。据新智元报道(36氪授权转载),Claude Code 工程师 Thariq Shihipar 公开回应:团队有时会先在 Claude Code 里测试 API 的服务配置,再决定是否全量推送;这个实验只是改了 effort 的数值映射,“有些人会看到 Claude 说自己是 10”,但这个刻度不是 0 到 100,数字单看没有意义,你选的 effort 就是你拿到的 effort;团队评测确认这不影响模型性能。36氪另外,面对 Opus 5 的降智质疑,Thariq 承认 Opus 5 是个"表现很不稳定"的模型。

实锤的是:改动存在、更新日志没写、事前零公告。
二、被实测推翻的部分
传言的核心主张"high 被砍到 10、脑力-75%",目前没有硬证据,最详细的实测恰恰指向反面。
"人间漂流"实测到的档位表:low=10,medium=20,high=40,xhigh=120,max 没有标签。小红书这张表直接推翻了传言的三个说法:
不是百分制。xhigh=120 超过了 100,"100 分里砍到 10 分"这个框架自己就塌了;
档位没有被压平。10→20→40→120 单调递增,high 仍是 low 的 4 倍;
起始版本是 236,不是 237。
官方工程师的回应也和这份实测对得上:实验改的只是数值映射方式,你选的 effort 就是你拿到的 effort。36氪
但也要如实交代对立证据:小红书用户"老农 API"说,有开发者在 API 日志里亲眼看到 high effort 只写了 10/100,且 2.1.237 起 Fable 5 被塞进 A/B 实验、压缩 effort 刻度,老版本和 Opus 5 不在实验里。小红书一边实测 40,一边日志看到 10——两个观察未必矛盾:如果服务端真在做 A/B,进了实验组的用户确实可能拿到更低的值,但"所有人被一刀砍 75%"就是夸大了。你可能命中了实验组,也可能没有,这正是"有人觉得明显变笨、有人毫无感觉"的原因。
三、最魔幻的部分:有些"实锤"是模型自己说的
这次很多人判断降智的第一步,是直接在对话里问模型"你现在是什么档位"。结果发 high,模型说自己是 Low;发 xhigh,它说 Medium;发 max,它说 High——听着像实锤,其实是幻觉。
机制不复杂:模型在系统提示词里只拿到一个裸数字 40,没有任何"数字-档位"对照表。你问它什么档,它只能猜,还经常猜错。这一点连官方回应都侧面印证了——工程师 Thariq 解释"有些人会看到 Claude 说自己是 10",并强调那个数字单看没有任何意义。36氪所以那篇实测帖留下一句值得所有 AI 用户记住的话:
模型对自身配置的自述,永远不能当证据。
判断降没降智,看客观量:API 日志里的 effort 值、thinking tokens、响应 id 前缀、header 指纹,都比问模型本人靠谱。小红书
四、为什么这次群情激愤?因为有前科
谣言辟掉了,这事能翻篇吗?不能。愤怒是有理由的,因为今年已经是第二次。
按微博转述的 Anthropic 官方说明梳理的时间线:
3 月 4 日,Claude Code 把默认推理强度从 high 调成 medium,当时给的理由只是"减少延迟"。微博
用户骂了一个多月,4 月 7 日官方表示收到反馈;
4 月 23 日官方博客承认:清空空闲会话"thinking"的 bug 导致持久上下文丢失,外加错误的默认推理设置和系统提示词改动,补偿是给全部订阅用户重置额度。道歉当天 GPT-5.5 发布,社区嘲讽"时机选得好"。<#&!53#&!>微博


有这个前科在,服务端再次悄悄动 effort 映射、changelog 只字不提,社区的信任崩塌是 Anthropic 自己应付的成本。真正该追问的是三件事:到底改了什么、为什么不公告、这次有没有补偿。
五、普通用户怎么办?五个自查动作比生气有用
先排除本地问题。这周知乎用户 Ward 写了篇《删了试试,AI降智秒解》:他以为所有模型都降智了,最后发现是自己攒的 CLAUDE.md/AGENTS.md 已经膨胀到 6594 行、挤占了有效上下文,瘦身到 736 行就好了。知乎骂服务端之前,先清一遍自己的配置、skill 和 MCP。
查 API 日志。看真实请求里的 effort 值和 thinking tokens,这是目前最直接的证据。
别问模型自己什么档位。这样验证出来的结果一律无效。
盯第三方监测,别靠体感。marginlab.ai/trackers/claude-code/ 每天跑一小批 SWE-Bench-Pro 子集并做统计检验,支持邮件订阅,比"感觉变笨了"可靠得多。微博

锁版本和迁移,都等官方详细说明再决定。锁 2.1.235 只改客户端,不保证服务端不下发;赌气迁移更没必要——现有证据不支持"high 变成 low"。
最后一句想对所有为 AI 编程工具付费的人说:模型能力波动大家都有心理预期,但订阅制产品在用户付费购买的参数上悄悄做 A/B、更新日志只字不提——这才是这场风波里最被低估的消费者权益风险。这事还没完,官方补偿和第三方复测的结果,值得继续蹲。