8月底,一条API日志把AI编程圈炸出了坑。开发者argofowl查Claude Code日志时发现,自己手动选的"high"推理档,被悄悄映射到了过去"low"档对应的数值10上。他debug了整个下午,先怀疑自己代码写错了,再怀疑Mac出了问题,最后翻API日志才抓到"凶手"。知乎
传言传得最快,但细节几乎全错
科技博主Chubby转发后AI圈炸锅,大量用户自测对比、翻旧会话逐行diff。微博流传最广的说法是:从2.1.237版本开始,系统把他手动选的"high"推理档,悄悄映射到了原本对应"low"档的数值10上,更新日志里一个字没提。知乎按这个版本的故事,Anthropic就是在偷偷降档。
Anthropic方面回应得很快。Claude Code工程师Thariq Shihipar称,团队在测试API服务配置,此次实验只是改了effort的数值映射方式,刻度本身没有实际意义,选的effort就是拿到的effort。微博
三版实测:三个细节全对不上
但回应归回应,证据才是证据。小红书用户"人间漂流"装了三个版本逐档实测:服务端把effort以一个tag塞进system prompt,他让模型逐字引用自己上下文里的相关原文,把真实数值"钓"了出来——low=10,medium=20,high=40,xhigh=120,max档干脆没有这个tag。小红书
对照传言,有三处错:其一,不是百分制,xhigh=120已经超过了100;其二,档位没有被压平,10→20→40→120单调递增,high是low的4倍;其三,卡点版本也错了,235完全没有这个tag,实验是从236开始的。
客户端同样没被动过。236和237两个版本的325MB二进制里,effort相关字符串计数完全一致,客户端里唯一的effort数字是计费系数。也就是说,这是一次服务端serving config实验,不是客户端层面的手脚。

"降智实锤"是从哪来的
辟谣之后,更大的疑问是:既然档位没被压平,网上那些"降智实锤"是怎么来的?那位实测用户又做了一个实验:直接问模型"你现在什么档位",结果传high,模型自称Low;传xhigh,自称Medium。模型只拿到一个裸数字40,没有任何对照表,于是自己猜档位名,猜错了。用户问一句、模型答low,就成了降智实锤。小红书这是一次模型自我内省的幻觉——它不知道自己是几档,但它言之凿凿。
站得住的批评只剩一条,但这条最要命
所以这件事不是简单的反转。站得住的批评只剩一条:服务端A/B事前零公告,有人白debug了一下午自己的应用。小红书实验本身没降档,但改配置不打招呼,用户只能靠debug自己的项目反推服务端在做什么——这才是社区炸锅的根源。
而且社区炸得这么凶,是有前科的。今年3到4月,一堆人说Claude Code变笨,AMD的AI总监Stella Laurenzo把自己团队6852个Claude Code会话全翻出来分析:1月30日到2月8日,中位思考深度是2200个字符;3月以后是600个字符,跌幅73%。微博同一时期,可见思考比例从100%跌到不足1%,读与编程的比例从6.6:1掉到2.0:1——模型不再反复读清楚再动手,而是匆匆看两眼就大改。

更耐人寻味的是Anthropic自己的复盘。小红书上有用户替官方博文划了重点:Anthropic复盘后给了个反直觉结论:API和模型层没问题,锅在产品/harness层——三个独立小改动凑一起,就让人觉得"模型变笨了"。小红书默认reasoning effort从high悄悄降到medium,为的是省延迟和token;清理idle session旧思考的bug每轮都清,让Claude健忘、重复;system prompt加了输出别超25/100词,coding质量掉约3%,最后只能回滚。权重没变差,是模型外面那层壳被悄悄动了,用户体感就是"变笨"。如果默认值和prompt能像代码一样被review、被ablation、被回滚,这次零公告实验大概也不至于一点就着。
背景也不友好:Opus 5本来就不稳
风波能烧到这个量级,还有这个月的背景板。跑分上,Opus 5综合得分82.72、SWE-bench Pro 79.2%、Terminal-Bench 86.7%,成绩亮眼。微博但用户体感却是另一面——啰嗦、偷懒、爱抬杠,跑分和体感正在脱钩,这已经成了行业普遍问题。
Anthropic自己也承认。Thariq随后承认,Opus 5的表现"很不稳定",团队正将其列为最高优先级来解决。知乎
可靠性同样在失分。8月24日这一天,Claude连着崩了三次。36氪状态页当天接连亮起三次红灯,故障从中午12点50分一路烧到下午3点36分,官方警报拉响21分钟后还挺自信地说已经定位到根因,然后就没有然后了。

往前翻,故障清单更密。8月一共24天,有13天留下了事故记录;第三方监测服务StatusGator显示,从2026年1月算到现在,Claude已经累计了184次故障记录。36氪
性能侧也有对照。有人把Opus 5和竞品跑同一个任务:Opus 5的xHigh档跑了一小时,换一家15分钟搞定——4倍差距。知乎
还在用Claude Code,你能做三件事
这场风波给付费开发者留下的教训,不是站队骂或者站队洗,而是三件马上能做的事。
第一,验证降智看客观量,别问模型本人。模型对自身配置的自述,永远不能当证据。判模型身份要看response id前缀、header指纹、token计数这些客观量,别问它"你是谁"。小红书体感变差时,先逐行diff新旧会话、对比thinking token的实际长度,再下结论。
第二,钉住版本,留回滚路径。这次实验证明,同一个客户端可能接不同的服务端配置,版本号是你为数不多的锚点。生产环境钉住能跑的版本,别急着自动更新,出问题先退回再说。
第三,留后手路由,别把调用全挂在一家。Reddit上有人实测,85%的简单请求走Haiku级别,只有不到2%才走旗舰,月费从288美元降到60美元。知乎GLM、Qwen的开源Flash版定价已经打到Opus的1/40甚至1/60,这个当口,路由灵活性本身就是利润。
最后,遇到"体感降智",先排除自己的变量:版本更新没有、档位改没改、prompt动没动。这三样自查完还有问题,再带着客观量证据链去社区发声——argofowl这次就是这么拿到官方回应的。黑箱没法消除,但证据可以学习。