52%的会话开工20分钟就进“变笨区”:Opus 5.5“降智”吵上热搜,真凶往往不是模型——官方已把解法写进手册,先做查切换、看水位、写交接、做减法这四件事

源自284位全网作者

08:33

这周 AI 编程圈有点热闹。10 月 7 日 Anthropic 发布 Opus 5.5,两天之内 Grok Bot 把它设成默认后端、谷歌云把它请上发布会,一副“接管一切”的架势。但另一边,“降智”的讨论也在同步刷屏:B 站有人把 Opus 5.5 的降智传闻一条条核查。知乎上“换了 Opus 5.5 为什么没体感”的帖子挂了一天,小红书上一条 10 月 6 日的笔记标题更直接——《AI 聊久了变笨,不是错觉》。知乎哔哩哔哩小红书

有意思的是官方的反应。10 月 8 日,Anthropic 发了一份《如何在 Claude 和 Claude Code 中用好 Opus 5.5》的使用手册,里面没有回避“变笨”这件事,反而把几种情况直接写了进去:长对话会让模型反复琢磨已经回答过的问题、上下文接近上限时旧内容会被压缩、最早交代的细节可能丢失,甚至还有一种你可能根本没察觉的情况——你以为自己在跟 Opus 5.5 说话,其实它早就悄悄换成了别的模型。知乎

所以“越聊越笨”到底是怎么回事?我把这两周小红书、知乎、B 站上的实测帖、官方手册和研究报告翻了一遍,结论是:你的 AI 变笨,大概率不是模型降智,而是四种更具体的原因。每一种都有对应的解法,而且几乎都不用花钱。

先说最扎心的数据:变笨比你想的来得早得多

小红书博主“橙研所”干了件狠事:统计了自己最近 30 天在 Claude Code 里的 155 个会话。结果 81 个(52%)超过了 15 万 token。越线的中位时间是——开工后 20 分钟,最大的一个会话烧到 95 万 token。小红书

15 万 token 是什么概念?他的模型上下文窗口是 100 万 token,状态栏显示“上下文才用了 15%”,绿灯。但按社区目前的经验线,过了 15 万 token 就进入所谓的 dumb zone(变笨区)。他的状态栏脚本设的是 70% 变黄、90% 变红——等它变黄,已经 70 万 token 了,黄花菜都凉了。小红书

为什么窗口没满也会变笨?两层原因。第一层是注意力预算:模型要计算每两个 token 之间的注意力关系,数量约是 token 数的平方。15 万 token 就是约 225 亿个关系,每个 token 的注意力预算是固定的,要分的对象越多,每份就越少。第二层是老问题“迷失在中间”(Lost in the Middle):斯坦福 2023 年的研究发现,输入很长时,模型对开头和结尾的信息用得最好,中间的内容最容易被忽略。也就是说,就算你交代的规则还在窗口里,它也未必“看进去”了。小红书

这不只是个别用户的体感。向量数据库公司 Chroma 做过一项著名研究,测了 18 个主流大模型,结论很扎心:所有模型都会随着输入变长而变蠢,一个不漏——而且在窗口远没满的时候就已经开始了。Chroma官方

52%的会话开工20分钟就进“变笨区”:Opus 5.5“降智”吵上热搜,真凶往往不是模型——官方已把解法写进手册,先做查切换、看水位、写交接、做减法这四件事

变笨的方式也被拆开统计过:Chroma 按模型族统计了长输入下的失败类型占比,不只是“答不出”,还包括格式跑偏、内容错漏,甚至直接编造答案。

52%的会话开工20分钟就进“变笨区”:Opus 5.5“降智”吵上热搜,真凶往往不是模型——官方已把解法写进手册,先做查切换、看水位、写交接、做减法这四件事

MIT 的研究者今年还补了一刀:上下文腐烂(Context Rot)可能根本不是长度问题,而是分布问题——当工具输出、历史推理不断堆积,上下文会逐渐偏离模型训练时见过的状态,模型等于在被窝里读天书。这个现象现在连官方都认了:OpenAI 在自己的文档里把这类问题称为 Context Rot,Anthropic 这次干脆把应对方案写进了使用手册。哔哩哔哩知乎

第二种原因最容易被冤枉:你可能一直在跟“替补”说话

这是这次官方手册里最值得一看的部分。Claude 系产品有一种安全机制:某些内容触发安全检查后,系统会自动把对话切换到旧模型,而且正常请求也可能被误判。手册明确说,检查范围不只是你刚发的那句话,前面的消息、文件和搜索结果都算——所以别光盯着最后一句找原因。知乎

怎么发现?在 Claude 应用里,看到“Switched to”加一个旧模型名字,就是被切了,后续对话会一直用那个模型。更坑的是:就算你在选择器里切回 Opus 5.5,之前触发检查的内容还留在对话里,聊着聊着可能又被切回去。知乎

官方的解法:如果希望换模型前先征求你的意见,去 Settings → Capabilities 关掉“Switch models when a message is flagged”;Claude Code 里用 /model 查看和切换当前模型,怀疑误判就新开对话重试,再用 /feedback 反馈。知乎

对照一下就知道这有多重要:很多人骂“Opus 5.5 降智”,但从头到尾没确认过自己到底在跟哪个模型说话。知乎那位“换了 Opus 5.5 没体感”的作者倒是坦率,明说自己没跑任何对比测试,只是个人印象——这种印象流结论,先查模型再下判断也不迟。知乎

当然,用户的警惕也不是空穴来风。今年 4 月 Anthropic 官方发过一篇 postmortem,承认了 Claude Code 质量危机的三大失误:默认推理档位被悄悄调低、缓存清理 bug 导致“失忆症”、字数限制逼坏代码质量。官方有前科,所以这次“降智”传闻一出来就炸锅。但 4 月那次是官方的锅,这次的“变笨”多数是另外几种情况——分清楚,才知道该修哪里。哔哩哔哩

第三种原因:工具装太多,AI 也会“选择困难”

B 站 10 月 9 日一条视频讲了个反直觉的事:Claude Code 插件不是装得越多越好,工具超过 50 个之后,模型反而会选错工具、性能下降。道理和上下文腐烂相通——每个工具的描述都要占上下文、分散注意力。你以为装了一柜子兵器,实际上是往模型的办公桌上又堆了一摞说明书。哔哩哔哩

这也是为什么官方手册反复强调子 Agent 分工:查订单、查库存、查支付各派一个子 Agent,各自带着一小撮工具去干活,查完由主 Agent 核查证据再汇总。工具少而准的上下文,比大而全的上下文好用得多。知乎

解法:官方手册加社区实测,一共四件事

把官方手册和社区里验证过的做法合起来,其实就是一套动作,按优先级排:

第一件:给水位装个仪表盘。Claude Code 里用 /context 命令随时看 token 占用;愿意折腾的可以像橙研所那样写个状态栏脚本,但阈值别学默认的 70% 变黄——按 15 万 token 这条经验线,100 万窗口设 15% 报警才合理。B 站有 UP 主甚至做了个“refresh 技能”,一键开新对话并自动保留所有规则和指令,本质上就是把水位管理自动化。哔哩哔哩

第二件:养成“交接文档”习惯,这是社区里被验证得最充分的方案。小红书上一条 1.58 万赞、1.97 万收藏的帖子只讲了一件事:每次关掉长会话之前,先让 AI 写一份 HANDOFF.md。原话模板可以直接抄:“这个会话要结束了。请写一份交接文档存到 HANDOFF.md:我们在做什么任务、已经完成了什么、当前卡在哪、下一步计划是什么、有哪些踩过的坑绝对不要再踩。写给一个完全没有上下文的新会话看。”下次开新会话,第一句话就是“先读 HANDOFF.md”。不装任何插件,一个 md 文件就是跨会话记忆最低成本的方案,Codex、Claude Code 通用。小红书

52%的会话开工20分钟就进“变笨区”:Opus 5.5“降智”吵上热搜,真凶往往不是模型——官方已把解法写进手册,先做查切换、看水位、写交接、做减法这四件事

官方手册的思路一样,只是换了个文件:让 Claude Code 把待办写进 TASKS.md,完成一项更新一项,发现新问题也补进去,接着干活前先读一遍。手册给的理由很实在:长任务跑起来后,对话里不断塞进代码、日志和工具结果,上下文接近上限时旧内容会被压缩,最早交代的细节就不再完整——与其指望压缩算法记住一切,不如把关键状态写到窗口外面。知乎

第三件:压缩不是万能药,小心它反过来烧你的钱。4 月就有人扒过 Claude Code 疯狂消耗 token 的问题,核心是 autoCompact(自动压缩)失败后疑似不断重试。当时社区总结的三条现在依然适用:给重试设上限、别一上来全开 auto 功能、把 token 和成本监控放到明面上。社区还有人扒过 /compact 的完整流程:分析、执行、重建三个阶段,10 万 token 的历史能压到 1 万以内,但模板再精细也是有损压缩。用 /compact 之前想清楚:压掉的可能是你最需要的那条约定。小红书小红书

52%的会话开工20分钟就进“变笨区”:Opus 5.5“降智”吵上热搜,真凶往往不是模型——官方已把解法写进手册,先做查切换、看水位、写交接、做减法这四件事

第四件:重要要求放最后说,一个话题一个新会话。“迷失在中间”规律的直接应用:关键的格式要求和限制条件,在每次提问的结尾再补一句,最不容易被漏掉。新问题跟前面聊的无关时,果断开新对话——干净的桌面永远比堆满的桌面好用。官方手册还补了个细节:Opus 5.5 已经会先思考再回答,把提示词里的“仔细思考”“一步一步想”删掉(包括 CLAUDE.md 里的存货),回复能更早开始,质量没见下降——这也是在给上下文腾地方。知乎

这笔账最终是钱:会话越长,每句话越贵

为什么值得这么较真?因为“变笨”不只是体验问题,是成本问题。模型每生成一个 token,都要把窗口里已有的内容整体处理一遍——对话聊得越久,每一句的计算成本越高。API 按量付费的用户,上下文直接进账单,会话管理就是账单管理。

订阅用户也别觉得“包月无所谓”。B 站有用户晒过自己连续三周 Claude 额度提前耗尽、产出反而减半的经历——额度是按用量算的,一个 95 万 token 的巨型会话吃掉的速度,够你开六个干净会话干完同样的活。已经有人把这笔账做成了开源监控工具,输入、输出、缓存读取的每一分钱都记录在面板上——截图里这位重度用户 94.8 亿 token、折合 5444 美元的总账单,就是这么被看见的。哔哩哔哩小红书

52%的会话开工20分钟就进“变笨区”:Opus 5.5“降智”吵上热搜,真凶往往不是模型——官方已把解法写进手册,先做查切换、看水位、写交接、做减法这四件事

官方手册里新推的 /fast 快速模式也是同理:用的还是同一个模型,速度更快,但同样的 token 会更贵,需要开启“额外用量”。值不值得开?官方的说法都算实在:你一直坐在屏幕前等,少等一会可能就值;任务交出去就去忙别的,就不用急着开。知乎

顺带一提,就在 Opus 5.5 发布同周,OpenAI 把 GPT-6.1 Sol 的 Ultrafast 版本定成了 6 倍价格换最高 8 倍速度——整个行业都在把“快”和“聪明”拆开来卖。看懂了注意力预算这笔账,你就看懂了这些定价:窗口里的每个 token,都是要反复计费的。微博

对号入座:三种人,三种打法

只在网页或 App 里聊天、偶尔让 AI 写点小代码的轻度用户:记住三句话就够——一个话题开一个新对话;聊久了先让它把结论总结成十条以内的要点,带着要点开新对话;最重要的要求放在消息最后再说一遍。不用装任何东西。

Claude Code / Codex 重度用户:把上面四件事做成肌肉记忆——/context 看水位、HANDOFF.md 或 TASKS.md 外置状态、autoCompact 别全信、插件做减法(对着 50 个的上限检查一下你装了多少)。再加一条:用 /model 确认自己到底在跟谁说话,把“Switched to”当成故障灯看待。

刚升级 Opus 5.5、觉得“没体感”甚至“降智”的人:先别急着下结论,按顺序排查——模型有没有被静默切换?会话是不是早就过了 15 万 token?插件是不是装爆了?三个都排除了,再去 /feedback 反馈,那时候你的“降智”指控才有分量。

最后说下值得继续盯的信号:Anthropic 这份手册是跟着 Opus 5.5 一起发的第一版,社区已经开始逐条实测,知乎上“Claude 官方发布 5 招解决上下文腐烂,能避免百万 token 白烧吗”的新问题这两天刚冒出来。Claude Code 会不会把“水位报警”产品化、autoCompact 的重试机制有没有修,也值得等一两个版本看看。在那之前,最靠谱的还是那句老话:模型不负责记住你,你负责管好桌面——桌子干净了,AI 自然就聪明了。知乎

内容由AI生成

精选参考来源

1. Opus 5.5接入一切,OpenAI遭全硅谷围剿!谷歌马斯克集体叛变了

2. Claude Opus 5.5 真的变笨了吗?把「降智」传闻一条条查了一遍

3. AI聊久了变笨, 不是错觉

4. Anthropic 重磅发布:Claude Opus 5.5 最佳使用手册!

5. Context Rot: How Increasing Input Tokens Impacts LLM Performance

6. MIT研究者指出:很多Agent设计方向可能错了,上下文腐烂不是长度问题

7. Codex 子 Agent 配置指南:让 Sol 当军师,Luna 当搬砖工

8. 换了 Opus 5.5 为什么没体感?Grok Bot 要开始自动挑模型了(依据公开资料)

9. 文章精读|Claude 变笨的真相:Anthropic 官方承认三大失误

10. Claude Code别再乱装插件!超过50个工具反而让AI变笨

11. 一招让Claude输出质量翻10倍 - Ben AI - 中配

12. Codex 有个很值得养成的收尾习惯

13. Claude Code的上下文压缩功能慎用

14. compact之后Claude Code上下文发生了什么?

15. AI变笨不是模型降智,是没人看全链路

16. 我给 AI 额度监控加了个会打工的小机器人

17. 【#GPT6.1Sol极速版上线#】OpenAI Developers 官方宣布,OpenAI 正式在 API、Codex 和 ChatGPT Work 中推出 GPT-6.1 Sol 的 Ultrafast 版本,6 倍价格、最高 8 倍速度。(IT之家)

18. Claude 官方发布 5 招解决「上下文腐烂」,这能有效避免「百万 token 白烧」吗?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章