8月28日,知乎问题《为什么刚开始觉得AI编程很厉害,用久了就不行了?》下的一条高赞回答,浏览量逼近百万。最扎心的不是技术拆解,而是一个段子:你让AI走方案A,它回"你说得对,但是我们应该选方案B";你红温大吼"方!案!A!“,它蓝移回去"方!案!B!”——最后你深呼吸,开了个新对话。知乎
紧接着,B站一个开发者晒了另一种"拉胯":打开Claude Code,一个字没打,起始上下文已经吃掉51,400 token。他用`/context`命令逐项排查,揪出两个隐形杀手——一个没卸载干净的测试插件和一个auto-memory开关——砍到41,400,等于每轮对话还没开始,先省下近1万token。哔哩哔哩
这两条内容指向同一件事,而它是8月份大量AI编程"中度用户"正在经历、却很少有人讲清楚的:你以为的模型降智,大概率是你的上下文失控。
一、"失忆"是怎么发生的:一场机器和人都参与的遗忘
翻车描述得最诚实的,是《大家Vibe Coding路上遇到最大的问题是什么?》这个171万浏览的问题。一篇以第二人称自嘲的复盘里,你——一个连一行代码都不会写的技术小白——用AI从零搭值班表报备网站,前期丝滑得像坐在高铁上看窗外风景,中后期坠入深渊:功能和功能打架、权限设计复杂得离谱、一个BUG修复方案连着问了六轮,拿到六个不一样的结论。复盘的总结句一针见血:不是它傻,是系统已经大到不能一次性塞进上下文。知乎 对另一半原因,这篇复盘同样不客气:最开始那个"精致到像一件艺术品"的方案,白纸黑字写在那,最后"被你们俩齐心协力忘了个底儿掉"。
注意,这是双向遗忘。AI那半场有机械原因:上下文窗口填满后,工具会触发压缩(compaction)——把老对话摘要化、塞回窗口继续。今年8月中旬开源就卷起插件生态的DeepSeek Harness(dsh),它的处理顺序是:先裁剪超大的工具结果,重新计量后若仍达阈值,再对旧历史生成摘要。哔哩哔哩 压缩是有损的:它倾向保住"正在写什么",丢掉"当初为什么这么写"。所以AI跟你翻脸选方案B时未必是抽风,而是晚上八点你说服它选A的那段论证,到晚上十一点已经不在它的脑子里了。这件事甚至已经被量化过:在火山引擎OpenViking的官方评测里,LoCoMo这类长程记忆基准上的长对话记忆准确率,从24%–57%被提升到了80%–83%。知乎

人这半场更隐蔽:每轮改需求时你都在"一时兴起",而AI只会无条件执行最近的说法。所谓AI编程"用久了不行",多数不是能力曲线在掉,是共识在蒸发。
二、你的token都烧在哪:我把多个平台的实测放到一张表上
单个人踩坑只能吐槽,跨来源对起来才能看出分布。这一轮AI编程社区在8月沉淀出来的实测数据,拼在一起大致是这样:
项目 | 实测/数据 | 来源场景 |
|---|---|---|
Claude Code 空会话起始上下文 | 51,400 → 清理插件和auto-memory后41,400 | B站开发者`/context`逐项排查(8-29) |
DeepSeek Harness 压缩机制 | 达自动压缩阈值时:先裁超大工具结果,仍超阈值再对旧历史做摘要 | B站DSH源码拆解(8-27) |
上下文压缩开源工具billion-context | 同时支持pi、opencode、dsh、codex、Claude、zcode等 | GitHub项目实测视频 |
OpenViking(3万+star,火山引擎8月开源) | 主打"资料越多Agent越容易找错",把上下文变成文件系统按需取;官方评测口径输入token最多减少91% | B站源码拆解+知乎评测 |
表里有两条反直觉,值得单独说:
其一,"多给上下文"不是解药,是症状。B站有人做了个对照实验:一路给Claude Code配齐所谓"必装6大Skill",另一路把技能全删了——后者标题就是《我删除了我所有的Claude技能……而Claude变得更聪明了》。哔哩哔哩 两条视频发布于同一天、前后只差不到9小时,观点却针锋相对,社区在这个问题上真实地分裂。而上面那张表的共同指向是:每个插件、每条memory、每份被自动塞入的项目说明,都在预扣你本轮对话的"思考预算"。1M上下文窗口≠1M可用注意力,塞错了比不塞更危险。社区近两个月流行开Subagent,本质也是同一个思路:让干脏活的子代理带着自己隔离的上下文窗口去读仓库、查资料,把500多行原始输出挡在外面,主会话只接收30行摘要这样的结论。知乎

其二,token浪费不只是钱,是质量的先行指标。起始上下文越肥,触发压缩越早,AI失忆越快——“没打字先烧5万"和"越用越拉胯”,其实是同一条因果链的两端。
三、三种"越用越不行",先分诊再开药
把这轮收集到的翻车样本做个归因,"拉胯"其实分三种,处理方式完全不同:
全局降智(真·模型问题):新开会话也拉胯,且社区短时间集中反馈同一个版本——特征是"所有人一起变差"。这种你只能等官方修复或换线路,个人操作无意义。
上下文失效(最常见):新会话开头丝滑,聊着聊着改A坏B、重复问同样的问题给出矛盾答案。多数个人体感"降智"属于这类。
需求漂移(人祸):连问六轮拿到六个结论,回头翻原始方案发现AI最初是对的。本质是边界没冻结,每轮都在追加临时想法。
分诊动作只需要两下:跑一次`/context`看起始占用;把当前任务原样开新会话重放。新会话立刻变聪明→是上下文失效或需求漂移,别骂模型。

四、值得收藏的操作:一次会话的卫生流程
综合这轮社区实测和几篇高赞复盘,中度以上用户可以照抄这套动作:
开局先体检:用`/context`(或状态栏上下文占比插件)确认起始占用;不用的插件、自动记忆开关,关掉比留着强。
"为什么"落盘,别留在聊天里:把架构决策、边界条件写进CLAUDE.md/spec这类单一事实源文件。有篇在知乎流传的复盘称,一个团队经过8个Vibe Coding项目验证后总结出:成功率从最初的30%提升到90%,靠的是"冻结边界、建立单一事实源、棘轮式约束"先铺工程规则,而不是Prompt多花(该文自述数据,未经第三方核验,方向值得抄、数字将信将疑)。知乎
认输信号:B站那期讲上下文工程的视频给了个好用的止损线——连续三轮修改后问题数量不减反增,别再compact续命,直接新开会话,用spec文件交接。哔哩哔哩 压缩只是延迟失忆,重启才是清创。
跨会话靠文件,不靠AI自觉:想要"昨天教过的今天还记得",要么手动维护进度文档,要么尝试MemoraX这类跨工具共享记忆方案——但要清楚,这类第三方层同样要占上下文,先瘦身再装记忆。

五、为什么这事值得继续盯
工具厂商比用户先一步承认了这件事。阿里8月27日发布全新Qoder,把定位从AI编程工具升级成"以Coding为核心能力、面向所有人的智能体工作台",官方口径称产品已累计服务全球超600万用户、覆盖10万家以上企业客户。智东西知乎 DeepSeek则把dsh整个框架押在"一切皆插件"的执行底座上,模型、工具、沙箱、会话全部变成可替换、可组合的插件。知乎 字节Trae、腾讯CodeBuddy同期都在堆Plan/Goal/任务管理。行业正在把"管上下文"从用户的自理能力,变成产品的竞争维度。

这意味着两件事:一是工具还会密集换代,但"上下文卫生"这项技能跨工具保值,先学会不亏;二是接下来值得观察的信号很具体——各家Agent的默认起始上下文水位、compaction策略是否公开可查、第三方记忆层是被官方吸收还是被干掉。谁把"失忆"治好了,谁才是这一轮智能体编程的终局选手。在那之前,先把你那个没打字就烧5万token的会话,清理一下。