9月10日晚上,小红书上一篇笔记开始被大量收藏:《新版本DeepSeek公文写作能力彻底报废》。发帖人当天用"三合一新款模型"写材料,一句"AI味拉满了,完全不能用",紧接着是更扎心的半句——以前的版本修改个几稿就差不多了,现在的基本上要全文重写一遍。小红书
3933个赞、4780次收藏,评论区分成两半:一半是同样发现"昨天还好用、今天不敢交稿"的打工党,另一半不理解——“算力变强了,输出变快了,骂什么?”
紧接着的几天,《请使用deepseek的用户们都进来让官方看见》拿了3001赞,《为什么要合并专家模式,为什么要换深度思考的思考链》拿了4103赞,“回复又臭又长”“开始嘴我骂我”“上下文变短"的帖子一天好几条。如果你这周打开小红书搜"DeepSeek更新”,能刷到一片哀声。小红书小红书
但另一边,第三方测试机构Artificial Analysis给这个新模型的评分是40分,超过了参数远大于它的V4 Pro;AutomationBench-AA智能体榜上它69%并列第一。36氪
跑分在涨、体感在崩,两头都是真的。而把这两头对起来看,恰好能看清这个九月每个AI提效党都绕不开的问题:当你赖以干活的模型一夜换了"脾气",你攒下来的提示词、模板、工作流,到底还值多少钱。

先把一周的账按时间摆出来
这事不是"版本迭代",是"换模型"。时间线是这样的:
9月10日,DeepSeek发布V4.1 Flash,官方通稿称其在性能、费用、速度等指标上"全面超越"V4 Pro,并计划让V4 Pro有序下线。 当天,公文帖、专家模式帖开炸。知乎
9月13日,官方定价页悄悄加了一行脚注:应广大用户需求,9月14日之后继续提供V4 Pro的API服务,计费方式不变。
9月14日12:00——原公告里写死的切换时刻。到了点,V4 Pro仍独立在售。这是DeepSeek第二次改口,从"延迟下线"到"放弃下线"。36氪
9月18日起,大量用户反馈App里"修改/重新生成过于频繁,请稍后重试",且有分析帖(个人推论,非官方口径)指出"修改"与"重新生成"已合并计入同一个滑动窗口限额。小红书
9月19日,价格页又更新了一行:调休上班日和法定节假日全天按闲时计费——工作日高峰(北京时间9:00-12:00、14:00-18:00)价格翻倍,其余时间一律五折。小红书

一家公司为什么推翻自己刚公布的下线计划?拆解那篇V4.1 Flash技术报告的标题就能猜到一半:《Pushing the Limits of KV Cache Compression》——整篇报告是围绕"把KV缓存压下去"写的。552B主干+196B Engram参数的多模态MoE,40层主干拆成20层因果编码器+20层解码器,提示词不进解码器,prefill计算量接近减半,全局KV缓存压到每token 890字节,约为V4-Flash的四分之一,对比初代是437倍。36氪

说白了:V4.1 Flash不是V4 Pro打了补丁,而是一台重新设计的机器,只为智能体、代码、长任务这些"输入重、输出轻"的负载优化。它跑Agent确实又快又便宜——AA测下来每个综合任务只花0.27美元。
然后回到那个4780收藏的公文帖,你就能看到错位在哪了:AA的评测里,V4.1 Flash是冗长度最高的模型之一,每个任务平均吐89k tokens。写代码、跑Agent时"想得久、说得全"是优点;写公文时它就是你删不完的排比、收不住的套话、"又臭又长"的初稿。至于材料腔调、层级编号、语气克制——没有任何一张跑分表考这些,你的老提示词替这些打了半年补丁,而补丁是贴在这台旧机器上的。36氪
社区里当然也有另一派:知乎有回答直接说这是新模型发布前的"请黑子",也有人实测新模型干活更利索。这些分歧至今没有官方说法来裁决。但有一条不需要裁决:提示词失效的损失,不取决于"谁对",只取决于模型换了没有。
不只是DeepSeek:模型寿命正在变成"三个月"
如果你这半年靠"换模型"来升级效率,会发现同样的事不是第一次发生:
8月24日,月之暗面官方宣布第一代万亿参数多模态模型Kimi K2.5月底退役,K3全面接棒——服役不到8个月。微博
知乎9月19日那个1万多浏览的问题下面,有人盘了今年国产模型的更替:5月20日的qwen3.7 max已被3.8max-0902取代;6月16日的GLM5.2已经让位给5.3和5.3-Flash;6月23日的豆包seed2.1迭代到了0915版;7月31日的DeepSeek V4 Flash,不到两个月就出了视图版和V4.1 Flash。结论一句话:两个月前的模型就处于淘汰的边缘,3个月前的模型已经几乎没人用了。知乎
9月18日一天之内:阿里千问上线Qwen3.8-Omni-Flash,1M上下文,每小时音频输入价格比上一代降超98%、音视频降超93%;智谱同日发布GLM-5.3-FlashX。知乎

降价这波是真红利——以前让AI"听一小时的会"是按分钟烧钱,现在按发布口径掉到几分钱量级(注意:98%是官方口径、只算输入侧,第三方复现还没跟上)。但对提效党,硬币另一面是:模型换代周期在8个月到3个月之间,而你的提示词资产的"标称寿命",默认是按上一个模型的脾气写的。
一个有意思的对照:那篇4103赞的帖子里,用户怀念的是"以前深度思考的碎碎念";另一批人在问"有没有别的软件能代替,我要跑路了"。两拨人吵的其实是同一件事的两种成本——情感陪伴党的资产是"关系",换代直接清零;而干活党的资产本该是"判断标准",如果它也跟着清零,说明你存的东西本身就有问题。
换代时代,怎么保住你的"提效资产"
不需要等官方道歉或者回滚,这周就可以对号入座:
第一步,把你的提示词库拆成两层。 打开你最好的那20条提示词,逐句标两类:A类是任务规范——结构、事实、格式、字数、验收标准(“通知类按’依据-事项-要求’三级”“禁用排比”“控制在400字内”);B类是模型适配层——人格设定、语气、防跑偏的补丁。换代时A类基本保值,B类按半衰期3个月算,重写不心疼。你现在觉得"崩了"的部分,大概率全是B类。
第二步,存"金标准用例"而不是存提示词。 挑3-5个你最典型的活儿(一篇公文、一份纪要、一类刁钻需求),把旧模型的合格输出存下来当对照答案。以后任何"更新"或"新模型",先跑一遍用例再决定:输出对不上,是你的活儿它不行,跑分再高也别迁;对得上还更快,降价才轮得到你省。这条同样适用于还在观望要不要迁到Qwen3.8-Omni-Flash做会议转写的用户——AliMeeting转写DER从88.11降到3.35这种数字,值得先用你自己的录音验一遍。
第三步,把降价窗口用起来,但要按规则薅。 拿DeepSeek新价格页说:缓存命中0.003美元/百万token,不命中0.15美元——差50倍,同一个长提示词反复调用和每次换开头调用,是两个量级的账单。 闲时是高峰一半,9月19日新政后调休周末和法定节假日也按闲时算。批量跑的任务排到北京时间12:00-14:00和晚上,零成本省一半。但注意9月18日起合并计入限额的"修改+重新生成"——多轮改稿党是重灾区,疯狂重试只会让滑动窗口限流更紧,等几分钟再回来比连点有效。知乎
第四步,给老模型留个出口。 旧模型未必立刻消失:V4 Pro就是被"用户需求"投回来复活的,目前原价在售(约为Flash的三到七倍)。 重活儿、老流程可以继续挂在Pro上跑,但要盯紧"切换延期"信号——它已经是第二次反悔,第三次通知未必还有缓冲期。企业侧把模型放在统一网关/聚合入口后面再切换,成本会低一个数量级;个人侧最省事的对冲,是任何单点任务至少留着第二条能跑通的路。知乎
值得继续盯着的三件事
DeepSeek是否正面回应"三合一"后的风格调整——目前所有"降智/变冷"的说法都还是社区体感,官方口径只有"全面超越"和那行脚注。
V4 Pro会不会哪天真的下线——两次反悔之后,挂着的原价老模型本身就是一个稀缺品,重度依赖它的流程该早做迁移预案。
其他厂商会不会跟进"小模型接棒+按任务定价"——K3 7.5折、GLM-5.3-Flash 6折、Omni音频砍98%,这个月的价格战和这个月的退役潮,大概率是同一件事。
模型会越来越强,这句没错。但这句话的主语是"模型",不是"你的活儿"。九月这场换代潮给所有提效党提的醒就一句:跑分替你选模型,验收标准才能替你保资产——趁这个周末闲时价,先把你的金标准用例跑一遍。