9月的同一周,小红书上有两条画风完全不同的帖子同时爆了。
一条是9月10日发的「deepseek合并之后写文完全崩了…」,4338赞、639条评论,发帖人的原话是:“能不能不要再牺牲文学性了啊!细节完全没了又开始各种短句堆砌”。小红书
几个小时后,另一个圈子也爆了:「新版本DeepSeek公文写作能力彻底报废」,1610赞、1975收藏——收藏比点赞还高,是公文党的标准动作:不吵架,先把翻车帖存下来当参照。帖子里的抱怨是:“写出来的材料无脑使用排比,AI味拉满了,完全不能用”。小红书
两条帖、两个圈子,骂的是同一件事。而且这件事有倒计时:9月14日12:00,DeepSeek会把V4 Pro的全部请求路由到新模型,旧旗舰正式下线。 对每天用DeepSeek喂公文、报告、稿子的人来说,这不是模型圈新闻,是换工具级别的新闻。知乎
一、先把9月10日到14日这一串动作拆开,被忽略的是最后两个
很多人以为这"只是更新了一下"。实际是一串五个动作。
动作一:发布V4.1 Flash。 552B参数的MoE模型,是全新架构系列里尺寸最小的成员,官方宣称在性能上超越了包括自家旗舰V4 Pro在内的一众模型,也包括GLM5.3、Kimi-K3。智东西
动作二:降价。 新价目从9月10日12:00生效:闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元,高峰时段翻倍——闲时价格是高峰的一半,官方明确鼓励按这个规律错峰跑任务。智东西

动作三:KV Cache效率跳代。 同样处理长上下文,新模型对显存的需求降到上一代的四分之一、硬盘缓存降到八分之一,官方称初代V1的KV Cache体积是V4.1 Flash的437倍。上下文从4K拉到1M,解码成本几乎不随长度涨。智东西
动作四:客户端"三合一"。 App和网页端的"快速、专家、识图"三个入口被取消,整合为单一对话模式,用户无需手动切换——调度权从你手里收回去了。智东西微博
动作五:旧模型被下线挂靠。 V4 Flash等旧版本的API名字已被下线,调用会被自动路由到V4.1 Flash;而从9月14日12:00起轮到V4 Pro,官方给的理由是新模型在多方测试中各项指标全面超越旧旗舰,没有理由再维持两档。智东西
第五个动作才是本次事件的关键:这不是"你用不用新模型"的升级,是"你躲不掉的强制换脑"。WorkBuddy、CodeBuddy、OpenCode这些官方合作伙伴在发布当天就全量接入了新模型,ima、腾讯云TokenHub同步接入——如果你的文档流程背后接的是DeepSeek,你这边什么都不会提示,那边9月14日就换完了。智东西
二、"全面超越旗舰"和"真的变笨"都是真的,因为考的不是同一张卷子
先看官方口径:Agentic基准、工具调用、任务执行,V4.1 Flash赢得干干净净。再看用户口径:跑代码、做Agent的普遍叫好——快、便宜、稳;但写小说的和写公文的同时翻车。知乎"如何评价正式发布的DeepSeek V4.1 Flash"的问题下,有个流传很广的回答把话说得很重:deepseek放弃了中文文学,写作这块彻底完了。
这两拨人都没说谎,只是考卷不同。第三方评测站之间自己也打架:一个叫OpenDesign的榜单上,它是"得分第二,仅次于GPT-6Astra",还标榜只用1.4%的成本就达到了头部得分的98%。微博

另一边,Artificial Analysis的综合排名里它的名次明显偏低,知乎这两天有人专门开问题问"排行那么低"。
底下的回答和写作用户的体感能对上:抛开跑分叙事,表达和写作能力也在肉眼可见地下滑。
为什么"更小更便宜更强"会伴随"写作变差"?两个机制,都不玄学。
一是容量问题。一个输入端只激活8B参数、输出端激活16B的模型,扛不住V4 Pro扛得住的文风密度。“细节没了、短句堆砌”“无脑排比”,就是小模型表达上限的通病。不是怀旧滤镜,是物理问题。智东西
二是选择权没了。合并之前,"专家模式"至少是你可以手动选的;现在路由器替你决定什么时候认真思考、什么时候敷衍。文档写作要的是稳定输出,这次改动拿走的恰恰是稳定的把手。

而且这有先例。今年2月11日,DeepSeek悄悄对旗舰模型灰度,核心卖点是上下文从128K提到1M。 结果当天就被吐槽"变冷变傻"“语气大变”,当时业内的说法是一句话:类似于极速版,牺牲质量换速度。 把产品线往效率端猛推、让写作型用户先承受代价,是这家公司的固定动作。微博微博
三、谁被伤到、伤多少,谁反而受益
公文党、汇报党——最直接的受害者。 要的不是"聪明",是"初稿改一改就能交"。新版把初稿从"改一改"变成"推重写",排比腔和AI味还会反噬:知乎一篇教评审人识破AI的文章说得很直白,导师和技术负责人根本不需要检测软件,“只翻两页,视线停留15秒"就能把材料合上。 AI写得越快,露馅的越是"你没动脑子”。知乎
长文作者(小说、自媒体、知识写作)——损失最深。 那4338赞帖子的639条评论基本是同一批人。丢的不是一次效率,是沉淀:上百轮调出来的提示词、风格约束、示例样本,全建立在旧模型的"脾气"上,换脾气等于资产清零。有评论把成本算得很具体,同样的活以前重说3轮就能满意往下推,现在每一次都要重说到6轮——同样的字,返工次数翻倍。小红书
纯读型用户——反而受益。 萃取要点、整理纪要、总结资料、表格转文字这类"理解型"任务,9月14日之后只会更快更便宜:便宜是KV Cache压缩砸出来的,长上下文和缓存命中的成本被砍掉一大截,官方那张跨代对比图里,初代V1的缓存体积是新版437倍。这类任务恰恰是新基准赢麻了的地方——受害者集中在"生成型"用法,"阅读型"用法是白捡的降本。智东西

用API、用办公工具接DeepSeek的人——最大的隐性受灾面。 如果你不知道"请求会被自动路由"这回事,9月14日12:00之后,你的输出风格会悄悄漂移:价格更低、速度更快、没有任何报错,监控一切正常,只有你依赖的那部分质量没了。
四、14日12:00切换点前的48小时,先把这4件事做了
与其在评论区吵"变没变笨",不如在切换点前把动作做完。这次事件里有个细节可以借鉴:V4.1 Flash内测时,官方问卷里就有一道题直接问用户"这个模型能不能全面替换线上的DeepSeek V4 Pro"——合并进旗舰不是临时起意,是官宣前就摆上桌的日程,你的工作流要跟上这个节奏。
1. 先做回归测试,再决定搬家。 挑一份你过去两个月用DeepSeek生成、且真的通过交付的"金标准样例",保留提示词,今天用同样的输入再跑一次,对比三件事:排比是不是多了、细节还在不在、语气变没变。十分钟的事。差距不可接受,别乱换工具前先按这个结果说话;差距比想象小,也别被帖子带节奏。
2. 把提示词资产导出来、冻结版本。 真正有效的提示词、风格约束、示例样本,存成一个文件,标注"在哪个模型上调出来的"。这些是你的资产,别让它们跟着模型蒸发——下一个悄悄换脑的也不会提前问你。
3. 查清自己用的是谁的管道。 通过WorkBuddy、CodeBuddy、ima、TokenHub、OpenCode或公司API用DeepSeek的,9月14日换的是"幕后",各家切换节奏、计费、有没有回退选项都不同,去问清楚,别默认它会跟你商量。
4. 把"写作的模型"和"干活的模型"拆开。 社区这两天已经跑出共识:整理、萃取、校对交给便宜快的新Flash,终稿输出换一家。上个月大家还在讨论"材料用什么模型合规",这次是模型方自己把账提前摆上了桌。
另外有个社区观察值得记录但不建议依赖:多条帖子里用户反馈,升级前就存在的旧会话窗口,输出和新会话完全两样,有人据此推断"老窗口还挂着旧模型"。这个说法没有官方确认,也可能随时消失——别把它当退路;它唯一可靠的价值是给你做回归测试用:新旧窗口同一条提示词一跑,差距自己会现形。
五、最后多说一句
先别急着给这事定死刑,有个变量很关键:V4.1 Flash是"新架构系列里尺寸最小的成员",官方对这套架构的期待是能力上限更高、并且可以扩展到更大参数规模的模型——旗舰在路上。今天"写作退步"很可能只是新架构第一棒产品的阵痛,更大版本大概率把吐掉的细节捡回来。智东西
但切换点不等产品迭代。9月14日12:00,V4 Pro的路由切换照常执行。对靠AI文档助手干活的人,这事真正教的是一句话:
你付费买下的从来不是"AI文档助手"这个产品,是它背后那个具体模型的脾气。而模型厂商换掉你背后的模型,不需要你同意。
你花几个月攒出来的提示词资产,是别人的一次开关变量。先去做那个十分钟的回归测试,做完欢迎带着对比样例来评论区对账。