V4 Pro“死而复生”,专家模式却还没回来:DeepSeek三天三改公告,开发者拍桌“悄悄换模型”逼出撤回——夸或骂梁之前,先理清时间线和新价表,再对号入座四类人

源自58位全网作者

01:45

9月11日晚上,不少正在吃饭的人刷到了少见的一幕:DeepSeek 开放平台挂了两天多的"V4 Pro 退役"安排,撤回了。

次日《科创板日报》获悉:为响应广大用户的需求,DeepSeek 决定在 2026 年 9 月 14 日之后继续提供 V4 Pro 的 API 调用服务,计费方式保持不变。也就是说,前两天刚被官宣进入"有序退役"的老旗舰,复活了。微博

对盯着 DeepSeek 的人来说,这五天比电视剧还密集。今天把这场"三天三改公告"的闹剧完整捋一遍:到底发生了什么、为什么一笔看起来双赢的买卖会被开发者集体拍桌,以及跑 API 的、玩 C 端的、想本地部署的和纯围观的,接下来各自该怎么办。

五天三改公告,完整时间线

  • 9月8日:V4.1 Flash 内测悄然开启,测试模型名直白得罕见——“deepseek-v4.1-flash-expires-on-0910”,社区立刻嗅到大动作,B站相关视频一天冲到近19万播放。哔哩哔哩

  • 9月9日:DeepSeek Harness 团队成员崔添翼在 X 上宣布,V4.1 Flash 在性能、费用、速度和总用时上全面超过 V4 Pro,因此 Flash 上线后,所有发往 V4 Pro 的请求都会被路由到 V4.1 Flash、按 Flash 价格计费。平台同步挂出公告、部分客户收到邮件,而按原计划距离切换只有一天左右,没有新旧模型并行的迁移期。36氪

  • 9月10日 12:00:V4.1 Flash 正式发布,网页、App、API 三端同步上线,新价格生效;老 V4 Flash 和 V4 Flash Vision Exp 同日退役,旧模型名只换成临时兼容路由。公告同时把 V4 Pro 的路由切换时间定在 9月14日 12:00,网页端"快速、专家、识图"三个模式则合并为统一"智能模式"。DeepSeek官网微博

  • 9月11日白天:V4.1 Flash 权重在 HuggingFace 开源(第三方材料称 MIT 许可),FP8 精度,权重文件 510GB 左右。知乎

  • 9月11日晚:剧情反转,新通知改为 9 月 14 日后继续提供 V4 Pro API,计费方式不变,“如有变动另行通知”。知乎

  • 9月12日:App 开始灰度语音播报,#DeepSeek开口说话了# 上了话题。而微博、小红书上"还我专家模式"的帖子仍在刷屏。微博

B站 UP 主"究委会"那期《深度求索团队三次变脸,V4Pro活下来了》拿到近14万播放,他自己的置顶总结更扎心:“问题有两个,第一个是三天之内连改三个通知,这对于服务运营商来讲,是非常不严谨,而且是非常影响公司形象的。”哔哩哔哩

为什么"你省钱、我省算力"的好事会被拍桌

单看账本,这事对双方都有利:V4 Pro 占更多算力、速度更慢、价格更高,效果还可能不如新 Flash;把流量转过去,平台释放算力,用户少花钱。但现实是,不少开发者刷到这条浏览量超过 70 万的推文,才意识到自己调用的 V4 Pro 马上要被换掉——DeepSeek 可能觉得,这是一笔很容易算清楚的账。36氪

开发者的反对理由非常具体,总结下来是三条:

  1. 没有缓冲期。生产环境里的 Prompt 是反复调试出来的,摸清了一个模型的"脾气":哪种说法容易被忽略、怎样固定输出格式、工具调用失败怎么重试。换成新模型,平均能力或许更强,但输出结构、拒答边界、工具调用顺序都可能变——聊天窗口里这只是"风格不同",接进上线系统里,少一个字段、多一段解释,后面的程序就可能报错。生产环境里,同一个模型名称背后,连着提示词、输出解析、业务评估、失败重试、延迟预算和 Agent 工作流。有开发者在推文下直接回了四个字:“请不要这样做。”知乎36氪

  2. 没有版本隔离。社区提出的成熟做法是:新旧模型用不同的 model ID,旧模型停服前至少预留两周缓冲期,让下游完成 Prompt、QC 和参数适配、测试通过后再迁移。而"路由"等于同一个模型名背后悄悄换了模型——用知乎一篇分析的话说,API 用户最怕的就是"悄悄换模型"。

  3. 科研复现被掐断。有科研团队正在用 DeepSeek-V4-Pro-0813 做研究、论文还没写完,旧模型一撤,实验条件无法沿用,已有结果难以复现,他们只求保留一个独立端点、哪怕只开一段时间。

海外开发者的嘲讽更直接:“你们真的需要接受一些正规的软件工程培训。”

V4 Pro“死而复生”,专家模式却还没回来:DeepSeek三天三改公告,开发者拍桌“悄悄换模型”逼出撤回——夸或骂梁之前,先理清时间线和新价表,再对号入座四类人

也要说句公道话:这不是 DeepSeek 第一次"不保留旧模型",B站一条 197 赞的评论就指出"deepseek 一直都不保留旧模型的,下线 pro 也在情理之中"——老用户早有预期。哔哩哔哩

而且就在争议前两天,DeepSeek 刚开放约 150 个资深后端和服务端工程师岗位,做的是操作系统、虚拟化、调度、容器和 Agent 弹性计算,几乎都不碰模型训练。模型之下的工程能力它是真肯投,问题出在模型之上:一涉及"用户契约",就退回课题组思维——我们觉得新的更好,那就换。36氪

"究委会"视频评论区一条 1383 赞的高赞把这事看得很透:"证明还是听客户的反馈的,很多用户针对 PRO 适配了工作流,应该是这部分用户反应太强烈了,下架完就白干了。"另一条高赞则补了个背景:DeepSeek 的工作模式与其说像商业公司,不如说像大学课题组——有成果就更新,有问题就解决。享受了小团队的效率,就得忍受小团队的任性。哔哩哔哩

抛开闹剧,V4.1 Flash 本身值不值

先看它凭什么敢叫"全面超越"。这次不是小版本提分,是架构级改动:

  • 552B 总参 MoE,全新 CED(Causal Encoder-Decoder)非对称架构:输入侧每 token 只激活约 8B 参数,输出侧约 16B。按技术报告解读,40 层主干拆成 20 层 Encoder + 20 层 Decoder,长文档、代码库、多轮对话的 prefill 成本大幅下降。DeepSeek官网

  • KV Cache 压到上代 1/4:叠加 CSA2 稀疏注意力和 FP4 量化,全局 KV 约 890 字节/token,官方口径 HBM 需求降为上代 1/4、SSD 降为 1/8——对 Agent 场景,这才是真正的成本开关。微博

  • 原生多模态:图文输入直接进主模型,不再外挂 Vision Exp。

  • 速度:峰值输出 500+ tokens/s,约为 V4 Pro 的 7 倍;社区实测 49k 上下文检索比老 Flash 视觉版快 5.2 倍。

V4 Pro“死而复生”,专家模式却还没回来:DeepSeek三天三改公告,开发者拍桌“悄悄换模型”逼出撤回——夸或骂梁之前,先理清时间线和新价表,再对号入座四类人

跑分要分两半看。Agent/自动化向确实猛:Terminal-Bench 2.1 媒体汇总约 90.6(V4 Pro 87.9)、Automation-Bench 约 54.8(超过 Claude Opus 5 的 50.3)、AiPy 63 项真实任务成功率 93.7%。最扎眼的一组对比是:它全面碾压的是自家 1.6T 总参的前旗舰 V4 Pro。微博知乎

V4 Pro“死而复生”,专家模式却还没回来:DeepSeek三天三改公告,开发者拍桌“悄悄换模型”逼出撤回——夸或骂梁之前,先理清时间线和新价表,再对号入座四类人

但学术硬基准(GPQA Diamond 等)与 GPT-6 Astra、GPT-5.6 Sol 等顶级闭源仍有差距,取两边 benchmark 的交集做对比,差距一眼可见。知乎上甚至有人专门提问,为什么 Artificial Analysis 榜单上它的排行那么低,有分析归因于跨脚手架泛化偏弱。知乎知乎

V4 Pro“死而复生”,专家模式却还没回来:DeepSeek三天三改公告,开发者拍桌“悄悄换模型”逼出撤回——夸或骂梁之前,先理清时间线和新价表,再对号入座四类人

关于"刷分"质疑,技术报告里有个耐人寻味的细节:DeepSeek 用 6 个脚手架家族、8 种配置做了控制变量实验,结果自家 harness 里功能最少的 DSH Minimal 模式,分数反而高于 Standard 和 PTC 模式。换句话说,功能多、流程复杂,并没有自动换来更高成功率;接进 Claude Code 或 Codex,开箱即用的水平就接近峰值。分数和"换个环境还好不好用",是两码事。知乎

再看价格,9 月 10 日 12:00 起生效(元/百万 token):

项目

闲时

高峰

输入·缓存命中

0.02

0.04

输入·缓存未命中

1.0

2.0

输出

4.0

8.0

高峰指工作日 9:00–12:00、14:00–18:00,其余全是闲时、按高峰半价。对比老 Flash:缓存命中 0.05→0.02(降六成)、未命中 1.5→1.0、输出 4.5→4.0。知乎有人点破:除输出外,输入价格等于回归了 8 月 17 日那轮涨价前的水平。缓存命中率高的 Agent 业务,账单会显著低于按输出单价的直觉。微博知乎

但峰谷价是把双刃剑。鱼皮首发实测视频下一条 615 赞热评就是活案例:“用了一下午,速度是真的快。等到晚上的时候突然想到,我去高峰期双倍价格。”哔哩哔哩

C端的账:API 活了,专家模式还没回来

这次撤回只覆盖 API。C 端网页/App 的"快速、专家、识图"合并没有恢复,智能模式会自动判断任务难度、自动开关视觉和思考。但 9 月 12 日的微博和小红书依然是大型索要现场:“deepseek 还我专家模式!!!”“改成会员制也可以啊,我真的很需要专家模式。”微博

受伤最深的是角色扮演/写作圈。小红书一条 186 赞的帖子吐槽取消专家模式以后"冷漠到令人发指!!!写了向着我的人设,然后跟着一起指责我!!!ooc 太严重了。"原生视觉上线后内容审核也跟着收紧,有人的长期项目突然被卡,“坑死我了!支持视觉了我还不知道”。小红书哔哩哔哩

但社区的自救速度也快——9 月 12 日一条"deepseek 新版本仿专家模式指令"拿下 2851 赞、2410 收藏,本质是把专家模式式的叙事规则写成一段系统提示词手动喂回去,比如"核心边界:禁止替用户(xx)作出任何行为、动作描写、发言或决策。禁止杜撰用户未明确描述的过去事件或反应。"小红书

也有好消息:12 日 App 开始灰度语音播报/语音对话。至于文笔,社区评价两极,一条微博说得直白:“V4pro 保留了真是太好了,flash 的文笔是真吃不惯。”微博

开源侧:510GB 权重,普通人是看客,社区是狂欢

权重已上 HuggingFace(deepseek-ai/DeepSeek-V4.1-Flash,附技术报告),官方表态会和开源社区紧密合作做 V4.1-Flash 的推理支持、探索更多部署形态。第三方材料称权重为 MIT 许可,vLLM/SGLang/Transformers 路线可用。DeepSeek官网

但先泼冷水:FP8 原始权重约 510GB,部分 MoE 路由专家已是 FP4,继续向下量化空间很小。想跑满上下文,按知乎实测博主的估算,要准备一台 8 卡 H200 或 16 卡 PPU 的算力服务器,预算 300 万往上;压缩着跑也要 8 张 96GB 的 RTX PRO 6000。知乎

社区动作很快:GGUF Q2 量化版已经出现,MiaAI 已经在 3 台 DGX Spark 上跑起了 DeepSeek-V4.1-Flash。知乎

V4 Pro“死而复生”,专家模式却还没回来:DeepSeek三天三改公告,开发者拍桌“悄悄换模型”逼出撤回——夸或骂梁之前,先理清时间线和新价表,再对号入座四类人

对开源社区,更有价值的可能是 CED 架构本身——发布次日就有人把这套 Encoder-Decoder 分工不重新训练直接移植到 Qwen3-8B 上:原本 36 层 decoder,借用 CED 的分工后,前 18 层 encoder、后 18 层 decoder,prefill 计算量直接减半。KV 压缩、非对称激活这些技巧,正在变成全行业可复用的效率资产。知乎

四类人,对号入座

① 拿 API 跑生产的开发者:V4 Pro 复活且计费不变是喘息,但注意公告原话是"如有变动另行通知"——不是永久承诺。第一件事是模型名:新项目直接用 deepseek-flash,别再依赖旧模型名,v4-flash 和 vision-exp 已退役、旧名只是暂时兼容路由。存量 V4 Pro 项目趁闲时跑回归,重点对比长上下文摘要、工具调用格式、图片 OCR、JSON Schema 输出是否一致;批量和长任务排到闲时,峰谷价差一倍,调度就是钱。做科研复现的,趁 DeepSeek-V4-Pro-0813 端点还在,抓紧备份关键输出。微博

② C 端重度用户(写作/角色扮演/编程):先接受"智能模式"会自动决定思考深度和视觉开关这个现实;怀念专家模式手感的,去抄那段 2851 赞的"仿专家指令"提示词、按自己的场景改;敏感图片上传比以前谨慎;语音播报在灰度,多刷新碰碰运气。想白嫖算力的,腾讯 WorkBuddy 已全量接入 V4.1 Flash。评论区还流传每天登录有积分可领(口径以官方为准)。微博

③ 想本地部署的:消费级单机全量推理不现实,别被"开源了"三个字冲动下单显卡。务实路径:先拿 GGUF Q2 量化版小成本试水、自测质量;或者关注社区基于 CED 思路的中小模型改造;真要为业务私有化,按 8 卡 H200 级别的预算认真立项。

④ 观望等 V4.1 Pro 的:盯四个信号——V4.1 Pro 何时上线(那才是 V4 Pro 真正退役倒计时的重启键);专家模式是否回归或改会员制;Artificial Analysis 等第三方榜单修正口径后 V4.1 Flash 的排位;以及 V4 Pro 会不会再被"另行通知"。

最后说两句

这周最有意思的是反差:模型之下,DeepSeek 的工程能力(3FS 分布式文件系统、单集群并发数十万 Agent 环境的 DSec 沙箱、437 倍的 KV 累计压缩)是行业顶级,还一口气招 150 个后端工程师;模型之上,一次"替你换模型"的决定,差点把用户信任烧穿。InfoQ 那句总结值得所有做软件的公司抄下来:这次争议的核心并非 V4.1 Flash 本身的性能或价格,而是模型切换的决策权。用户可以接受退役、接受迁移,唯独不接受被"悄悄换模型"。往后评价一家模型公司,除了看它能不能把最高分刷上去,也要看它能不能让开发者放心地把业务跑上去。36氪知乎

对咱们用户,教训同样简单:梁子家听劝是好事,但听劝不等于以后不整活。版本承诺这种东西,还是握在自己手里最踏实——该锁版本的锁版本,该跑回归的跑回归,该抄的提示词抄起来。

内容由AI生成

精选参考来源

1. AI早报 2026-09-12 星期六1、DeepSeek V4 Pro API 调用服务将不会下架《科创板日报》获悉,为响应广大用户的需求,DeepSeek决定在2026年9月14日之后继续提供DeepSeekV4Pro的API调用服务

2. 突发!DeepSeek V4.1 Flash 中间版本开启测试“deepseek-v4.1-flash-expires-on-0910”

3. V4.1 Flash全面超越,开发者为何还在喷 DeepSeek:缺的不是能力,是软件工程思维

4. DeepSeek-V4.1-Flash Release

5. #DeepSeek发布V4.1Flash# 这次更新对调用方最大的影响集中在三个时间节点上,按顺序理一遍。9月10日,DeepSeek 发布 V4.1-Flash,新架构家族里最小的模型,原生多模态。想调用最新模型,把模型名改成 deeps

6. DeepSeek V4.1 Flash 开源了,本地部署成本骤降!线上实测!

7. DeepSeek撤回V4 Pro迁移:API用户为什么怕“悄悄换模型”

8. #DeepSeek开口说话了##DeepSeek灰测语音对话# 最近DeepSeek的动作挺多的,先是发布了DeepSeek V4.1 Flash,并且要降价,然后说4.1Flash的能力很强超过了V4Pro,然后要下架V4Pro,后续V4

9. 特梁普的信誉已经换不来一瓶可乐了!深度求索团队三次变脸,V4 Pro 活下来了!AI 界的特朗普诞生了!!!

10. DeepSeek V4.1 Flash 首发实测,吊打自家 Pro 模型?!梁圣回归

11. DeepSeek V4.1 Flash发布解析:非对称新架构、原生多模态、把“Flash”重新做成主力粉丝好,我是文兰公子。2026年9月10日,DeepSeek正式发布V4.1 Flash,网页端、App端、API端同步上线。这不是常规“

12. 为什么Artifical Analysis 的DeepSeek V4.1 Flash排行那么低呢?

13. 怎么看 DeepSeek Flash 系列9月10日将再调整定价,除输出外回归8月17日前价格?

14. DeepSeek取消专家模式以后真的好难用

15. deepseek新版本仿专家模式指令 附例图

16. V4pro保留了真是太好了,flash的文笔是真吃不惯这两天又玩美了,再降降价吧牢梁

17. 怎么看用户把DeepSeek V4.1的CED架构,不需要再次训练就可以直接用到其他模型上提升速度?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章