昨天(9月10日),DeepSeek 一口气干了两件事,每一件都直接砸在普通用户头上。
第一件,发布了新模型 V4.1 Flash。552B 参数的 MoE 架构,但每次推理读输入只激活 8B 参数、写输出激活 16B——参数堆得大、真干活时用得少,成本和速度就是它的主打。官方口径是综合指标已经全面超过自家上一代旗舰 V4 Pro,并且从 9 月 14 日 12:00 起,API 里 deepseek-v4-pro 的请求会全部路由到 V4.1 Flash、按 Flash 的价格计费。知乎微博

第二件对普通人更有感:网页端和 App 把原来的快速、专家、识图三个模式,合并成了一个"智能模式"。你不用再自己选,模型自动判断这题要不要深度思考、这张图要不要开视觉。关键是,深度思考、文件上传、联网搜索这些功能目前全都免费,没有设付费墙。知乎
然后社区就炸了。知乎"如何评价正式发布的 DeepSeek V4.1 Flash"的问题浏览量已经冲到 340 万以上。排在前面的高赞回答只有一句话:“前面忘了,后面忘了,总之牛逼”。小红书上,一篇拆解第三方评测的笔记发布一天就攒下几百个赞和上百收藏。知乎知乎
最有意思的是这个:两家第三方评测机构同一天出分,结论截然相反。
一、垫底又第一?两份分数考的根本不是同一张卷子
按小红书上那篇逐项核对过两家官网数据的评测笔记:
Artificial Analysis(AA)智力指数:39.5,12 个旗舰模型里垫底,连 GLM-5.3 Flash(41.9)都没打过。极限推理测试 HLE 同样垫底——39.2 分,第一名 Fable 5.1 是 59.1 分。小红书
为什么差这么多?因为两家的考卷完全不一样。
AA 考的是"智力上限":超难综合推理 HLE、物理推理、科研级代码,专挑让模型露馅的题。V4.1 Flash 在这几个分项里几乎全是 12 个模型中的第 11-12 名。一个 Flash 级的小激活模型对全量旗舰,极限推理天然吃亏。小红书

vals.ai 考的是"商业落地":按美国 GDP 结构加权——金融 54%、代码 38%、法律 8%,全是具象工作流:终端实操、从零写 App、表格建模、查法条。不考智力上限,也不罚幻觉。这正好踩中 V4.1 Flash 的长板。小红书

第三方实测的分项也能对上:SaaS 工作流 AutomationBench,12 个模型第 1;SkillsBench agent 技能,全场第 1、领先第 2 名 8 分;从零写 App 排第 6、开源第 2。
知乎上有个高赞回答把它拟人化得很准:V4.1 Flash 是"干活很麻利、会认真钻研、大量试错,但没啥知识储备和直觉的敏捷牛马"。它的价值不是跟顶级模型拼聪明,而是把确定性任务做得又快又便宜——用模型其实就是在做管理,把对的人放在对的位置上。原话是:“谁能拒绝一个几百 token 每秒的干脏活儿的可爱小牛马呢?”知乎
这个拟人还有一组数据支撑,也是普通用户最要防的坑:AA 的知识测试里,V4.1 Flash 准确率 46.4%,中游水平;但在它没答对的题里,"硬编"答案的占比高达 96.5%,12 个模型里最高。翻译一下:它不懂的时候,几乎不会说"我不知道",而是非常自信地编一个像样的答案给你。小红书

另一个提醒:官方宣传 Terminal-Bench 2.1 跑了 90.6 分,第三方在统一环境下实测只有 74.5。这不一定是造假——测试环境和配置差异都会拉开分数——但它说明一件事:不管是官方跑分还是第三方榜单,都别直接当成你自己的上手体验。
二、免费三合一能感知到的,就一个字:快
对不调 API 的普通人来说,这次升级最直观的感受不是跑分,是速度。
知乎有位用户没跑任何基准,直接打开 DeepSeek App,把孩子医院的配镜验光单拍了张照扔进去,问"这些数据和同龄小朋友比大概什么水平"。模型先识图、再联网搜索、再回来作答,一套连招做完,他的总结是:“已经不是我在等 AI 回答了,是 AI 在等我把字看完。”。知乎
速度的实测数字各家不一,有测出 194 token/s 的,也有跑到 300-400 token/s 的,但"快得明显"是共识。三合一还省了另一层事:以前你要自己判断这题用快速模式还是专家模式,现在直接扔进去,模型自己分派。小红书知乎
当然,差评也有。知乎有用户拿它和 Gemini Flash 3.8 对比,认为 V4.1 Flash “还是上一代的手感——不说人话、目光短浅、注意力狭窄、没有大局观”,Gemini Flash 3.8 才是目前最强的 Flash。小红书也有老用户吐槽 DeepSeek 更新后"越来越自以为是",想找同样能深度分析的免费替代。这些体验也不是错觉——它们和跑分指向的是同一件事:这个模型的技能点全加在了速度、成本和执行力上,没加在对话质感和知识深度上。知乎<#&!53#&!>小红书
三、任务分派表:什么交给0元、什么留个心眼、什么还值得掏钱
结合评测分项和社区实测,如果你也在收藏夹里囤过一堆 AI 工具、也有一份正在犹豫续不续的会员,可以先把你的任务对号分进这四个桶。
第一桶:直接交给免费三合一,一分钱不用花
识图问答:化验单、配镜单、合同、外文菜单、报错截图,拍进去让它识图+联网+作答,这是目前它最完整的连招
日常写作、润色、翻译、出初稿、头脑风暴
确定性小任务:总结这篇、提取要点、改成清单、批量套格式
知乎有位做了三年 AI 产品的作者,“测了 20 多个 AI 工具,最后留下的不到 5 个”。囤工具这个毛病,治法就一条:先把免费入口用满两周,再看哪些任务还卡着,卡着的才值得花钱。知乎
第二桶:可以用,但必须留个心眼
事实查询、数据引用、行业结论:96.5% 的硬编率在提醒你,凡是要拿去用的事实,务必逐条核对来源
重要文档、对外正式内容:AI 出初稿,人核事实和立场
简单原则:这个任务越允许"差不多",越能放手给它;越会被别人较真核查,越要自己过一遍。
第三桶:别指望它,找专业工具
生图、生视频、配音、PPT 一键排版、重度编程 Agent——这些各有一批专业工具,任何一个聊天入口都替代不了全部。这也是"为什么三合一了也不能把别的工具全删"的答案:它统一的是入口,不是能力边界。
第四桶:仍然值得掏钱的场景
极限推理、学术级深度问题:AA 那份垫底成绩单告诉你,这恰恰是免费 Flash 的短板
长文写作、对文笔和"人味"要求高的活儿:差评实测集中吐槽的就是这里
重度编程、高峰期优先额度、更大上下文:会员价值要按自己的用量算
知乎有个高赞判断标准很实用:如果一个月只用两三百元的 API,上千元的会员当然不划算;只有当付费用量接近甚至超过会员价格、且每天都稳定在用,会员才有意义。把这个标准换成你自己的数字,套进去算一遍。知乎
四、三个提醒,都和钱有关
1. 免费不等于永远,但也别为焦虑囤会员。"三合一是为收费做准备"是目前社区的主流猜测:今年 4 月专家模式上线时,入口就挂过类似"钻石"的付费标识。业内观点认为,统一入口是统一付费体系的前置条件——三种模式三种体验没法统一定价,合并后才能按用量或高级功能做订阅。但截至目前,网页端和 App 没有上线任何订阅或付费墙,深度思考、文件上传、联网搜索全部免费。合理姿势是:福利窗口期现在就用,等真出了收费方案再决策。可以参考豆包现在的结构:官方承诺免费版基础功能永久保留,付费专业版是三档增值(据公开整理为每月 68 / 200 / 500 元)。"免费打底 + 付费增值"大概率是国内的主流结构,直接全免费转全收费并不是常态。知乎
2. 用 API 或第三方工具调 deepseek-v4-pro 的,注意 9 月 14 日中午切换。之后 V4 Pro 请求自动转 V4.1 Flash,按 Flash 价格计费:闲时输入缓存命中 0.02 元、未命中 1 元、输出 4 元,高峰时段全线翻倍(单位:元/百万 token)。对多数人是降价利好,但如果你的自动化工作流依赖 V4 Pro 的输出风格,切换前先做对比回归。另外,缓存命中和未命中的输入价差 50 倍,长上下文、多轮调用的 Agent 类任务,能省多少全看缓存命中率。36氪微博

3. 别花钱报课。每次大模型更新,都会冒出一批"7 天精通新版 DeepSeek"的速成课。小红书上已经有大量"免费 AI 工具够用了,别再交智商税"的过来人帖。这次三合一把使用门槛降到了近乎零——连模式都不用选,拍张照、打一行字就能用。一个不需要选择困难症的免费入口,不需要一万多的研学营来教你。小红书
最后,四个待观察信号
DeepSeek 网页端 / App 会不会出现付费订阅入口——"三合一"变"收费"的那天,上面这张任务分派表要重新算
V4.1 Pro 的上线时间:官方发布文案写明"至未来 V4.1 Pro 上线之前",V4 Pro 请求才临时路由到 Flash,说明真正的旗舰还在后面。知乎
社区对写作能力、"人味"的后续实测——目前的差评集中在发布后 48 小时,样本还小
AA 和 vals.ai 更新题库后,两份相反的分数会不会收敛
一句话总结:V4.1 Flash 这波的真实定位是"考智力垫底、干活第一"。对普通用户,它既不是让你退掉所有会员的理由,也不是继续无脑续费的理由——先把任务分进对的桶里,免费的用满,卡住的那部分再掏钱。