两家评测同日出分截然相反、知乎340万浏览吵翻:DeepSeek免费“三合一”上线,为AI掏钱前先看这张任务分派表

源自105位全网作者

01:52

昨天(9月10日),DeepSeek 一口气干了两件事,每一件都直接砸在普通用户头上。

第一件,发布了新模型 V4.1 Flash。552B 参数的 MoE 架构,但每次推理读输入只激活 8B 参数、写输出激活 16B——参数堆得大、真干活时用得少,成本和速度就是它的主打。官方口径是综合指标已经全面超过自家上一代旗舰 V4 Pro,并且从 9 月 14 日 12:00 起,API 里 deepseek-v4-pro 的请求会全部路由到 V4.1 Flash、按 Flash 的价格计费。知乎微博

两家评测同日出分截然相反、知乎340万浏览吵翻:DeepSeek免费“三合一”上线,为AI掏钱前先看这张任务分派表

第二件对普通人更有感:网页端和 App 把原来的快速、专家、识图三个模式,合并成了一个"智能模式"。你不用再自己选,模型自动判断这题要不要深度思考、这张图要不要开视觉。关键是,深度思考、文件上传、联网搜索这些功能目前全都免费,没有设付费墙。知乎

然后社区就炸了。知乎"如何评价正式发布的 DeepSeek V4.1 Flash"的问题浏览量已经冲到 340 万以上。排在前面的高赞回答只有一句话:“前面忘了,后面忘了,总之牛逼”。小红书上,一篇拆解第三方评测的笔记发布一天就攒下几百个赞和上百收藏。知乎知乎

最有意思的是这个:两家第三方评测机构同一天出分,结论截然相反。

一、垫底又第一?两份分数考的根本不是同一张卷子

按小红书上那篇逐项核对过两家官网数据的评测笔记:

  • Artificial Analysis(AA)智力指数:39.5,12 个旗舰模型里垫底,连 GLM-5.3 Flash(41.9)都没打过。极限推理测试 HLE 同样垫底——39.2 分,第一名 Fable 5.1 是 59.1 分。小红书

  • vals.ai 指数:57.9,开源模型第一,还反超了 Kimi K3。

为什么差这么多?因为两家的考卷完全不一样。

AA 考的是"智力上限":超难综合推理 HLE、物理推理、科研级代码,专挑让模型露馅的题。V4.1 Flash 在这几个分项里几乎全是 12 个模型中的第 11-12 名。一个 Flash 级的小激活模型对全量旗舰,极限推理天然吃亏。小红书

两家评测同日出分截然相反、知乎340万浏览吵翻:DeepSeek免费“三合一”上线,为AI掏钱前先看这张任务分派表

vals.ai 考的是"商业落地":按美国 GDP 结构加权——金融 54%、代码 38%、法律 8%,全是具象工作流:终端实操、从零写 App、表格建模、查法条。不考智力上限,也不罚幻觉。这正好踩中 V4.1 Flash 的长板。小红书

两家评测同日出分截然相反、知乎340万浏览吵翻:DeepSeek免费“三合一”上线,为AI掏钱前先看这张任务分派表

第三方实测的分项也能对上:SaaS 工作流 AutomationBench,12 个模型第 1;SkillsBench agent 技能,全场第 1、领先第 2 名 8 分;从零写 App 排第 6、开源第 2。

知乎上有个高赞回答把它拟人化得很准:V4.1 Flash 是"干活很麻利、会认真钻研、大量试错,但没啥知识储备和直觉的敏捷牛马"。它的价值不是跟顶级模型拼聪明,而是把确定性任务做得又快又便宜——用模型其实就是在做管理,把对的人放在对的位置上。原话是:“谁能拒绝一个几百 token 每秒的干脏活儿的可爱小牛马呢?”知乎

这个拟人还有一组数据支撑,也是普通用户最要防的坑:AA 的知识测试里,V4.1 Flash 准确率 46.4%,中游水平;但在它没答对的题里,"硬编"答案的占比高达 96.5%,12 个模型里最高。翻译一下:它不懂的时候,几乎不会说"我不知道",而是非常自信地编一个像样的答案给你。小红书

两家评测同日出分截然相反、知乎340万浏览吵翻:DeepSeek免费“三合一”上线,为AI掏钱前先看这张任务分派表

另一个提醒:官方宣传 Terminal-Bench 2.1 跑了 90.6 分,第三方在统一环境下实测只有 74.5。这不一定是造假——测试环境和配置差异都会拉开分数——但它说明一件事:不管是官方跑分还是第三方榜单,都别直接当成你自己的上手体验。

二、免费三合一能感知到的,就一个字:快

对不调 API 的普通人来说,这次升级最直观的感受不是跑分,是速度。

知乎有位用户没跑任何基准,直接打开 DeepSeek App,把孩子医院的配镜验光单拍了张照扔进去,问"这些数据和同龄小朋友比大概什么水平"。模型先识图、再联网搜索、再回来作答,一套连招做完,他的总结是:“已经不是我在等 AI 回答了,是 AI 在等我把字看完。”。知乎

速度的实测数字各家不一,有测出 194 token/s 的,也有跑到 300-400 token/s 的,但"快得明显"是共识。三合一还省了另一层事:以前你要自己判断这题用快速模式还是专家模式,现在直接扔进去,模型自己分派。小红书知乎

当然,差评也有。知乎有用户拿它和 Gemini Flash 3.8 对比,认为 V4.1 Flash “还是上一代的手感——不说人话、目光短浅、注意力狭窄、没有大局观”,Gemini Flash 3.8 才是目前最强的 Flash。小红书也有老用户吐槽 DeepSeek 更新后"越来越自以为是",想找同样能深度分析的免费替代。这些体验也不是错觉——它们和跑分指向的是同一件事:这个模型的技能点全加在了速度、成本和执行力上,没加在对话质感和知识深度上。知乎<#&!53#&!>小红书

三、任务分派表:什么交给0元、什么留个心眼、什么还值得掏钱

结合评测分项和社区实测,如果你也在收藏夹里囤过一堆 AI 工具、也有一份正在犹豫续不续的会员,可以先把你的任务对号分进这四个桶。

第一桶:直接交给免费三合一,一分钱不用花

  • 识图问答:化验单、配镜单、合同、外文菜单、报错截图,拍进去让它识图+联网+作答,这是目前它最完整的连招

  • 日常写作、润色、翻译、出初稿、头脑风暴

  • 确定性小任务:总结这篇、提取要点、改成清单、批量套格式

知乎有位做了三年 AI 产品的作者,“测了 20 多个 AI 工具,最后留下的不到 5 个”。囤工具这个毛病,治法就一条:先把免费入口用满两周,再看哪些任务还卡着,卡着的才值得花钱。知乎

第二桶:可以用,但必须留个心眼

  • 事实查询、数据引用、行业结论:96.5% 的硬编率在提醒你,凡是要拿去用的事实,务必逐条核对来源

  • 重要文档、对外正式内容:AI 出初稿,人核事实和立场

简单原则:这个任务越允许"差不多",越能放手给它;越会被别人较真核查,越要自己过一遍。

第三桶:别指望它,找专业工具

生图、生视频、配音、PPT 一键排版、重度编程 Agent——这些各有一批专业工具,任何一个聊天入口都替代不了全部。这也是"为什么三合一了也不能把别的工具全删"的答案:它统一的是入口,不是能力边界。

第四桶:仍然值得掏钱的场景

  • 极限推理、学术级深度问题:AA 那份垫底成绩单告诉你,这恰恰是免费 Flash 的短板

  • 长文写作、对文笔和"人味"要求高的活儿:差评实测集中吐槽的就是这里

  • 重度编程、高峰期优先额度、更大上下文:会员价值要按自己的用量算

知乎有个高赞判断标准很实用:如果一个月只用两三百元的 API,上千元的会员当然不划算;只有当付费用量接近甚至超过会员价格、且每天都稳定在用,会员才有意义。把这个标准换成你自己的数字,套进去算一遍。知乎

四、三个提醒,都和钱有关

1. 免费不等于永远,但也别为焦虑囤会员。"三合一是为收费做准备"是目前社区的主流猜测:今年 4 月专家模式上线时,入口就挂过类似"钻石"的付费标识。业内观点认为,统一入口是统一付费体系的前置条件——三种模式三种体验没法统一定价,合并后才能按用量或高级功能做订阅。但截至目前,网页端和 App 没有上线任何订阅或付费墙,深度思考、文件上传、联网搜索全部免费。合理姿势是:福利窗口期现在就用,等真出了收费方案再决策。可以参考豆包现在的结构:官方承诺免费版基础功能永久保留,付费专业版是三档增值(据公开整理为每月 68 / 200 / 500 元)。"免费打底 + 付费增值"大概率是国内的主流结构,直接全免费转全收费并不是常态。知乎

2. 用 API 或第三方工具调 deepseek-v4-pro 的,注意 9 月 14 日中午切换。之后 V4 Pro 请求自动转 V4.1 Flash,按 Flash 价格计费:闲时输入缓存命中 0.02 元、未命中 1 元、输出 4 元,高峰时段全线翻倍(单位:元/百万 token)。对多数人是降价利好,但如果你的自动化工作流依赖 V4 Pro 的输出风格,切换前先做对比回归。另外,缓存命中和未命中的输入价差 50 倍,长上下文、多轮调用的 Agent 类任务,能省多少全看缓存命中率。36氪微博

两家评测同日出分截然相反、知乎340万浏览吵翻:DeepSeek免费“三合一”上线,为AI掏钱前先看这张任务分派表

3. 别花钱报课。每次大模型更新,都会冒出一批"7 天精通新版 DeepSeek"的速成课。小红书上已经有大量"免费 AI 工具够用了,别再交智商税"的过来人帖。这次三合一把使用门槛降到了近乎零——连模式都不用选,拍张照、打一行字就能用。一个不需要选择困难症的免费入口,不需要一万多的研学营来教你。小红书

最后,四个待观察信号

  • DeepSeek 网页端 / App 会不会出现付费订阅入口——"三合一"变"收费"的那天,上面这张任务分派表要重新算

  • V4.1 Pro 的上线时间:官方发布文案写明"至未来 V4.1 Pro 上线之前",V4 Pro 请求才临时路由到 Flash,说明真正的旗舰还在后面。知乎

  • 社区对写作能力、"人味"的后续实测——目前的差评集中在发布后 48 小时,样本还小

  • AA 和 vals.ai 更新题库后,两份相反的分数会不会收敛

一句话总结:V4.1 Flash 这波的真实定位是"考智力垫底、干活第一"。对普通用户,它既不是让你退掉所有会员的理由,也不是继续无脑续费的理由——先把任务分进对的桶里,免费的用满,卡住的那部分再掏钱。

内容由AI生成

精选参考来源

1. DeepSeek V4.1 Flash 正式发布:更快、更强、更便宜

2. 如何评价正式发布的DeepSeekV4.1Flash?

3. 如何评价正式发布的DeepSeekV4.1Flash?

4. DeepSeek把此前的三种模式又合并在一起了,是为收费做准备吗?

5. Deepseek v4.1 Flash最新第三方独立评测

6. 为什么ArtificalAnalysis的DeepSeekV4.1Flash排行那么低呢?

7. Deepseek三合一上线网页端,V4.1 Flash在性能和应用上都有哪些提升?大家都有什么感受?

8. 如何评价新发布的DeepSeek V4.1 Flash模型?

9. 越来越讨厌他的说话方式了…

10. 我测了20多个AI工具,最后留下的不到5个

11. 目前使用AI是直接买会员还是调用API 划算?

12. #DeepSeekV4.1Flash发布# DeepSeek今天发了V4.1 Flash。552B参数的MoE,用了个新的Causal-Encoder-Decoder结构,输入输出不对称:输入激活8B,输出激活16B。参数堆得大,真干活时用的少,成本就下来了。然后是,把他们自家的V4 Pro干掉了。官方说在性能、费用、速度、总用时上全面超越V4 Pro。所以9月14号之后,访问V4 Pro的请求全部路由到V4.1 Flash,按Flash的价格计费。当然价格是重点。输出4块/百万token,缓存命中0.02元,闲时一律半价。加上KV Cache比初代压缩了437倍、对HBM的需求降到四分之一,跑Agent和长上下文的人,会实惠很多。另外,原生多模态视觉,模型名统一成deepseek-flash,旧名字暂时兼容路由过去,迁移成本基本为零。腾讯WorkBuddy、CodeBuddy和OpenCode已经全量接入。我在Lobster上也已经在用了。以前是小模型又快又便宜,但不够聪明。现在是最小的那个最便宜,还比旗舰聪明。梁圣又要卷了。

13. DeepSeek V4.1 Flash 正式发布,552B 参数的大模型,每次推理却只唤醒 8B 的输入激活、16B 的输出激活,读便宜、写稍贵,成本算到了每一层。基准测试里它甚至超过了自家旗舰 V4 Pro,价格却走平民路线,旗舰负责秀肌肉,Flash 负责铺量。真正值得玩味的是定价表。缓存命中的输入只要 0.02 元每百万 Token,未命中要 1 元,同一批 Token 差价 50 倍。配合 KV Cache 缩到初代的 1/437,官方等于在明说:Agent 时代记忆越复用越便宜,反复调用上下文才是常态。这套组合拳的信号很清晰:DeepSeek 在赌多模态和 Agent 会吃掉海量高频调用,谁把缓存成本打下来,谁就拿到下一轮流量入口。国产与海外的模型差距或许还在,但价格战的主动权,已经换了主人。#DeepSeekV4.1Flash发布#

14. 刚刚,DeepSeek新模型上线,长文本缓存硬盘占用暴降88%

15. 免费AI工具够用了,别再交智商税…

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章