昨天(9月10日)上午,DeepSeek 干了一件它自己以前从没干过的事。
官方宣布新模型 V4.1 Flash"在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro",同时直接给老旗舰排了退役表:9月14日中午12点后,V4 Pro 的 API 下线,所有请求自动路由到 V4.1 Flash,并按 Flash 系列降价后的新单价计费。这是 DeepSeek 产品史上第一次用新模型直接顶替旧旗舰。今日头条今日头条

社区反应分成两派:官宣帖在小红书拿到 2051 赞、757 条评论,字母AI的稿件标题直接喊出了"梁文锋又当回了梁圣"。另一边,有媒体把内测期开发者的吐槽总结成一句话——“速度更快,烧钱也更快了”。今日头条网易智能
我把官宣、基准测试图、第三方实测和内测用户的踩坑记录都翻了一遍。先说结论:对免费用户,这次是白捡的升级;对付费用户,先别急着欢呼或迁移,14日中午之前有几件事要核对。
App和网页党:三个模式没了,但你大概率赚了
普通用户最直观的变化,是官方 App 和网页版原来的"快速、专家、识图"三个对话模式合并了,后续统一由 V4.1 Flash 提供服务。深度思考和搜索也都默认接入,不用再手动挑模式。小红书知乎
担心"合并等于减配"的可以看看实测。这次的变化点有三个:
识图变成了原生能力。之前8月21日上线的 Vision-Exp 版是给纯文本模型"外挂"一个视觉编码器,识图和文字两套路;V4.1 Flash 是图和文从基座模型层就在一起训练的原生多模态。视觉输出的差距肉眼可见——同一道"火箭发射"动画题,老 V4 Flash 画出来还是卡通贴纸风的扁平色块,V4.1 已经能给出像样的发射场构型,点火时烟云铺开;"水族馆"题里,老版那些"鱼"被吐槽是气球,新版终于变成了五颜六色的鱼群。今日头条今日头条
速度是另一个维度的。社区内测实测首字延迟 0.4 秒、输出 344 token/s。转正后媒体实测 427 token/s、峰值 507 token/s。字母AI提到一个极端例子:敲一句"你好",思考 0.3 秒、端到端 0.8 秒出完整回复。更关键的是速度不随上下文变长而衰减,长文档、多轮任务里的体感提升会很明显。哔哩哔哩微信知乎
干成活的比例高了。网易智能给 V4.1 Flash 和老 V4 Flash 布置了三个真实小项目:3D 绕障停车游戏、能下单打折取消的小店、能预约改期导出日历的系统。V4.1 三次交代码都没超过 5 分钟,三套全部通过验收;老版做成了预约系统,但游戏画面做反了、小店查订单出错,折了两道。网易智能

对免费用户,这部分不需要你做任何操作,重新打开 App 就是新版。唯一要适应的是:不用再纠结切哪个模式,图片直接丢进去就行。
"烧钱更快"是笔误读账:单价没涨,反而全面降了
内测那两天(9月8日-9日)最大的争议,是有开发者吐槽"几分钟就花掉10元"。这事是真的,但机制要说清楚:
一是输出快了,单位时间 token 自然多。上手实测的开发者也发现了这个矛盾点:模型输出速度变快,单位时间消耗的 token 变多——每秒三四百 token 往外喷,同样干一分钟活,token 总量比老模型翻几倍。账单变大的第一来源是"它干得快",不是"它卖得贵"。今日头条
二是这代模型主动性很强。有内测用户让它搜个信息,它自己写代码跑测试去了。做视觉 Agent 任务时它还会反复截图、自查、改代码。一位抖音博主跑完整套流程烧掉约 3 亿 token,但因为缓存命中率 99%,实际费用只有 32 元左右。小红书抖音
而转正这天,官方把 API 价格整体下调了。每百万 token 的空闲时段新价格:缓存命中 0.02 元、缓存未命中 1 元、输出 4 元,高峰时段翻倍。对比老 V4 Flash 的空闲 1.5 元输入、4.5 元输出,这次是实打实的下调。而对比 V4 Pro,更是便宜约 77%。知乎网易智能今日头条

所以正确的算法是:重度 Agent 任务确实"吃" token 更快,但单价降了、缓存命中价便宜到近乎白送(0.02 元/百万)。把批量任务挪到闲时、让上下文尽量命中缓存,总账大概率比升级前更低。被"烧钱"吓退之前,先看自己的任务结构。
API和工具链用户:9月14日中午12点前,做完这3件事
第一件:核对你的模型名和业务依赖。如果你的调用还指向 V4 Pro,14日中午后请求会自动切到 V4.1 Flash、按新价计费。对性能满意的话等于纯省钱;但如果你的业务依赖 V4 Pro 的特定输出行为——格式、语气、工具调用习惯——务必在 14 日前自己跑对比测试。官方公告末尾专门留了口子:“如您在对比测试中发现任何问题,请及时向我们反馈”。另外内测用户注意:那个写着 expires-on-0910 的内测模型名已经到期下线,别让它留在你的配置里报错。今日头条小红书
第二件:DSH(DeepSeek Harness)用户升级到 v0.1.5。内测期有个经典坑:DSH 里调用 V4.1 Flash 会提示不支持图片,但模型本身原生就能看图——问题出在 DSH 的模型配置没声明图片输入,有人手把手教你打开 settings.yaml,在 inputModalities 里手动补一行 image 才跑通,这篇教程在小红书拿了 63 赞、96 收藏。与正式版同步发布的 v0.1.5 已经支持 Web 界面上传图片、PDF,而且这次 DSH 是和 V4.1 Flash 深度结合训练的,模型在不同配置下做过专项优化,不用再手改配置文件。小红书知乎
第三件:薅准两周优惠窗口。腾讯系 WorkBuddy、CodeBuddy、OpenCode 成为 V4.1 Flash 官方合作伙伴并已全量接入,其中前两者是"在中国独家联合推出",提供为期两周的上线优惠。本来就在用这些第三方 Agent 工具的,这两周是成本最低的试错窗口。今日头条
冷静部分:"全面超越"没说满的地方
官方基准图里有两项没被重点转发,但你应该知道:
Terminal-Bench 3.0(终端操作类任务):V4.1 Flash 只有 30.0 分,明显低于 Claude Opus 5 的 43.3 和 GPT-5.6 Sol 的 34.4;
GPQA Diamond(研究生级科学问答)、Terminal-Bench 4.0、ProgramBench 等项目,与顶级闭源模型仍有差距。知乎

它拿得出手的是 DeepSWE v1.1(74.2 分,以 0.2 分险胜 Opus 5)、CyberGym(88.1 分)和 Automation-Bench 这类软件工程与自动化任务——正好是 Agent 干活的主战场,但硬核终端操作和深度科学推理不是。抖音
个体实测也印证了这个画像。一位开发者拿它跑完整产品流程:推理题很稳,24 点给出 3 个全对的解法、七位密码锁答案精确命中。但做"浏览器操作系统"时桌面一片空白,压轴的太空设计游戏直接报错跑不起来。今日头条
他的结论一针见血:代码写得再漂亮都没用,用户最在意的还是"能不能跑、能不能给人用"——一到要把完整产品流程跑通的难点,它就会在关键节点掉链子。今日头条
别忘了不久前的教训:V4 Pro 8月13日上线时也是万众期待,结果第三方实测智能指数只有 53 分,仅比便宜三倍的 V4 Flash(50 分)高 3 分,撑不起定价。相关公告还被撤回,有行业追踪直接把 V4.1 Flash 的发布定性为 V4 Pro"翻车"后的补救。这次"全面超越 V4 Pro"有基准图和多方实测背书,可信度更高,但建议你在心里翻译成:在大多数日常对话和 Agent 场景全面超越,顶级难度任务仍需别人。知乎微信
同一周的两个世界:一边卖"AGI",一边卖"普惠"
把时间线拉远一点会更有意思:9月3日,OpenAI 发布 GPT-6 Astra,总裁布洛克曼喊出了"欢迎来到AGI时代"。API 定价输入 10 美元/百万 token、输出 50 美元/百万 token,比上代涨了 2.5 倍。7 天后,DeepSeek 的 V4.1 Flash 官宣稿关键词是"普惠",闲时缓存命中价 0.02 元人民币。只看输出单价:Astra 的 50 美元按当前汇率折合约 356 元/百万 token,V4.1 Flash 闲时 4 元、高峰 8 元——差距在 40 到 90 倍之间。这不是简单的谁强谁弱,而是两条路线:一条把"最强智能"标高价、配严权限卖给愿意付钱的人;另一条把"足够好的智能"压到接近白菜价,让你高频用、放心用。今日头条百家号小红书
对普通工具党,最优解大概率不是站队,而是按任务分配:高频对话、识图、文档处理、办公自动化、轻量编程,交给 DeepSeek,便宜且快;一次都不能失败的硬核项目、复杂终端操作,再考虑顶级闭源订阅。两边的钱都花在刀刃上。
接下来值得盯的三个信号
V4.1 Pro 来不来、什么时候来。官方"路由到 Flash"的承诺以"V4.1 Pro 上线之前"为前提,且按第一财经说法,V4.1 Flash 只是新架构系列里尺寸最小的一款,更大的还在后面。今日头条
App 三模式合并后的真实口碑。尤其原来"专家模式"的深度推理场景,统一到 Flash 后够不够用,评论区的风向值得观察一两周。
14日 V4 Pro 下线后的第一个账单周期。跑重度 Agent 任务的朋友,拿新价格对照自己的总消耗,验证一下"吃得快"和"单价低"到底谁赢。
DeepSeek 这次等于亲手承认了一件事:对绝大多数场景,“够强+够快+够便宜"打得过"最强+最贵”。而用工具的我们,是这场路线之争里稳赚的一方。