DeepSeek V4-Flash上线,Agent任务成本降至3美分平民化时代来了

2026-08-01 00:56:41 0点赞 0收藏 0评论

七月的最后一天,北京刚送走一场暴雨。比天气更让开发者圈躁动的,是DeepSeek官方API文档里一条不起眼的更新日志。

没有发布会、没有预热、没有梁文锋的演讲,DeepSeek-V4-Flash正式版API就这么悄然上线公测了

DeepSeek V4-Flash上线,Agent任务成本降至3美分平民化时代来了

“正式版”和“公测”两个词同时出现,说明这还不是V4的最终形态。

但这次更新释放的信号,足以让整个行业重新审视一个问题:到了Agent阶段,我们需要的究竟是一个能力最强的模型,还是一个足够强、足够快、也足够便宜的模型?

◆ 一份“反常识”的成绩单

DeepSeek官方一口气亮出了9项基准测试的完整成绩。

Terminal Bench 2.1 82.7分,这意味着模型在终端环境下的任务执行能力已经相当成熟,能够理解复杂的命令行操作、编写脚本、调试错误,几乎是“AI运维工程师”级别的表现。

DeepSeek V4-Flash上线,Agent任务成本降至3美分平民化时代来了

Cybergym 76.7分,展示了出色的网络安全对抗能力。Toolathlon Verified 70.3分。内部全栈开发测试DSBench-FullStack达到68.7,高难度编码测试DSBench-Hard拿下59.6

潜台词:这不是一个“能写代码”的模型,这是一个“能像工程师一样工作”的模型,打开终端、分析仓库、调用工具、完成端到端任务。

更令人惊讶的是,跑出这些分数的模型,总参数2840亿,激活参数仅130亿。而三个月前发布的V4-Pro预览版,总参数1.6万亿,激活参数490亿。

Flash用不到Pro三分之一的激活参数,在Agent能力上实现了对自家Pro预览版的全面反超。

海外模型评测机构Artificial Analysis在7月31日更新的智能指数测试中,给予V4-Flash-0731(最高推理档位)50分,比4月的原版V4-Flash高出10分,比V4-Pro预览版还高出6分。在同类可比模型中明显高于平均水平,可比模型的中位数仅为17分。

在性价比曲线上,它已经冲进了“帕累托前沿”,用最低的成本拿到了最高的智能分数。

◆ “后训练”的魔法:不换发动机,只调变速箱

DeepSeek官方在更新日志中明确表示:“DeepSeek-V4-Flash-0731的模型结构、尺寸和DeepSeek-V4-Flash-preview保持一致,仅重新进行了后训练。”

雷锋网用一个比喻精准概括了这次升级的本质:“这有点像同一辆车没有更换发动机,却重新调整了变速箱、控制系统和驾驶策略。”

换句话说,底座没变,变的是“后天教育”。

DeepSeek V4-Flash上线,Agent任务成本降至3美分平民化时代来了

过去,大模型公司的主要竞争发生在预训练阶段,谁有更多算力、更多数据,谁就有机会训练出参数更大、知识更多的模型。但进入Agent阶段后,模型能力不再完全由预训练决定。

一个模型会不会使用终端,能不能在数百次交互中维持任务状态,遇到错误后能否修正,以及是否知道什么时候应该调用什么工具,这些能力越来越依赖后训练、强化学习和模型外部的执行框架。

V4-Flash的变化,恰好说明了这一点

这也意味着,目前公布的这些成绩不完全属于模型本身,而是属于“模型、推理预算与Harness”共同组成的系统。DeepSeek在测试Code Agent任务时,使用了尚未正式发布的DeepSeek Harness极简模式。这个细节暗示,DeepSeek可能在Agent框架层面也做了针对性优化,而非仅仅是模型本身的提升。

潜台词:大模型的竞争,正在从“拼预训练算力”转向“拼后训练工程能力”。参数规模的决定性权重,正在被训练方法和数据质量稀释。

◆ Agent时代的“价格屠刀”

如果说技术参数是DeepSeek的“面子”,那定价策略就是它的“里子”。

DeepSeek官方API文档显示,V4-Flash的输出价格为每百万Token 0.28美元。而Kimi K3的输出价格为每百万Token 15美元,相差超过50倍

即便是与GLM-5.2相比,V4-Flash也便宜了一个数量级。雷锋网指出,和刚降价过的GPT-5.6 Luna对比,V4-Flash的终端操作、代码修复、工具执行和自动化流程这几个项目已经足以和GPT-5.6 Luna放进同一轮POC了,但价格还是DeepSeek更便宜

如果按约99%的缓存命中率计算,V4-Flash平均每项任务的成本约为0.03美元

3美分干一个Agent任务。 这个价格,让“试错”从奢侈变成日常。

翻译过来就是:当Agent任务的成本从“一杯咖啡”降到“一颗糖”,AI Agent就不再是巨头的专利,而是每个开发者都能玩得起的工具。

◆ 一个“反Pro”的商业逻辑

这次更新最值得玩味的地方,在于DeepSeek打破了行业惯常的“Pro强、Flash弱”分层逻辑。

V4-Pro负责能力上限,V4-Flash负责效率。在DeepSeek的原始定位里,参数规模更大的V4-Pro在世界知识以及高难度Agent任务上表现更好;V4-Flash则可以通过增加思考预算,在部分推理任务上接近Pro。

DeepSeek V4-Flash上线,Agent任务成本降至3美分平民化时代来了

但7月31日的后训练,让Flash在Agent这个具体赛道上跑到了Pro前面。

这意味着什么?

意味着在Agent这个场景里,“参数大”不一定代表“能力强”。Agent任务对推理速度和成本的敏感度远高于纯对话场景。一个需要反复调用工具、多轮推理的Agent任务,如果用旗舰模型跑,成本可能是Flash的数倍甚至数十倍。

如果Flash能在Agent能力上达到“够用甚至好用”的水平,其性价比优势将极具杀伤力

这或许才是DeepSeek真正的战略意图:用高性价比的轻量模型切入Agent应用市场。

◆ 生态暗战:Responses API与Codex的“兼容牌”

除了基准成绩的飞跃,正式版V4-Flash在工程适配上也有重要更新,原生支持Responses API格式,并针对性适配了Codex

Responses API是OpenAI力推的新一代API格式,相比传统的Chat Completions,它更适合Agent场景,支持更灵活的工具调用、更复杂的多轮交互以及更精细的输出控制。对Codex的适配,则瞄准了代码生成与软件开发这一垂直场景。

现在,开发者可以在Codex CLI、ChatGPT桌面端和VS Code的Codex插件中,将DeepSeek配置为模型提供方。

潜台词:DeepSeek不是在做一个“替代品”,而是在做“兼容层”,让OpenAI生态的开发者可以零成本切换到DeepSeek。这是一场生态层面的正面交锋。

◆ 开发者社区的“用脚投票”

在GitHub、知乎、即刻等社区,V4-Flash的讨论热度正在快速攀升。

美国方面,Replit CEO Amjad Masad称赞V4的注意力压缩和长上下文效率提升属于真正的架构创新。Reddit和Hacker News上,开发者对1M上下文开源模型和MIT许可证反应积极,但多数人采取“先测再说”的观望态度。

不过,也有开发者指出了V4-Flash的痛点,缓存命中率偏低(40-50%,而V4-Pro在90%以上)、安全分类器超时、工具调用后返回空响应等问题,直接影响了开发体验和生产成本

潜台词:性价比是入场券,但稳定性和体验才是留存的关键。DeepSeek的“后训练奇迹”能否转化为开发者生态的真正繁荣,还需要时间的检验。

◆ 500亿融资之后:一场不能输的仗

这次更新距离DeepSeek完成首轮外部融资不到两个月。

今年6月,DeepSeek完成首轮外部融资,募资总额超500亿元人民币,投后估值约500亿美元,创下中国AI行业单轮融资纪录。梁文锋本人出资200亿元,腾讯、宁德时代等跟投。

高估值背后,是市场对DeepSeek商业化能力的极高期待。Flash正式版的上线,是资本加持下的第一次技术兑现

而这场Agent战争的更大背景是,2026年的大模型付费逻辑正在发生变化,2025年用户只认免费开源,极少人为API付费;到2026年,模型能力跨过生产力临界点,Token消耗指数级上涨,国产算力规模化落地,API付费逻辑正式成立

潜台词:从“免费开路”到“API收费”,DeepSeek正在走一条所有开源商业化公司都必须走的路。Flash的性价比,就是它在这个转折点上最锋利的武器。

◆ 全球AI棋局中的“中国变量”

如果说V4-Flash的技术突破是“里”,那它引发的全球连锁反应就是“表”。

就在DeepSeek更新的前一天,7月28日,英伟达CEO黄仁勋亲赴华盛顿,密集会见多位国会议员及商务部长,力陈开放权重模型对美国AI产业安全与竞争力的战略价值。

据彭博社报道,特朗普政府和国会正在努力应对中国AI初创公司月之暗面旗下开源模型Kimi K3所带来的挑战。而DeepSeek V4系列,则是另一个让硅谷无法忽视的“中国变量”。

黄仁勋在X上发帖重申:“开放的模型能够增强安全与网络安全,加速创新和传播,并促进主权。”他警告,政府应避免“对开源模型施加过早限制,进而扼杀竞争或将创新推向海外”。

潜台词:当中国模型能以极低成本实现接近顶尖闭源模型的性能,美国企业将面临两难选择,选择闭源则成本高昂,选择开源则面临被中国模型“卡位”的风险。DeepSeek V4-Flash的“极致性价比”,已经在这场博弈中投下了关键一票。

◆ 结语:Agent时代的“平民化”序幕

2026年7月31日,是值得被记住的一天。

不是因为DeepSeek V4-Flash超越了谁,而是因为它证明了:在AI的世界里,“参数”不是一切,“效率”才是王道。

如果说2023年的大模型竞争是“拼通用能力”,2024年是“拼长上下文”,那么2026年的关键词,毫无疑问是Agent

而Agent战争的第一枪,DeepSeek用130亿激活参数、0.28美元/百万Token、50分的智能指数,打出了“平民化”的鲜明旗帜。

后训练精调出奇迹,百亿参数破万重关。
三美分办成天下事,Agent从此入民间。

当Kimi K3还在以2.8万亿参数和15美元/百万Token的价格定义“高端”,当GLM-5.2还在以7440亿参数和百万级上下文定义“长程”,DeepSeek V4-Flash用“后训练优化”这把手术刀,精准切开了“成本-性能”的死结。

DeepSeek V4-Flash上线,Agent任务成本降至3美分平民化时代来了

它让AI Agent不再只是科技巨头的“烧钱游戏”,而是变成了每个开发者、每个企业都可以“玩得起”的工具。

窗口期正在以月为单位快速关闭。

谁先完成从“拼参数”到“拼落地”的转身,谁就站在了下一个时代的起跑线上。

至于开发者,那个3美分就能跑一个Agent任务的时代,已经开始了。

写在最后

从V4-Pro的1.6万亿参数到Flash的130亿激活参数,从490亿到13B,DeepSeek用一次“后训练”证明:在Agent时代,效率比规模更重要。当Kimi K3还在以15美元/百万Token定义“高端”,Flash已经用0.28美元把Agent任务成本打到了3美分。这不是参数的胜利,这是工程智慧的胜利。

大模型竞逐何所惧,后训练精调定乾坤。
三美分跑完Agent路,开发者从此笑开颜。

来聊聊

如果DeepSeek V4-Flash的API价格降到0.1美元/百万Token,你会用它做什么?欢迎在评论区分享你的“脑洞”!

【免责声明】: 本文部分配图源自公开渠道或CC0协议素材,仅作行业交流与产业参考使用。如涉侵权,请联系后台处理。本文仅做行业科普与实操分享,不构成任何投资、消费决策建议。文中数据及案例均来自公开信源,仅供参考,具体以实际为准。

#DeepSeekV4# #AI大模型# #Agent# #后训练优化# #国产大模型# #AI开发者# #开源模型#

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松