DeepSeek V4-Flash正式版上线:Agent能力反超自家旗舰

2026-07-31 18:02:09 0点赞 0收藏 0评论
图片图片

7月31日午后,DeepSeek悄悄上线了V4-Flash正式版API。

没有发布会,没有预热。但在开发者圈子里,这条消息的分量不轻——一个激活参数只有130亿的轻量模型,Agent能力跑出了超越自家旗舰V4-Pro预览版的成绩。

图片图片

翻译一下:小的比大的更能干活了。

数据说话

先上硬数据

图片图片

V4-Flash正式版的Agent基准测试成绩:Terminal Bench 2.1拿到82.7分,NL2Repo 54.2,Cybergym 76.7,DeepSWE 54.4,Toolathlon Verified 70.3。

作为对比,V4-Pro预览版在Terminal Bench 2.0上是67.9分。虽然测试集版本不同、不能直接对比,但趋势很明显——一个130亿激活参数的轻量版,在Agent任务上碾压了490亿激活参数的旗舰版。

两者差了接近四倍。

更值得注意的是,官方明确说:模型结构、尺寸和预览版完全一致,仅重新进行了后训练。

没有换架构,没有加参数,没有堆算力。只是换了训练方法,同一个模型就脱胎换骨了。

这件事的意义在于:后训练的优化空间,可能比单纯堆参数更具杠杆效应。

为什么是Agent?

2026年大模型竞争的关键词,毫无疑问是Agent。

不是对话、不是写作、不是画图——是模型自主规划、调用工具、执行复杂任务的能力。

Agent场景有个特点:对推理速度和成本极其敏感。一个需要反复调用工具、多轮推理的任务,用旗舰模型跑一次的成本可能是Flash的十倍甚至几十倍。

Flash的定位很清晰:用十分之一的参数规模,拿到"够用甚至好用"的Agent能力,然后把价格打到地板。

这才是性价比之王的打法。不是每个场景都需要1.6万亿参数的怪兽,大部分Agent应用要的是"又快又便宜还能干活"。

两个更值得注意的信号

除了模型本身,这次更新还有两个信号。

第一,原生支持Responses API格式

这是OpenAI力推的新一代API格式,比传统的Chat Completions更适合Agent场景——更灵活的工具调用、更复杂的多轮交互、更精细的输出控制。DeepSeek原生支持这个格式,意味着开发者可以把基于OpenAI生态开发的Agent应用,几乎零成本地迁移过来。

这是生态层面的正面抢人。

第二,针对性适配了Codex

Codex是OpenAI在代码领域的招牌模型。DeepSeek专门适配它,等于直接在OpenAI的传统优势地带发起挑战。再加上自研的Agent Harness框架首次以正式命名出现,DeepSeek在Agent工具链上的布局已经浮出水面。

梁文锋此前把AGI的实现路径比作爬楼梯:语言模型是第一级,CoT是第二级,Agent是今年的台阶,再往后是持续学习,最后才是自我迭代的"奇点"。

V4-Flash正式版,就是他在Agent这级台阶上的落子。

500亿之后的技术兑现

时间线拉一下。

一个多月前,DeepSeek完成了首轮融资,超500亿人民币,投后估值520亿美元。投资方包括腾讯、宁德时代、京东和多家国资基金。梁文锋本人出资约200亿。

7月中旬,新一轮融资启动,投前估值已跳到710亿美元。从520亿到710亿,间隔不到六周。

高估值意味着高预期。市场押注的不只是模型能力,而是商业化前景。

Flash正式版的上线,可以看作一次技术兑现——我融了这么多钱,现在告诉你这些东西能用。

但真正的考验在后面:V4-Pro正式版何时发布?Agent能力的提升能否转化为实际收入?在OpenAI和Anthropic的夹击下,高性价比路线能跑多远?

结语

这次更新的本质,不是"DeepSeek又发了个新模型",而是大模型竞争逻辑可能正在被改写

过去两年的默认共识是:参数越多、模型越大、能力越强。但V4-Flash正式版用事实证明——在特定任务上,训练方法和数据质量的权重,正在超过参数规模。

130亿激活参数打赢490亿。不是靠堆,是靠练。

这对整个行业是一个信号:Agent时代的竞争力,不一定属于模型最大的那个,而是属于训练最聪明、生态最开放、性价比最高的那个。

Agent战争的大幕刚拉开。DeepSeek选了一个聪明的站位——不当最贵的,当最划算的。

而"最划算"这三个字,在商业化时代,往往是最致命的武器。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松