DeepSeek V4 Pro Agent能力差0.1分逼近全球第一,价格便宜几十倍

2026-08-13 20:05:59 0点赞 1收藏 0评论

8月13日凌晨,DeepSeek官网API文档悄然更新。

DeepSeek V4 Pro正式版上线,模型版本号更新为DeepSeek-V4-Pro-0813。

调用方法不变,使用deepseek-v4-pro即可调用最新版本。

没有发布会,没有预告。

DeepSeek V4 Pro Agent能力差0.1分逼近全球第一,价格便宜几十倍

但一张评测对比表,让整个AI圈炸了。

◆ 差0.1分,追平全球第一

一张评测榜单上两个紧挨着的分数,一条几乎垂直的上升曲线。

这张刷屏的评测表显示,在Terminal Bench 2.1,一项衡量AI智能体在真实终端环境中完成复杂任务能力的测试中,V4 Pro正式版拿到87.9分。

全球第一的Anthropic Fable 5是88.0分。

差距只剩0.1分。

DeepSeek V4 Pro Agent能力差0.1分逼近全球第一,价格便宜几十倍

作为参照,三个月前V4 Pro预览版的成绩是72.1分。

三个月,15.8分的跃升。

更猛的是,在两项专项测试中,V4 Pro甚至反超了Fable 5:

  • CyberGym(AI安全智能体评测):V4 Pro 83.3分 vs Fable 5 83.1分

  • AutomationBench(工作流智能体测试):V4 Pro 31.8分 vs Fable 5 29.1分

潜台词:这不是“接近”,是“在特定维度上已经超过”。尤其是在安全和高难度自动化任务这两个关键场景里,V4 Pro证明了自己不仅能跑分,更能干活。

◇ Agent,才是这次升级的关键词

一个正在干活的机器人,从“聊天”到“干活”的转换路径。

DeepSeek V4 Pro Agent能力差0.1分逼近全球第一,价格便宜几十倍

与传统大模型比拼知识问答和数学推理不同,Terminal Bench、DeepSWE这类测试考察的是AI能不能真正干活,调用工具、执行多步骤任务、编写和修改代码、在长链条中持续推进直到交付结果。

这正是大模型从“聊天玩具”走向“生产工具”的核心门槛。

新版本大幅增强了Agent能力,支持Responses API和Codex接入。

同时支持100万Token上下文窗口、最高38.4万Token单次输出,提供思考与非思考双模式。

潜台词:从“能聊”到“能干”,这一步跨越了多少,看DeepSWE的分数就知道,预览版12.8分,正式版62.7分,接近原来的五倍。这490%的提升,就是Agent能力的含金量。

▶ 价格,才是最锋利的刀

一把价格标签上写着0.87美元的刀,对面是标价50美元的刀。

性能逼近,价格呢?

V4 Pro正式版定价为3元/百万Token输入、6元/百万Token输出,缓存命中输入仅0.025元/百万Token。

作为对比,Anthropic Fable 5的输出定价为50美元/百万Token。按当前汇率计算,V4 Pro的价格只有Fable 5的几十分之一

DeepSeek V4 Pro Agent能力差0.1分逼近全球第一,价格便宜几十倍

跑分差距0.1分,价格差距几十倍。

潜台词:这不是在打价格战,是在重新定义“性能的定价权”。当中国AI模型在关键能力上追到只剩0.1分,而价格只有对手的几十分之一时,全球开发者的技术选型逻辑将被彻底改写。

同夜撞车:梁文锋与马斯克的对垒

就在V4 Pro上线前几个小时,马斯克旗下SpaceXAI发布了Grok 4.6。

两款主打高性能与高性价比的模型,不约而同地将矛头指向同一件事:让AI在长任务中稳定交付可用成果。

目前,Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max为30美元,Grok 4.6为6美元。

而DeepSeek V4 Pro,是0.87美元(永久25折后)。

0.1分的跑分差距背后,是五十七倍的价格鸿沟

潜台词:梁文锋与马斯克同时出牌,真正感到压力的,是OpenAI与Anthropic。当一个性能逼近全球第一的模型,价格只有对手的几十分之一时,单纯靠“性能领先”或“价格低廉”的单一路线,正在同时失效。

还有一个悬念:Harness

除了新模型,业界同样关注DeepSeek Harness的进展。

近期,DeepSeek被发现注册了新账号“DeepSeek Harness团队”。

今年5月,DeepSeek资深研究员陈德里就透露内部正在组建Harness团队,对标Claude Code。

官方曾广招Agent Harness研发工程师和产品经理,目标是让Agent在更多场景下更深入帮助到更多的人。

这次为Harness业务线单独设立官方发布阵地,被外界解读为Harness产品即将正式发布。

老子说,天下难事,必作于易。

把AI从“能聊”变成“能干”,V4 Pro走了一条最难的路。

翻译过来就是:性能追到只差0.1分,价格却只有对手的几十分之一。

全球AI的定价逻辑,正在被重写。

这段适合转给关注AI大模型的朋友看看,当中国AI追到只剩0.1分,价格却只有对手的几十分之一时,全球AI的定价逻辑正在被重写。

写在最后

0.1分的差距,几十分之一的价格。

DeepSeek V4 Pro不是在打价格战,是在重新定义性能的定价权。

当“便宜”不再等于“差一截”,全球AI市场的规则正在被改写。

DeepSeek V4 Pro Agent能力差0.1分逼近全球第一,价格便宜几十倍

榜单之上差零点,性能逼近全球一。
价格碾压几十倍,定价权在悄然移。
Harness悬念待揭晓,Agent战场已开启。
且看中国AI力,改写规则正当时。

✋ 轮到你了

DeepSeek V4 Pro只差0.1分就追上全球第一,价格却只有对手的几十分之一。你觉得这是“性价比之王”的胜利,还是“性能天花板”正在被打破的信号?欢迎在评论区聊聊。

点个赞、点个小心心,让更多人看到:当中国AI追到只剩0.1分,价格却只有对手的几十分之一时,全球AI的定价逻辑正在被重写。

【免责声明】: 本文部分配图源自公开渠道或CC0协议素材,仅作行业交流与产业参考使用。如涉侵权,请联系后台处理。本文仅做行业科普与实操分享,不构成任何投资、消费决策建议。文中数据及案例均来自公开信源,仅供参考,具体以实际为准。

#DeepSeek# #V4Pro# #AI大模型# #Agent# #性价比之王# #人工智能# #国产ai# #大模型# #科技# #AIGC#

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
1
扫一下,分享更方便,购买更轻松