V4 Pro跑分逼近Fable 5实测翻车,过拟合锁性能社区已解锁

源自460位全网作者

08-16 00:36

内容由AI生成

精选参考来源

1. 首发体验 | DeepSeek Harness 来了,它不想做下一个Codex

2. DeepSeek Harness 入选项目疑似曝光,不选万星「花瓶」,死磕 Agent 基建

3. 突发 | DeepSeek V4 Pro 上线,逼近 Fable 5

4. DeepSeek Harness,是今年最有野心的一次Agent开源

5. AI斩杀线更新!DeepSeek V4 Pro正式版发布,马斯克成最大受害者

6. 别只说“国产大模型追平了”。DeepSeek-V4-Pro 这次不是追,是在 Agent 赛道局部超车——Cybergym、AutomationBench 直接干翻 Opus-4.8 与 Fable 5,DeepSWE 从 12.8 飙到 62.7,是质变不是挤牙膏。这事跟你有关:DeepSeek 本来就人人免费用。你不用懂 benchmark,只要知道,以后让它跑复杂任务、自动干活,顺太多。顶级 Agent 能力,不再锁在付费墙后。我们这代人挺幸运——最好的工具,正从贵到用不起变成国产的、免费的、还更强。技术平权真发生,爽的不只是极客,是每个想省力的普通人。#DeepSeek发布V4Pro正式版#

7. 【#中美大模型价差正在收窄#】#DeepSeekV4Pro与Grok4.6对比#8月12日,DeepSeek与马斯克旗下SpaceXAI同日发布新模型DeepSeek-V4-Pro和Grok 4.6,新一轮大模型竞争再次升温。从最新评测来看,两款模型均进一步逼近全球头部水平。其中,DeepSeek-V4-Pro在多项智能体相关测试中超过Anthropic的Claude Opus 4.8;Grok 4.6则在Artificial Analysis智能指数中追平OpenAI旗舰模型GPT-5.6 Sol。能力差距缩小的同时,中美大模型之间悬殊的价格差距也在发生变化。摩根士丹利最新研报显示,中国大模型API平均价格过去一年明显上涨,而美国闭源模型价格近期持续下降,中美大模型价格差距正在收窄。摩根士丹利指出,中国大模型市场的竞争重点正在从“价格战”转向“智力战”。(每经)

8. #DeepSeekV4Pro和Grok4.6谁更强#8月12日DeepSeek V4 Pro与Grok 4.6 两款旗舰大模型同步上线,二者定位还是存在明显差异的。国产DeepSeek V4 Pro主打智能体实操,终端控制、安全测试多项跑分跻身一线,百万token调用成本远低于海外竞品,适合开发者、企业批量部署,追求低成本自动化任务。而Grok 4.6深耕知识推理,综合智力对标GPT-5.6,文献调研、复杂学术分析表现突出,更适配科研、深度内容创作。选AI工具有人比较在意性价比,也有人优先选择能够深度知识输出,没法直接比较二者孰强孰弱,主要还是看你怎么用!AI

9. DeepSeek V4 Pro和Grok 4.6同一天上线,这场“中美顶级模型正面碰撞”确实有点意思。如果只看单项能力,我觉得很难说谁碾压谁。DeepSeek V4 Pro更值得关注的,是推理、代码以及复杂任务上的综合能力;Grok 4.6则在通用能力、实时信息和生态体验上有自己的优势。所以我更倾向于认为:这不是谁“绝对更强”,而是谁在不同场景下更好用。真正值得看的,其实是DeepSeek和Grok背后的两条路线,接下来谁能把模型能力真正变成产品和用户体验,才是下半场的关键。#DeepSeekV4Pro和Grok4.6谁更强#AI

10. #DeepSeekV4Pro和Grok4.6谁更强#昨晚AI圈炸了——DeepSeek V4 Pro和Grok 4.6同一天上线,但谁更强?我的答案是: 别急着站队,先想想你拿它干嘛。DeepSeek V4 Pro走的是“能干活还便宜”路线。 Terminal Bench 2.1拿下87.9分,离全球第一的Claude Fable 5只差0.1分;软件工程能力DeepSWE从预览版的12.8暴涨到62.7。输出价格仅0.87美元/百万Token,百万级超长上下文对开发者极度友好。Grok 4.6则押注“知识广还聪明”。 Artificial Analysis智能指数61分,和GPT-5.6 Sol Max持平;GDPval知识工作评测1753 Elo,超过GPT-5.6 Sol Max。实时联网、图文多模态、复杂研究场景是它的主场。说到底,这不是谁碾压谁的问题。 做开发、跑自动化、预算有限,DeepSeek是务实之选;搞研究、要联网、需要多模态,Grok更合适。跑分是参考,价格是门槛,真正重要的是——谁能稳定帮你把事办成。 你选哪边?评论区聊聊👇#DeepSeekV4Pro和Grok4.6谁更强#AI #DeepSeekV4Pro和Grok4.6谁更强

11. DeepSeek Harness 正式发布! 开源一天狂揽 6.8 万星!V4 Pro 模型低调上线,AI Agent 部署与实测 | 零度解说

12. #DeepSeek发布V4Pro正式版#DeepSeek V4Pro正式版悄悄发布,开发者现已可以通过API接入使用。百万级上下文窗口、最高38.4万token输出,重点强化Agent相关能力,同时兼容多家主流接口,对开发者迁移适配很友好。不少硬核评测榜单上它表现抢眼,部分项目超越竞品站上开源模型首位,复杂编程任务的能力也有不小提升,综合水平向顶尖闭源模型靠拢。但成本相比Flash高出三倍,并发额度也做了压缩,主打重度推理场景。跑分数据看着很亮眼,不过高价与有限并发,并不适合普通轻量调用。真实业务场景下稳不稳定,还得靠开发者实际测试才能见分晓。#热点跨界共创# #DeepSeek发布V4Pro正式版#

13. #DeepSeekV4Pro正式版#DeepSeek V4 Pro正式版上线,作为我一直用的AI模型,这次升级确实给力。它在编程、操作电脑等“Agent”任务上进步巨大,跑分直逼甚至部分超越了国外顶尖模型Claude Fable 5。价格虽然比Flash版贵三倍,但输入3元、输出6元/百万token的定价,考虑到性能依然很有性价比。

14. 刚刚涨完价,Deepseek就把AI Agent的“家底”全掀开了

15. 实测完DeepSeek V4 Pro正式版,我发现下一条「斩杀线」可能藏在它的Agent里

16. #DeepSeek发布V4Pro正式版#深夜上线的V4 Pro正式版真的有点惊喜,这次重点强化Agent智能体能力,多项硬核评测直接冲到第一梯队水平。 百万级超大上下文,搭配超高输出上限,处理整本文档、大型代码库这类复杂任务更加顺手,思考模式可自由切换,开发者友好度拉满。 对比Flash版本,Pro版主打深度复杂任务,不是追求极致速度,而是拼推理、工具调用的落地实力。国产大模型卷到这个程度,能明显感受到硬核能力的实实在在进步,已经很好奇实际上手体验了。

17. #DeepSeek发布V4Pro正式版#DeepSeek又放大招了。8月12日晚,官网模型列表新增DeepSeek-V4-Pro-0813,支持思考与非思考模式、Tool Calls、Responses API,还能直接导入Codex使用。更关键的是,上下文窗口达到100万Token,最大输出38.4万Token,性能接近Anthropic Fable5,但价格仅为V4 Flash的3倍。AI模型的竞争,已经从“有没有”进入拼性能、拼生态、拼价格的阶段了。

18. #DeepSeek发布V4Pro正式版#深夜,DeepSeek 悄无声息地扔出了一枚重磅炸弹。昨晚,DeepSeek 官网 API 文档悄然上线了 V4 Pro 正式版(版本号 0813)。没有发布会,没有预告,就这么直接“转正”了。性能上,它真的在向国际顶尖闭源模型靠拢。 根据官方流出的评测对比,V4 Pro 正式版在多项测试中已接近 Anthropic Fable 5 的水平。更夸张的是 Agent 能力的跃升——Terminal Bench 2.1 跑到 87.9 分,Cybergym 83.3 分,DeepSWE 62.7 分,相比预览版简直是代际提升。1M 超长上下文加上 384K 的最大输出,处理整部小说或整个代码仓库都不在话下。价格方面,Pro 版是 Flash 的三倍——输入 3 元/百万 tokens,输出 6 元。但缓存命中后输入仅需 0.025 元,性价比依然惊人。作为对比,Claude Opus 4.8 跑一次任务的成本是 DeepSeek V4 Pro 的 44 倍。把接近 Fable 5 的性能,卖成白菜价。 这或许才是 DeepSeek 真正的“大招”。#DeepSeek发布V4Pro正式版##DeepSeek发布V4Pro正式版

19. #DeepSeek发布V4Pro正式版#模型命名DeepSeek‑V4‑Pro‑0813,Deepseek小助手已经下发通知,V4 Pro正式版开放API调用。目前还没大规模官宣,开发者社群已经率先发酵,官方完整发布会预计8月13日才会到来。计费标准维持原样,输入3元每百万token,缓存命中低至0.025元,输出6元每百万token。对比预览版属于全方位升级,不少评测指标追上甚至反超Fable5,DeepSWE分数暴涨格外亮眼,这次迭代重心完全放在Agent智能体。虽说各项榜单数据很出彩,但跑分只是纸面实力。偏高的调用成本摆在眼前,能不能扛住真实业务压力,还是要开发者亲自实测才能得出结论。#热点跨界共创# #DeepSeek发布V4Pro正式版#

20. #DeepSeek发布V4Pro正式版# 终于等到了!DeepSeek V4-Pro 正式版来了,给大家划几个硬核看点:· 1.6万亿总参数,激活490亿,支持100万Token超长上下文· Agent编码能力开源模型最强,数学/STEM比肩GPT-5.4、Claude Opus 4.6· 混合注意力架构让长文本推理成本暴降,百万Token场景下计算量仅为前代V3.2的27%· 原生适配华为昇腾等国产算力,训练推理全流程不依赖CUDA更关键的是——Flash正式版已经公测,Pro正式版也官宣“尽快发布”。再加上DeepSeek最近预告API要涨价,业内普遍解读是为Pro正式版上线做准备。国产大模型这波,从参数到生态都在卷出新高度。你会第一时间接入V4-Pro吗?#DeepSeek#

21. 【#开发者实测DeepSeekV4Pro和Grok4.6#】#开发者晒DeepSeekV4Pro真实评价# “梁圣”梁文锋和马斯克,盯上了同一座高地。数小时前,AI行业上演极具戏剧性的一幕:DeepSeek悄然发布V4 Pro正式版,几乎同一窗口,SpaceXAI火速放出Grok 4.6旗舰模型。没有提前串通,分属中美两大阵营的两款顶级模型,不约而同完成重磅迭代。有开发者在同一代码项目上同时调用两款模型:DeepSeek V4 Pro成本低廉,但耗时实在太久,闷头跑二三十分钟命令,完全不知是否卡住了以及还需多久。相比之下,Grok4.6速度很快,输出结果稳定性更好,但单次任务成本更高。(@搜狐科技 )#DeepSeekV4Pro价格暂未上调# 梁文锋、马斯克同日双发:当顶级模型性能价格双杀,谁先被推进斩杀区

22. DeepSeek V4 Pro 即将发布!4 大核心升级 !

23. V4-Flash 对决 V4-Pro:DeepSeek 承诺的廉价高效是真的吗?

24. DeepSeek V4 Pro 正式版评测:1.6 万亿参数、Agent 跑分翻倍,加量不加价

25. 突发!DeepSeek V4P发布,这次重点在Agent 8月12日晚间,DeepSeek V4 Pro正式版更新至API,调用模型名不变,仍是DeepSeek-v4-pro,模型版本号更新为DeepSeek-V4-Pro-0813。已经接入的开发者不用改任何代码,直接用最新版,从4月24日发布预览版算起,这款旗舰模型转正用了将近四个月。 在DeepSeek官方公布的benchmark里,V4 Pro正式版在HLE、Terminal Bench、Cybergym、DeepSWE等Agent相关基准上的得分都超过了Anthropic的Claude Opus 4.8,逼近Anthropic在6月发布的Fable 5。【P1】 具体分数上,终端Agent测试Terminal Bench拿到87.9分,Fable 5是88.0分,只差0.1;在AI安全智能体评测CyberGym和高难度智能体评测AutomationBench上则反超了Fable 5。需要说明的是,这些数字都是官方口径,实际表现等开发者的实测出来再验证。 这次更新的重点放在Agent能力上,正式版新增支持Responses API和Codex接入,同时兼容OpenAI的ChatCompletions和Anthropic的Messages接口,开发者手上的工具基本不用换。【P2】 参数方面,1M Token的上下文窗口和384K Token的最大输出保留了下来,思考模式默认开启,另有一个非思考模式的端点,处理对延迟敏感的调用。 目前正式版没有跟着“转正”涨价,当前每百万Token价格跟预览版一致:缓存命中输入0.025元,缓存未命中输入3元,输出6元。 不过涨价也确实在路上了,DeepSeek此前公告计划整体上调API定价,引入峰谷定价机制,就是平时价格不变,高峰时段价格直接翻倍。 届时V4 Pro缓存命中的输入涨到0.05元,缓存未命中的输入涨到6元,输出涨到12元。同时,V4 Flash同步上调,三档价格分别从0.02元、1元、2元涨到0.04元、2元、4元。【P3】 总之,这次DeepSeek V4 Pro明显为Agent而生,至于涨价方案什么时候落地、怎么落地,官方还没给时间表,对依赖API调用的团队来说,趁价格没动,把手头的接入验证一遍,大概率不亏。 #DeepSeek #DeepSeekV4Pro

26. DeepSeek V4 Pro正式版上线:1M超大上下文+384K输出,价格比Flash贵三倍

27. DeepSeek V4 Pro正式版上线:100万上下文、38.4万最大输出

28. 0.1 分性能差,60倍价格差:不甘“平替”,DeepSeek双杀硅谷

29. DeepSeekV4Pro正式版API上线 Agent能力增强

9
扫一下,分享更方便,购买更轻松
1评论

  • 精彩
  • 最新
  • 喜欢,买了

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章