中国大模型再刷新纪录!DeepSeek-V4多项性能力压GPT-5.4与Claude
2026年4月24日,中国人工智能公司深度求索(DeepSeek)正式发布了全新系列模型DeepSeek-V4的预览版本,并同步向全球开源。这款备受瞩目的新一代大模型凭借百万级超长上下文、显著增强的Agent能力与顶尖推理性能,在多项关键基准测试中实现了对主流闭源产品的超越,在全球AI圈引发强烈震动。

编程与推理能力多点突围
从官方披露的对比数据来看,DeepSeek-V4-Pro在多个硬核评测任务上表现极为亮眼。在最能体现算法与逻辑能力的Codeforces编程竞赛评测中,V4-Pro-Max拿下3206分,一举超越了GPT-5.4的3168分和Gemini 3.1 Pro的3052分,刷新了新的基准纪录。LiveCodeBench评测中,V4-Pro取得了93.5分,同样位列榜首,展现出当前开源模型中顶级的编程能力。
在指令遵循方面,V4-Pro的交付质量在公司内部测试中已接近Claude Opus 4.6的非思考模式,使用体验更是优于Sonnet 4.5。在Agent能力上,V4系列针对Claude Code、OpenClaw、OpenCode等主流智能体产品进行了专项适配优化,代码任务与文档生成能力全面提升。

此外,在知识与推理类测试Apex Shortlist中,V4-Pro-Max同样拔得头筹。在数学、STEM及竞赛型代码测评中,DeepSeek官方明确表示V4-Pro已经超越当前所有已公开评测的开源模型,取得了比肩世界顶级闭源模型的优异成绩。
百万上下文成本重构
DeepSeek-V4另一个引发行业热议的突破,是对超长上下文场景的极致成本重构。V4系列采用了全新的注意力机制,在token维度进行压缩,并结合自研的DSA稀疏注意力(DeepSeek Sparse Attention),相比传统方法大幅降低了对显存和计算的需求。在100万token设置下,V4-Pro的单token推理FLOPs只有前代V3.2的27%,KV Cache仅剩10%;V4-Flash更为极致,两项数据分别压到了10%和7%。
DeepSeek在新闻稿中明确表示:从现在开始,1M(一百万)上下文将是DeepSeek所有官方服务的标配。这一宣告的信号意义极为强烈——一年前百万上下文还是Gemini独家的王牌,其他闭源模型大多仅支持128K或200K,开源领域几乎无人能负担这个量级。DeepSeek直接将超长上下文这个“高端功能”变成了“水电煤”。

国产算力:从适配到正式落地
在硬件生态层面,DeepSeek-V4也传递出清晰的战略信号。V4系列模型包含两个MoE版本——旗舰版DeepSeek-V4-Pro总参数达1.6万亿、激活参数490亿,轻量版DeepSeek-V4-Flash总参数2840亿、激活参数130亿,两者均原生支持100万token上下文。更重要的是,V4从模型设计之初就深度适配国产算力,在华为昇腾芯片生态中已实现实测跑通,成为全球首个在国产算力底座上完成训练与推理的万亿参数级开源模型。

DeepSeek的工程师为此投入了大量精力进行底层迁移,完成了从英伟达CUDA生态向华为CANN架构的适配。不过,官方也坦承受限于高端算力供给,Pro版本当前的服务吞吐有限,预计下半年随昇腾950超节点批量上市后,Pro版价格将大幅下调。
低成本优势依然显著
定价方面,DeepSeek继续维持一贯的高性价比路线。API价格对比显示,V4 Flash输入(未命中)为1元/百万token,输出为2元/百万token,相比前代进一步降价;而V4 Pro定位旗舰,输入12元、输出24元,对标Claude Opus 4.6的定价大约便宜了21倍。社区也有用户参照海外模型定价逻辑指出,DeepSeek V4的极高性价比正在底层推动AI服务成本整体下探。

理性看待差距:与头部闭源仍有距离
值得注意的是,DeepSeek在官方报告中也给出了相对克制的判断。V4的能力水平大约滞后前沿闭源模型3至6个月,这并非一次全面的能力越级,而是一次重构长上下文成本结构、为下一阶段研发铺路的基础设施发布。在MMLU-Pro等综合性知识评测中,V4-Pro与GPT-5.4旗鼓相当,但与Gemini-3.1-Pro和Claude Opus 4.6相比仍存在小幅差距。在SWE Verified准确率上,V4-Pro与各家闭源模型基本持平在80%左右,差距已微乎其微。在长上下文能力方面,Opus 4.6在特定评测中仍领先近10个百分点。Agent任务方面,各项测试互有胜负,整体差距十分接近。
综合来看,DeepSeek-V4的意义远不止于“又一个新模型”:它将开源模型的能力上限大幅拉升,将百万上下文从旗舰配置拉入普惠时代,同时标志着中国AI大模型在国产算力底座上迈出了实质性一步。正如网友所评价的那样,DeepSeek真正令人震撼的地方可能不只是“进步了多少”,而是在极低的成本结构下做到了这个量级的性能,这让每一家AI产品公司都不得不重新审视自己的利润结构。这一次,中国开源力量正以前所未有的姿态改写全球大模型竞争格局。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

woozhj
校验提示文案
huohu4399
校验提示文案
huohu4399
校验提示文案
woozhj
校验提示文案