国产大模型DeepSeek V4的基准测试泄露,其编程能力首次超越Claude和GPT-4。这不仅是技术参数的领先,更通过架构创新实现了极低的训练与调用成本,可能重塑AI行业的竞争格局。
智能速览
HumanEval编程测试得分90%,超越Claude的88%与GPT-4的82%。
采用Engram记忆分离技术,显著降低推理成本。
mHC拓扑突破让模型信息传递更高效,提升学习与推理能力。
训练成本仅600万美元,远低于GPT-4预估的1亿美元。
API调用价格比OpenAI便宜20-40倍,性价比极高。
拥有100万token上下文,可理解并重构整个软件项目。
精华内容
DeepSeek V4的突破并非偶然,其背后是架构层面的深度创新和对成本的极致控制,这才是真正撼动行业的关键所在。
性能反超
根据泄露的基准测试数据,DeepSeek V4在衡量编程能力的HumanEval测试中得分达到90%。这一数据超越了目前硅谷头部玩家的成绩,其中Claude为88%,GPT-4为82%。
这意味着在10道Python编程题中,DeepSeek V4能一次写对9道。在另一项更贴近真实开发场景的SWE-bench Verified测试中,其修复GitHub bug的能力也据传超过了Claude Opus 4.5保持的80.9%记录。
架构革新
DeepSeek V4的突破源于两项核心技术。首先是Engram记忆分离技术,它将传统大模型中“记东西”(静态知识)和“想问题”(推理计算)的功能分离开。
静态知识被存放在成本更低的内存中,而昂贵的GPU则专注于推理计算。实测显示,将1000亿参数的嵌入表放入内存,性能损失不到3%。其次是mHC拓扑突破,解决了模型越深信息传递越易丢失的问题,让信息能跨层流动,提升了学习效率和推理能力。

成本颠覆
技术领先之外,成本优势是DeepSeek V4更具威慑力的地方。数据显示,其训练成本约为600万美元,而GPT-4的预估成本超过1亿美元。
在API调用价格上,DeepSeek也比OpenAI便宜了20-40倍。这种将先进技术与极低成本相结合的模式,使得高质量AI能力的获取门槛大大降低。同等能力,十分之一的成本,这才是对现有市场格局的直接挑战。
DeepSeek V4的出现,标志着国产大模型在核心能力上已具备与世界顶尖选手正面竞争的实力,尤其是在高价值的编程领域。技术突破与成本控制的结合,或将加速AI应用的普及。这场全球AI竞赛的下一步会走向何方?