DeepSeek V4 不给英伟达用了

源自知乎:波特

03-02 11:51

DeepSeek V4 的出现,不仅是参数量的提升,更是一次对行业惯例的挑战。它以百万级上下文窗口和极低的训练成本,展现了超越前代的性能,同时通过优先适配国产芯片,可能重塑 AI 硬件生态的格局,为国产 AI 发展提供了新的可能性。

DeepSeek V4 不给英伟达用了智能速览

  • V4 模型总参数达万亿,但推理激活参数仅 320 亿,效率反超前代。

  • 实现 100 万 token 上下文窗口,可一次性读入整个代码仓库。

  • 训练成本预估仅 800-1000 万美元,远低于 GPT-5 的 5-10 亿美元。

  • SWE-bench 跑分超过 80%,性能比肩 Claude Opus 等顶级模型。

  • 打破行业潜规则,优先适配华为昇腾芯片,而非英伟达

  • 将推出重型版 V4 和轻量多模态版 V4 Lite,满足不同场景需求。

DeepSeek V4 不给英伟达用了精华内容

DeepSeek V4 的革新之处,不仅在于模型规模的突破,更在于其通过精巧的架构设计,实现了成本与性能的极致平衡,并主动引导了产业链的变革方向。

高效 MoE 架构

DeepSeek V4 的总参数规模约为 1 万亿,相比 V3 增长了近 50%。然而,通过采用更先进的 MoE(混合专家)架构,其在每次推理时仅需激活 320 亿参数,这一数字甚至低于 V3 的 370 亿。

这种设计好比一个 100 人的公司,每次只精准派出 3 名专家完成任务,而非一个 67 人的公司派出 4 人。团队规模更大,但核心执行成本反而更低,实现了模型越大、推理越便宜的反直觉效果,展现了卓越的工程优化能力。

百万级上下文

V4 配备了高达 100 万 token 的上下文窗口,相当于 15-20 本书的容量,远超 GPT-4o 的 12.8 万和 Claude 的 20 万。这项功能并非概念,而是已在今年 2 月静默上线,可供开发者实测。

其背后是名为 Engram 的关键技术,该技术实现了 O(1) 常数时间检索,无论上下文多长,信息提取速度和准确率都保持稳定。实测准确率从 V3 的 84.2% 提升至 97%。更关键的是,它能将千亿级的嵌入表卸载到系统内存,对 GPU 显存要求大幅降低,性能损失不到 3%。

成本与性能

在性能对标顶尖模型的同时,DeepSeek V4 的训练成本控制得极为出色。V3 的训练成本约为 560 万美元,而参数翻倍的 V4,凭借核心技术优化,额外训练时间仅增加 6.7%。据推算,其总训练成本在 800-1000 万美元之间。

这与业内估计的 GPT-5 高达 5-10 亿美元的训练成本形成了百倍差距。在 SWE-bench 等权威评测中,V4 的得分超过 80%,与 Claude Opus 的 80.9% 基本持平,并计划开源,让用户能以零成本获得接近 GPT-5 级别的模型能力。

产业链新博弈

此次 V4 发布最引人关注的,是其打破行业潜规则的决定:未提前向英伟达和 AMD 提供模型权重进行优化,而是优先完成了华为昇腾芯片的适配。

过去,英伟达凭借 CUDA 生态的先发优势,始终是主流模型发布前的“第一站”。DeepSeek 凭借 V3 和 R1 在 GitHub 上百万级的下载量和全球影响力,获得了与芯片厂商议价的资本,将“求你优化”变为了“你来适配我”。这为国产 AI 芯片生态注入了强心剂,标志着国产 AI 基础设施开始走向独立运转。

双版本策略

为满足不同场景需求,DeepSeek V4 将以两个版本呈现。V4(重型版)专注于编码能力,SWE-bench 表现卓越,目标是成为最强的自主编码 Agent,适用于高算力、高精度的场景。

另一个版本是 V4 Lite(代号 Sealion-lite),它轻量、响应快速且原生多模态。其价格预计仅为 GPT-4o 的十分之一,非常适合出海创业者,兼顾了成本效益、多模态能力和数据合规(可本地部署)三大优势,具备成为“性价比之王”的潜力。

DeepSeek V4 的发布,不只是一个技术产品的迭代,更是国产 AI 产业链寻求独立运转能力的一个标志性事件。它证明了顶级模型也能拥有对供应链的议价权,这条新路能走多远,将深刻影响未来 AI 技术的全球格局。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
1评论

  • 精彩
  • 最新
  • 我就问,国内ai模型开发者,就不能开发适用于国产芯片的模型吗,干嘛非要使用老美芯片的。

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章