张大妈

成本狂降90%!DeepSeek深夜扔出“核弹”:一张游戏显卡,就能跑千亿大模型

源自公众号:吾同书院兰亭雅集

01-28 16:52

AI行业长期受困于昂贵的GPU显存,DeepSeek提出一种名为Engram的架构创新,通过将模型静态知识迁移至廉价的CPU内存,不仅将硬件成本降低90%,还意外提升了模型性能。这项技术为个人开发者和小团队运行千亿大模型铺平了道路,或将重塑AI产业的竞争格局。

成本狂降90%!DeepSeek深夜扔出“核弹”:一张游戏显卡,就能跑千亿大模型智能速览

  • DeepSeek提出Engram技术,旨在解决AI行业的“显存墙”难题。

  • 该技术将静态知识存储于CPU内存,实现存算分离,成本直降90%。

  • Engram通过查表方式获取语义,模型推理吞吐量下降不到3%。

  • 分工优化后,模型在多项基准测试中表现全面超越基线。

  • 此架构创新可能动摇英伟达HBM显存的市场地位,推动行业转型。

成本狂降90%!DeepSeek深夜扔出“核弹”:一张游戏显卡,就能跑千亿大模型精华内容

当整个行业还在为算力堆砌而内卷时,DeepSeek另辟蹊径,通过架构创新重塑AI算力经济学。Engram技术如何实现存算分离,并带来意想不到的性能提升?

显存墙困局

当前AI行业面临的核心瓶颈是“显存墙”。英伟达等厂商的GPU算力提升迅速,但HBM高带宽显存容量增长缓慢,产能被少数厂商垄断,价格是普通内存的6-8倍。这使得运行更大模型的成本急剧攀升,仅仅是为了将模型参数塞进昂贵的显存,而非算力不足,已成为阻碍AI技术普及的最大障碍。

Engram解法

DeepSeek提出的Engram模块,其核心是存算分离。它将模型中的静态知识(如固定概念、事实)与动态推理(如逻辑思考)剥离开。通过改造N-gram技术,Engram构建了一个巨大的哈希索引嵌入表,存放在CPU内存中。当模型遇到已知短语时,直接O(1)复杂度查表获取语义向量,几乎不消耗计算资源,再由上下文感知门控机制判断是否注入主网络。

成本与性能

实验结果证明,Engram的突破不仅是成本。通过将千亿参数的Engram表挂载到CPU内存,硬件成本从数万美元降至约1200美元,降幅高达90%,而推理吞吐量仅下降不到3%。更意外的是,由于分工优化,Engram-27B模型在知识、逻辑推理、数学和代码等多项基准测试中,分数全面超越纯MoE-27B基线,实现了成本和性能的双重胜利。

行业冲击波

这项技术或将重构AI产业链。对硬件厂商而言,英伟达HBM显存的稀缺性被削弱,CPU内存和SSD可能成为AI基础设施新贵,若30%算力需求转向此方案,英伟达可能损失数十亿美元订单。对开发者而言,个人和小团队也能负担千亿模型运行,AI开发门槛大幅降低。对中国AI生态,这更是一条绕过硬件壁垒,转向架构创新的高效路径。

DeepSeek Engram的出现,标志着AI行业正从蛮力堆砌算力的规模竞赛,转向精细化的架构优化。当单纯卷算力的时代渐行渐远,架构创新的红利期才刚刚开启。未来的AI竞争,或许不再是显卡的战争,而是智慧的较量。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
4评论

  • 精彩
  • 最新
  • 问题是内存也贵呀

    校验提示文案

    提交
    至少能自己造啊。

    校验提示文案

    提交
    主要咱们个人咱俩堆个128内存还可能,堆个128显存基本不可能

    校验提示文案

    提交
    还有1条回复
    收起所有回复
提示信息

取消
确认
评论举报

最新文章 热门文章