DeepSeek无显卡本地部署70B,能跑吗?

2025-03-07 18:44:13 21点赞 21收藏 36评论

大家好,我是波导终结者。

DeepSeek无显卡本地部署70B,能跑吗?

在我写这篇文章的这几天,号称32B能媲美DeekSeek-R1满血671B的QwQ模型已经放出来了,我还没有完成完整的测试。今天先把前不久折腾的llama-70B本地部署整理出来与大家分享。因为之前有小伙伴留言,说70B也是能跑的,慢点是慢点,自己本地折腾个乐呵。我想一想也有道理,但是具体什么样才叫“能”跑,定义可能不一样。最基础的,能载入运行,不崩,能正确出结果,再慢也叫能跑。那咱们就以这个定义为基础,来看看本地无显卡部署DeepSeek是否可行吧?

DeepSeek无显卡本地部署70B,能跑吗?

70B-Q4_K_M的模型大小为42.52GB,基本上得64G内存才有戏,出于谨慎起见,这里我还是放到96G的机子上跑。而Q6模型有57.88G,Q8模型有74.98G,根据自己机子酌情选择。CPU线程池拉满,评估处理大小拉到1024,题目为“请帮我写一篇年终总结,主角是程序员,每天工作24小时,每周工作6天”。实测CPU占用50-70%左右,双通道内存仍存在瓶颈但并未达到质变程度,内存占用54GB左右。4分43秒出结果,1.64 tok/sec,1233 tokens,6.79s to first token,还算可以接受。

DeepSeek无显卡本地部署70B,能跑吗?

但根据小伙伴反馈,70B在连续对话时会卡住。这里我测试了一下,要求继续在原文基础上修改。原文有“一天12杯黑咖啡”,“梦到Terminal里的报错日志”,“公司attendance系统”,“用JSX来思考这个世界”这样不合理,或者无必要英文的使用。我跟它说,“一天喝12杯咖啡会死人的,没必要的英文请改成中文”。此时,小伙伴所反馈的疑似卡住的现象开始出现,虽然显示4分24秒出结果,但是1.61 tok/sec,1183 tokens,1050.18s to first token。注意这个first token,换算一下,它先思考了17.5分钟,才开始正式工作。总的等待时间已经超过20分钟。

DeepSeek无显卡本地部署70B,能跑吗?

但你说它能跑吗?确实能跑,结果也很不错。没有必要的英语单词都换成了中文术语,“BUG,Deadline”等可以保留的都保留了,“JSX来思考世界”改成了“JavaScript来思考世界”。其他部分没有叫它改的,也都没有乱改。只是程序也好AI也好,思考方式和人类还是有区别,才会需要把之前的内容都回锅一遍吧。这里我叫它把程序员改成原画师,正式计算结果之前又卡住好久。

DeepSeek无显卡本地部署70B,能跑吗?

随着负载的加重,出结果的速度继续变慢。5分19出结果,1.58 tok/sec,1239 tokens,1162.05s to first token,还不知道之前的Processing Prompt有没有算进去。结果倒是中规中矩,文章架构几乎没换,只是把一些描述和字眼,从程序员相关,换成了画师相关。

DeepSeek无显卡本地部署70B,能跑吗?

总的来看,本地部署70B,只要内存够,上下文不爆炸,慢是慢了点,倒也不能说不能用。至于最近冒出来的QwQ-32B,测试完再跟大家分享。

感谢大家的观看,点赞和关注,我们下期再见。

展开 收起
36评论

  • 精彩
  • 最新
  • 只要内存够671的都能跑,速度1-2token每秒

    校验提示文案

    提交
    671下载列表里面怎么找不到了?

    校验提示文案

    提交
    估计负载太大,只能找分流试试了

    校验提示文案

    提交
    还有1条回复
    收起所有回复
  • 可以的,我升级到128gb,cpu线程全开,OK的。

    校验提示文案

    提交
    以后单条内存容量不知道会不会继续提升,让四槽板也能全开

    校验提示文案

    提交
    收起所有回复
  • 咋没看到你说机器配置?

    校验提示文案

    提交
    哦,上两篇写过,12700K的机子。寻思着瓶颈在内存带宽,换更好的U也没啥用

    校验提示文案

    提交
    收起所有回复
  • 内存容量要求有点高……

    校验提示文案

    提交
    内存不够只能降一档

    校验提示文案

    提交
    收起所有回复
  • 大佬专业啊,这种就是输入超大内存堆出来的,也是一种大力出奇迹吧,可以用

    校验提示文案

    提交
    毕竟模型载入内存是硬指标

    校验提示文案

    提交
    收起所有回复
  • 2696双路处理器可以不 [惊喜]

    校验提示文案

    提交
    以目前大家的研究结果来看,只要内存够载入就可以。至于瓶颈到底在CPU还是在内存带宽上,反正总有一个。

    校验提示文案

    提交
    行,我试试,我的内存也不小

    校验提示文案

    提交
    收起所有回复
  • 我们对比满血版和llama70B版,70B已经在思考过程明显变差了。70B再Q4量化、还几分钟出结果,真的有实际使用场景吗。。。

    校验提示文案

    提交
    我前几篇就说了,民用电脑本地部署玩玩还行,真需求高的要么上满血,要么买在线服务。奈何现在网上营销号什么千元以内部署方案满天飞,结果和速度如何却不敢说,但外行人却看着痒痒,也很多朋友来咨询我。所以我才实跑给各位看看呀。
    至于有没有实际使用场景,那得看定义。我之前就说过了,这么久出结果,我觉得不太可用。但有的人对“能跑,可用”的定义是,“不崩,能出结果,再慢都行”,那就实践出真知嘛。

    校验提示文案

    提交
    理解咯。你可以再放一些prompt对比,比如我们是用“假设我原先处理一项工作需要花5个工作日,现在我开发了一些自动化工具来支持这项工作,将原先5天的工作压缩至2天,请问这里实现了百分之多少的提效”。671B能回答正确的150%,其它蒸馏模型都是60%。QwQ32B能对但是差点死循环了。

    校验提示文案

    提交
    收起所有回复
  • 这需要什么神仙配置

    校验提示文案

    提交
    内存完全载入模型是必须的

    校验提示文案

    提交
    收起所有回复
  • 大佬,147+48g+4070tis,lmstudio载入70b,思考和回答过程全是乱码,这个问题是模型出错还是因为内存太小呢。我模型是另外下载,然后放入指定目录的。

    校验提示文案

    提交
    内存小了吧,我这里都吃了50多g了。你先降到32b试试看。

    校验提示文案

    提交
    32b完全没问题,不管是ds的还是那个qwq的,那估计就是内存不够了。。。

    校验提示文案

    提交
    收起所有回复
  • 64G的I7加上RTX1050显卡2G不知道跑得起来不?我也想试一试。

    校验提示文案

    提交
  • 最新的Mac studio走一个?

    校验提示文案

    提交
    内存硬指标在那,跑不了32B。大内存版又太贵了

    校验提示文案

    提交
    收起所有回复
  • 可惜啊,我的机器整不了

    校验提示文案

    提交
    跑14B或者7B,8B应该也还行的

    校验提示文案

    提交
    收起所有回复
  • 我先来学习一下

    校验提示文案

    提交
    社区就是互相学习的地方

    校验提示文案

    提交
    收起所有回复
  • 可惜我没这么大内存?

    校验提示文案

    提交
    跑个14B效果倒也还可以

    校验提示文案

    提交
    收起所有回复
  • 大家都开始跑DP赚钱了,自己也想试试

    校验提示文案

    提交
    这几天有个炒邀请码的

    校验提示文案

    提交
    收起所有回复
  • 看的我的小机器一紧呀

    校验提示文案

    提交
    哈哈哈哈,中文博大精深呀

    校验提示文案

    提交
    收起所有回复
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
21
扫一下,分享更方便,购买更轻松