当前位置:
AIGC文章详情

本地跑 DeepSeek V4 Flash,A 卡用户不用急着换卡:这波部署潮考的是内存不是显存

源自65位全网作者

05:41

最近本地大模型圈最火的一件事,是 DeepSeek-V4-Flash 的"Token 自由"潮。7 月 31 日 0731 正式版发布后,这个 284B 参数的 MoE 模型被各路玩家搬上了自己的机器:单张 5090 的、Mac Studio 的、4 张二手矿卡压测的,全都晒出了能日常用的速度。哔哩哔哩上周伯克利和 MIT 的团队又开源了端侧推理引擎 FreeToken,号称一张 5090 加 192GB 内存就能满血跑 V4 Flash,发布 48 小时冲上热榜。知乎

本地跑 DeepSeek V4 Flash,A 卡用户不用急着换卡:这波部署潮考的是内存不是显存

但如果你用的是 A 卡,刷这些帖子大概率会有点不是滋味:晒单的清一色 N 卡和 Mac,AMD 这边好像又没跟上。先别急着下单换卡,这波的账和以前不一样,我把它算给你看。

这轮部署潮考的从来不是显存,是内存

V4 Flash 的总参数是 284B,听起来吓人,但它是 MoE 架构:43 层、每层 256 个路由专家、每个 token 只激活其中 6 个,单 token 实际参与计算的参数约 13B。今日头条稀疏激活带来一个结果——跑它不需要把 284B 全塞进显存,全部权重可以放在系统内存里,按需把被路由到的专家搬进 GPU 算。

这就是这波"消费级硬件跑 284B"的底层逻辑,也是和以前最大的区别。以前跑大模型,显存容量是第一道死门槛;现在 MoE offload 路线下,门槛变成了"总内存 + 内存带宽 + PCIe"。证据都摆在明面上:

  • Unsloth 放出的 V4 Flash GGUF 量化版,官方最低要求是 92GB 总内存(系统内存 + 显存一起算),推荐 128GB 起步。3-bit 版文件约 103GB,Q4 约 155GB,Q8"无损"版约 162GB。今日头条

  • FreeToken 的论文里讲得很直白:解码阶段的瓶颈是双通道 DDR5 只有 80-90GB/s 的带宽,而显卡片上内存能到 1TB/s 以上——所以它的核心工作是动态决定"多少专家放 GPU、多少在 CPU 上算"。它测试的平台涵盖 PCIe 3.0 x8 到 PCIe 5.0 x16,笔记本 4060 都能跑。微信

  • 标杆配置:5090(32GB)+ Ryzen 9 9950X3D + 192GB DDR5,V4 Flash 解码 22-25 tok/s(论文数据,暂无第三方复现)。注意这个组合里真正的主角是那 192GB 内存,5090 只是提供了 32GB 的专家缓存池。哔哩哔哩

翻译成一句人话:这波拼的是内存插槽,不是显卡天梯。

全网五条路线摆在一起看

路线

硬件

量化

速度

备注

FreeToken(新)

5090 32GB + 192GB DDR5

FP4

22-25 tok/s

论文数据,未独立复现;仅支持 N 卡

Mac Studio M4 Max

192GB 统一内存

Q4_K_M

25-35 tok/s

约 4.3 万,开箱最省心

4× CMP 170HX 矿卡

4 张二手 N 卡矿卡

-

日常约 80 tok/s

B站 5.7 小时压测,跑通 104 万 Token

ds4(antirez 出品)

N 卡 / Mac

FP8 GGUF

官方实现的约 3 倍

纯 C 引擎,只支持 CUDA 和 Metal

llama.cpp GGUF

大内存机器通用

3-bit 起

依硬件而定

A 卡唯一现实入口

看出问题了吗?前四条全是 NVIDIA 或 Apple 的地盘:ds4 只写了 CUDA 和 Metal 后端,FreeToken 目前公开资料里的配置全是 N 卡,5090 那条"满血"路线依赖的 FP4 量化更是 N 卡专属。A 卡用户能走的,目前只有最后一条——llama.cpp 的 ROCm/Vulkan 构建加 GGUF 量化,这条路上的所有机制对 A 卡都不设歧视。知乎

A 卡的账:卡可以不动,内存得加

好消息是,offload 范式对 A 卡其实相当友好。V4 Flash 每个 token 只激活 13B,7900 XTX 的 24GB 显存装下活跃部分加注意力层毫无压力,剩下的专家池交给系统内存。你真正要做的投资是把内存加到 128GB(跑 3-bit)或 192GB(跑 Q8)。这笔钱是几千块级别的,和现货 3.7 万的 5090 比起来,完全是一个量级的决策。

但有几句丑话必须说在前面:

  1. 目前没有找到任何 V4 Flash 在消费级 A 卡上的公开实测速度。 第一批晒单全是 N 卡和 Mac,A 卡这条路"能走通"有依据(llama.cpp 官方支持该架构的 GGUF),"跑多快"没人替你验证过,你得做好当第一批小白鼠的准备。

  2. llama.cpp 的静态专家放置,恰恰是 FreeToken 论文点名批评的低效方案——加载时固定分配专家,路由一变,大量计算就落到 CPU 上。也就是说,同样是 192GB 内存,A 卡 + llama.cpp 的体验大概率不如 N 卡 + FreeToken。微信

  3. 老版本 llama.cpp 跑 V4 Flash 从第二轮对话开始会吐乱码(prompt caching 兼容问题),Unsloth 已经修了,但你需要拉最新代码自己编译。今日头条

  4. ROCm 环境那些老坑——环境变量不生效、桌面偷显存、升内核驱动翻车——跑之前先自查一遍,别让模型问题背锅。知乎

本地跑 DeepSeek V4 Flash,A 卡用户不用急着换卡:这波部署潮考的是内存不是显存

如果只是想先尝尝 V4 Flash 的味道,还有个更省的路:AMD GPU Cloud 和 Cherry Studio 合作,每天送 10 美元调用额度,里面就有 V4 Flash 0731、V4 Pro 和 GLM 5.2。小红书小红书多位用户实测,8 月初有人遇到回复胡言乱语的部署问题,到 8 月下旬的横评里它已经被认为是"每日重置、适合长期用"的那个。小红书官方 API 也只要 2 元/百万 Token——先用免费和便宜的确认自己真需要,再决定要不要往机器里砸钱。今日头条

所以,到底动不动手

  • 已经有 A 卡、只是想体验:AMD GPU Cloud 免费额度或官方 API 先用着,一分钱硬件都别花。

  • 确有"数据不出机器"的刚需:卡别换,加内存。128GB 上 3-bit、192GB 上 Q8,llama.cpp 拉最新版编译,llama-server 起个 OpenAI 兼容接口,Claude Code、OpenCode 这些都能接。预期放平:速度未必好看,但你买到的是数据主权。

  • 正在观望装机:现在更不建议为 V4 Flash 仓促买卡。这波潮说明"内存是新显存"——真要装,优先保证主板有四条内存插槽、CPU 内存带宽别拉胯,显卡反而可以按需再等。

  • 你其实只是想要个能干的本地编程模型:别追 284B 的热闹。27B 级模型才是 A 卡现在的甜点:27B 级模型的 Q4_K_M 在 7900 XTX 上全量进显存,上下文开到 128K 显存占用也才 22.8GB。知乎用户 pixels-lee 的 27B 模型在这张卡上长期实测 36+ tok/s。知乎我们此前测到过 65 tok/s,日常 Agent 和写代码完全够用。小红书还有一组 27B 模型在同卡上的实测值得咂摸:ROCm 后端解码 21-23 tok/s,Vulkan 后端能到 55-60+ tok/s。小红书A 卡上后端和调参的影响比想象中大得多。

本地跑 DeepSeek V4 Flash,A 卡用户不用急着换卡:这波部署潮考的是内存不是显存

接下来值得盯的三个信号

一是 FreeToken。它用 Apache-2.0 协议开源,几天就拿了 2800+ star,代码全公开——社区会不会把它移植到 ROCm/Vulkan,是 A 卡用户最值得盯的事,目前公开资料里它还只有 N 卡配置。二是 Unsloth 说更小的量化版本还在做,128GB 以下的机器可以再等等。三是 AMD GPU Cloud 的免费额度能不能稳住,如果能,A 卡用户等于白得一个长期 V4 Flash 入口。

V4 Flash 这轮真正值得 A 卡用户记住的结论只有一句:MoE 时代,本地大模型的门槛正在从"显存税"转向"内存税"。税种变了,A 卡反而不用先交最贵的那一笔。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章