最近想玩本地大模型的人,处境有点微妙。
一边是显卡行情还在创新高:9月初,5090D V2 涨到 24799 元,5060 Ti 8G 涨到 3450 元,都是历史最高价。知乎另一边,本地AI的浪潮完全没停:Qwen3.8-27B、MiniMax H3 这类新模型、Unsloth Desktop 这类新工具最近密集出现,B站上"老显卡也能跑"的教程一期接一期。

于是评论区最近反复出现同一个问题:这个行情,本地AI到底该买什么卡?
先给一个反常识的结论:12G显存现在真的能跑35B级大模型。但别急着去捡便宜卡——这个"能跑"有三个代价,其中第三个在涨价潮里已经变得很贵。
先纠正一个误区:7B参数 ≠ 7GB显存
很多人按参数量选卡,觉得"7B的模型就要7G显存"。实际上显存占用由三部分组成:权重、KV Cache(上下文缓存)和运行时开销。
权重部分好算:参数量×每参数字节数,FP16是2字节,INT8是1字节,INT4约0.5字节。但INT4实际占用通常比理论值高——嵌入层和归一化层会保留更高精度,还有量化分组的元数据。比如32B模型INT4理论16GB,实际往往要18~20GB。
真正的变量是KV Cache,它随上下文长度线性增长:7B模型每增加1K token,大约多0.3~0.5GB;32B密集模型每token约256KB,128K上下文单路就要32GB——比任何一张消费级显卡的显存都大。知乎所以选卡不能只问"能不能跑",得问"跑多长的上下文、开几路并发"。能跑和跑得舒服,是两个概念。
一张显存对照表:什么模型要什么卡
把社区部署实践和工程估算整理成一张表,口径是4K~32K上下文、1~2路并发,实际占用以启动日志为准。知乎
模型档位 | 常用方案 | 实际显存 | 够用的卡 |
|---|---|---|---|
7B | FP16 / INT8 | 约14GB / 约8GB | 3090、4090跑FP16;16G卡(如4060 Ti 16G)跑INT8;3060 12G跑INT4 |
14B | INT8 / INT4 | 约16GB / 约9GB | 3090、4090(24G)跑INT8;3080 Ti、4070跑INT4 |
32B | INT4 | 18~20GB | 24G是门槛:4090装完权重只剩约4GB,单人32K单路 |
30B级MoE(如Qwen3-30B-A3B) | Q4 | 18~19GB | 显存和密集32B接近,但生成速度快得多,5090单用户可到约192 tok/s |
67B/70B | INT4 | 约40GB | 单张消费级显卡无解,双卡、A100或云上租用 |
两个关键分水岭:
24G(3090/4090)是第一道坎:往下,7B/14B随便玩;往上,才摸得到32B。
32G(5090)装32B INT4后还剩约10GB,能撑32K单路或低并发服务,体验明显改善。知乎但现在5090D V2要24799元,值不值,取决于你拿它干什么。
12G显存跑35B是真的,但有三个代价
先看社区里的实测:12G显存+64G内存,跑Qwen3.6-35B-A3B(MoE架构,35B总参数、每token只激活3B)的NVFP4版本,32K上下文平均约75 tok/s,200K上下文还剩约40。知乎从格式支持推断,这张12G卡大概率是RTX 5070这一档的Blackwell。
原理不复杂:MoE模型每个token只需要搬运被路由选中的几个"专家"。把专家权重钉在内存里(llama.cpp的–n-cpu-moe参数),每步只从内存传几百MB到显存。有人在一台很老的机器上验证过:RTX 3060 12G+PCIe 3.0,密集模型Qwen3-14B Q4卸一半层到内存,速度从35.9 tok/s掉到5.7;同一张卡跑MoE 35B,专家全卸出去,还能稳在38。知乎这就是最近流传的"MoE把显存门槛打下来了"。

但这个"能跑"有三个代价:
第一,吐字快,首字慢。 MoE省的是解码阶段的搬运量,预填充阶段仍要把prompt路由到的专家完整过一遍接口。以DeepSeek-V4-Flash为例,一次预填充要经PCIe流过约140GB专家权重,PCIe 4.0 x16要多等约5秒,x8链路多10秒以上。日常聊天没感觉,跑那种每轮都要重做prefill的Agent,感知非常明显。
第二,单人能玩,服务别想。 专家缓存只保留5%的条件下,单用户缺失率6.91%,16路并发直接冲到68.84%。这条路只适合个人自用,多人并发场景一张卡都省不下来。
第三,也是最现实的:省下的钱被内存吃掉了。 这条路线本质是"用小显存换大内存"。但64GB DDR5套条,去年同期约1287元,今年8月约7538元——内存这波涨了接近5倍。知乎不买大显存卡省下的钱,原封不动在内存条上还了回去。涨价潮里,这条路线的经济账得重算。
另外说句公道话:12G能塞下35B,另一半功劳是注意力机制换代(线性注意力把上下文缓存压了下来),不全是offload的功劳。
涨价潮里,分人群怎么买
先看行情(9月渠道报价):5060约2900元、5060 Ti 8G约3300~3450元、16G版约5000元、5070约6600元、5070 Ti约9300元、5080约12000元;A卡这边9070约5200元、9070 XT约5800元。知乎这轮涨价的根子是AI产能和GDDR7显存颗粒,社区比较冷静的共识是:别指望短期回到2024年的价位。在这个背景下,玩本地AI的可以按人群对号入座:

尝鲜党(聊天、摘要、跑着玩):别急着上24G。 7B模型,12G卡跑INT4、16G卡跑INT8就够用;B站上MiniMax H3这类新模型的教程,8G显存就能跑AI视频生成,入门门槛比想象中低。哔哩哔哩涨价潮里二手3060 12G也在跟涨,多比价再下手。
手里已有16G卡(5060 Ti / 5070 Ti / 4080这类):先别换卡。 16G的潜力已经被社区榨出成熟方案了——以最近讨论度很高的Qwen3.8-27B为例,用Unsloth Desktop加IQ3_XXS量化,96K上下文稳定、占13~14G显存,速度约55 tok/s,Agent流程也能跑。知乎GitHub先确认它不够你用,再去付涨价的税。

非要跑32B:24G是入场券。 3090/4090跑INT4,做单人助手没问题;注意这波二手24G卡也跟着涨了,验矿、验翻新一步不能少。预算充足且需要并发的,32G卡体验确实上一个台阶,但24799元的当下,赚钱的算投入产出,纯玩的不建议。
70B以上、或要微调训练:别买卡,租。 这个档位已经超出消费级显卡的范围,云GPU按小时租(A100/H100),短期验证和弹性扩容都比一次性买断划算。
拿不定主意的,用一个通用方法:先别买卡。 本地部署的老手们反复提的建议是:先连续记录两周——每次任务GPU实际忙了多久、显存用了多少、一周有几天根本没开机。知乎大多数人会高估自己的算力需求,整理数据、改代码、查bug的时间根本用不上好卡。记录两周,再用真实任务去云上租两周测出显存下限,然后让本地卡承接稳定负载,峰值交给云端。对多数人来说,最大的隐形成本不是卡价,是吃灰率。
最后三个避坑提醒
别先买卡再让模型迁就它。 靠谱的顺序是:先定模型→再定部署框架→核对资源需求→最后选GPU。反过来做,多半得到一张"哪哪都不够用"的卡。知乎
密集模型别硬卸载。 14B密集模型卸一半层到内存,速度直接掉80%以上;offload只对MoE模型有意义。
量化损失别只看跑分。 INT4对日常对话、摘要的损失通常可接受,但数学推理、长代码这类敏感场景,务必拿自己的任务实测。
涨价潮里,所有人都在盯价格表。但本地AI这件事,一张显存对照表加一份两周的利用率记录,比任何价格群都可靠。卡是贵了,门槛却未必高了——新模型和新量化方案每天都在把入门线往下拉。先搞清楚自己需要多少显存,再看钱包,这个顺序至少能省一次换卡的钱。