"我的显卡才8G,是不是带不动本地大模型?"这大概是本地AI圈被问得最多的问题。而就在8月15日,Ollama推送了0.32.6版本,给Mac用户送了个不用改任何配置的加速:升级到新版后跑Qwen3.5,MLX引擎会自动启用模型内置的MTP推测解码,生成速度直接受益。今日头条
这个更新本身值得聊,但它背后那个更普遍的问题更值得先解决:我的硬件到底能跑多大的模型?要不要为了跑大模型去买新显卡?今天把这笔账算清楚。

先纠正一个最常见的误区:8B不等于8GB
很多人看到模型名字里带"8B",就下意识觉得要占8GB显存,于是觉得自己8G显存的卡"刚好够"或者"不够",其实都不对。8B说的是参数量(80亿个参数),显存占多少,取决于量化精度。
社区里通用的估算逻辑是:所需显存 ≈ 参数量(B) × 量化位数 ÷ 8 × 1.2,最后那个1.2是给KV缓存和上下文留的余量。有部署教程拿这套逻辑做过实例测算,算出约9.6GB的显存需求,结论是3060 12G显卡就可以跑。知乎按它算一个8B模型、Q4量化(Ollama默认拉取的大多是4bit版本):8×4÷8×1.2=4.8GB。也就是说8G显存的卡跑8B模型不仅够,还挺宽裕;真正卡死人的不是参数量,是你没搞清楚量化后的实际占用。
显存对照表:你的卡到底能跑多大模型
把最近几个月社区里各平台的实测帖翻了一遍,大致能拼出这样一张对照表:
6GB显存(比如RTX 3060 6GB游戏本):能跑,但要精打细算。值得买社区有帖子专门实测过这台机器:7B模型的量化版体积只有约4.7GB,塞进6GB显存稳稳跑了起来。值得买社区不过这时显存余量已经基本吃满,别再去碰13B,跑模型前记得把浏览器关掉。
8GB显存(RTX 4060/3060 8G/2070S这一档,保有量最大):有博主专门拿4060实测了5个主流模型:Qwen3 8B约5.2GB、DeepSeek-R1蒸馏8B约5.2GB、Qwen2.5-Coder 7B约4.7GB、Mistral 7B约4.4GB、Gemma3 4B约2.5GB(最小的还带看图能力)。结论很直接:7B-8B是甜点区,13B以上别碰,溢出到内存后速度暴跌几十倍,卡成PPT。微信公众号
12GB显存:这是社区公认的"性价比起步线"。7B-14B随便挑,14B的Q4量化(约8-9GB)能完整进显存,还能留出上下文空间。
16GB显存:14B全速、24B(如Devstral-Small这类代码模型的Q4版本)可跑,开始有余量做双模型常驻。
24GB显存(3090/4090档):32B级别模型的主力区间。还有人分享过靠调Ollama环境变量(比如开启Flash Attention、更换KV缓存类型)让7个27B-35B模型常驻同一张3090、峰值显存不到15GB的进阶玩法。微信公众号
至于70B、120B这种大家伙,按上面的公式算,Q4量化也要40GB上下的显存。显存不够时Ollama可以让它走CPU/内存混合硬跑,但速度会大幅下降,"能跑"和"能用"是两回事。
Mac用户单独说:统一内存的好处是能装下很大的模型,短板一直是推理速度。0.32.6这次的MTP加速就是冲着这个短板去的,尤其利好代码类场景。参考数据上,6月这套机制在Gemma4上落地时,M5 Max的代码基准测试里平均生成速度提升接近90%。今日头条注意,那是Gemma4+代码场景的数据,Qwen3.5目前没有同等官方测试,实际提升要自己跑过才知道。

跑起来卡,真不一定是显卡的锅
翻踩坑帖发现,相当一部分"带不动"其实是配置问题,换卡之前先排除这三条:
第一,量化别贪高。Q4_K_M是质量和体积的平衡点,8G卡硬上Q5、Q6属于自己为难自己。微信公众号
第二,上下文窗口是隐形显存杀手。有实测发现,Ollama设置里选了4K上下文,但模型实际按默认的大上下文在跑,设置没生效,CPU推理直接超时。今日头条日常聊天把上下文收在4K档通常就够用,还能省下可观的显存余量。
第三,后台在偷显存。Windows桌面本身和浏览器标签页会悄悄占用显存,8G卡跑模型前把这些关掉,是成本为零的优化。

还有两个特定人群的坑。AMD显卡用户在Windows下基本享受不到GPU加速,ROCm路线主要在Linux下可用,要么折腾Vulkan,要么考虑换工具。有A卡用户反馈,拿Ollama本地跑大模型时推理过程中显卡基本闲置、完全不调用显存,换了LM Studio才恢复丝滑。百家号另外有人发现,Ollama对10GB以下显存的卡有个隐藏策略:会把多模态模型的视觉模块锁在CPU上,8G卡明明带得动也不让用。哔哩哔哩这属于软件策略问题,已经有硬核玩家改源码解决,普通用户知道有这回事就行。
到底要不要买新卡?
先说不用买的情况:你手里的硬件大概率比你想的更能打。Ollama这半年的更新主线之一就是"免费榨干现有硬件"——0.13.2修复了GTX 1080这类老卡的兼容性问题,4B多模态模型在老卡上实测显存占用只要4.7GB、推理速度15-20 tokens/秒。今日头条0.32.3又给Windows ARM64(Surface Laptop这类)补上了CUDA支持。微信公众号软件还在持续释放存量硬件的性能,此时花钱升级往往是最贵的解法。
再说值得买的情况:如果你明确要跑14B以上模型、要长期玩本地AI,显存确实是硬门槛,软件优化突破不了物理上限。这个档位上,社区讨论度最高的建议是二手RTX 3060 12GB,行情大约在1500-2000元区间,被不少人称为本地跑LLM的性价比之选。今日头条这个价格是社区说法,下单前记得对照实时行情。
还有个容易被忽略的变量:工具本身。llama.cpp、Ollama、LM Studio底层用的是同一套推理引擎,但封装和调度策略不同,值得买社区有帖子实测同一显卡同一模型,不同工具的速度差距能到数倍。值得买社区差距这么大,说明"选对工具"有时比"升级显卡"更划算。
后续值得盯的三个信号
Ollama的MTP加速会不会扩展到Qwen3.5之外的更多模型——如果成了,等于所有用户的存量硬件集体升值;
云端模型和本地模型的联动,Ollama从v0.12.0就开始做云端模型入口,小显存用户的折中方案会越来越多。知乎
0.32.6临时移除的实验性图像生成功能什么时候加回来,需要画图的朋友在那之前建议先留在0.32.5。今日头条
如果你现在想上手:先按上面的对照表选好模型,`ollama run qwen3:8b` 一行命令的事,跑通了再谈升级硬件。

一句话收尾:本地大模型这件事,80%的"带不动"是选错了模型或者配置没调对,先查表、再调参、最后才掏钱。