今年8月底,显卡市场给本地大模型玩家递上来一份残酷的账单。8月27日的显卡日报写道,今天显卡价格有所下跌,但是RTX5090D 32GB涨至34999元,又回到了历史最高价。知乎复产的RTX3060 12GB涨得更凶,这款显卡自7月初在美国市场重新上架以来,价格已上涨约45%,目前售价已超过性能更优的新款RTX5050。知乎
工作站卡市场同样火热,Marketplace将RTXPRO6000Blackwell工作站版的标价上调至16,000美元,折合人民币约11万元,这张卡2025年3月首发时的建议零售价是8,565美元,一年半涨了87%。知乎这些卡涨价的背后是同一个原因——显存荒。因为显存荒,老黄的核心产能实际上没那么紧张了,甚至有些富余,超大规模的核心配上不够的显存,刚好可以攒出一张游戏卡,再消化一部分产能。知乎
于是真正想跑本地大模型的人,把目光投向了咸鱼:大量显存翻倍的魔改卡正在涌入。最近显卡叕涨了一波,但好在一张2080Ti22GB魔改卡目前的价格大致是2.3k左右,不算太高。知乎RTX 3080 20G魔改卡价位如今已经暴涨到3千元左右。知乎RTX 4080魔改32G涡轮卡,价位方面也是高的吓人的存在,普遍超过了上万元的存在。知乎
最顶端的4090 48G魔改卡更夸张,其从24G显存容量魔改翻倍达到了48G的恐怖程度,当然价位也是极为恐怖,清一色的高达2万多,号称全新显卡!知乎对不少人来说,这已经是一整台工作站的年预算了。

对跑本地大模型的人来说,真正的问题已经不是“买哪张卡”,而是“现在1GB显存到底值多少钱”。这篇文章就来把这笔账算清楚。
先算一笔账:你到底需要多少显存
以最近讨论度最高的开源模型Qwen3.8-27B为例,满血版要55.6G显存,量化版只要17G,8GB最低量化仅体验、16GB入门、24GB甜点(跑4bit)、32GB约8bit近无损、双卡48GB才能上满血。哔哩哔哩
所以买卡之前,先回答两个问题:你要跑什么模型,能不能接受量化?只跑27B的4bit量化,22GB就够了;想要近无损甚至满血,就得32GB起步或者上双卡。显存需求决定预算档位,卡型只是档位里的选项。
显存成本账:每1GB差价能到35倍
把咸鱼上讨论度最高的几张卡的行情价整理出来,按每1GB显存折算单价:
卡型 | 大致价格 | 显存 | 每GB单价 |
|---|---|---|---|
Tesla P100 16G | 498元 | 16G | 约31元 |
RTX 2080Ti魔改22G | 约2300元 | 22G | 约105元 |
RTX 3080魔改20G | 约3000元 | 20G | 约150元 |
RTX 4080魔改32G | 10000元以上 | 32G | 约313元 |
RTX 4090魔改48G | 20000元以上 | 48G | 约417元 |
RTX 5090D 32G | 34999元 | 32G | 约1094元 |
从31元到1094元,1GB显存的单价差了约35倍。最便宜的Tesla P100 16GB,流出价只要498元,16GB大显存可以轻松运行14B大模型。知乎但它是Pascal架构的GP100核心,没有Tensor Core,“能跑”的上限很清楚,只适合当入门练习机。
魔改卡靠硬改显存实现越级。以4080魔改卡为例,它是魔改扩容翻倍的显存容量版本,直接16G扩容到32G,通过更换显存颗粒实现容量翻倍,算是填补了“CUDA生态+32G显存+非专业卡”市场空白。知乎常见做法是把1GB颗粒换成2GB颗粒、改PCB配置电阻再刷入定制vBIOS,核心本身一般不动。

所以魔改卡买的本质是“显存容量”,不一定是“速度”。这个差别在实测里体现得最明显。
速度不能只看显存:两组实测样本
最便宜的组合是2080Ti四卡并行。UP主用四张2080Ti魔改卡跑Qwen3.8-27B-FP8,最少两张卡也能部署,他自己实测速度是45tokens每秒,没有使用nvlink,听说使用nvlink更快,可以超过100tokens每秒。哔哩哔哩
评论区还有更极限的数据:有车主在540K上下文下跑出decode峰值58t/s,prefill速度1700+t/s。哔哩哔哩这个速度已经进入能正经干活的区间。
往上一档是魔改4080 Super 32G。5090 还是最快,约 220 token/s。它代表的是新一代旗舰的上限。魔改 4080 Super 32G 约 150 token/s,落后 5090 明显,但并不慢。粗略算一下,它达到了 5090 的 68% 左右。知乎
注意这个150 token/s是跑MoE模型的成绩。稠密模型就没这么轻松。比如 Qwen 3 类 27B、Gemma/Gemini 类 31B 这类 30B 级稠密模型,魔改 4080 Super 32G 大致能跑到 30 token/s 以上。知乎如果你的目标模型是稠密架构,速度预期要大幅下调。

三个比显卡更便宜的坑
坑一:多卡并行不等于显存翻倍。RTX 4080 Super 没有 NVLink。多卡之间主要走 PCIe。PCIe 4.0 x16 理论带宽约 32GB/s,PCIe 5.0 x16 约 64GB/s。作为对比,3090 的 NVLink 3.0 约 100GB/s,而 4080 Super 自身显存带宽约 736GB/s。知乎卡间通信和本地显存访问根本不是一个量级。
所以把两张 4080 Super 32G 拼起来,不等于得到一张 64GB 大显存旗舰卡。知乎模型如果频繁跨卡交换数据,多卡性能会被通信拖住,下单前先确认你的框架和并行方式吃不吃得消。
坑二:FP8模型文件不等于FP8硬件加速。2080Ti四卡视频下有人直接问,为什么选择fp8不选择q8,2080ti不支持fp8。哔哩哔哩Turing架构本身没有FP8张量加速,40 系并不支持硬件 NVFP4 加速,低精度加速主要到 FP8 这条线。知乎想押注下一代超低精度模型,新架构的溢价是真实存在的。
坑三:软件层会吃掉硬件的功夫。有位AMD卡用户把折腾过程做成了视频,显卡反复黑屏掉驱动,他认定750W电源带不动7900XT,连1000W电源都加进了购物车,盯了一整晚监控才发现硬件全程无辜,凶手是全网教程第一步都让你装的Ollama,换LMStudio调对参数后,同一台机器同一个模型,token速度直接起飞。哔哩哔哩N卡阵营也一样,我们自己搭了GPU集群跑大模型,用的魔改48G的4090,vLLM部署,跑了大半年了。知乎同一张卡换一套部署框架,性能差距可能远超直觉。
按预算给出的购买建议
3000元以内档:2080Ti魔改22G基本是唯一选项,适合跑Q4量化模型。有条件组双卡的话,一个六七千的工作站双卡轻松44g显存,正好怼到现在能流畅干活的本地大模型配置上,模型智力够,上下文也够。知乎
8000—11000元档:魔改4080S 32G是主战场,卖家普遍号称大厂工包、三年质保。知乎但下单前必须把功课做足,要看改装工艺、压力测试、售后、质保,以及卖家是否长期做这类产品,不要只看32GB三个字就下单。知乎

同时要清醒一点:魔改卡没有任何官方背书,魔改的缺陷极为明显,翻车率肯定是存在的,官方不认可,售后也难有保证。知乎接受不了翻车风险,攒钱买原生32G的新卡或者等行情回落,也是理性选择。
接下来值得盯的三个信号
一是显存荒是否缓解。魔改卡吃香的根源是新卡供给跟不上需求,一旦显存供应恢复,新卡和魔改卡的涨价逻辑会同时松动。
二是新产品定位。消息称英伟达今年将推出一款定位高于GeForceRTX5090的新显卡。知乎如果落地,高端消费卡的价格空间会被再挤压一次。
三是魔改卡的资产化。4090 48G魔改卡原先某宝入手价位2万3千多,如今暴涨三千多。知乎魔改卡已经在跟着行情当理财产品走,买来用就尽早用,想炒一把的风险不比炒卡小。
这一轮涨价里,1GB显存的价格从31元到1094元都有。先算清自己的模型到底要多少显存,再看哪张卡的每GB单价合理,这比追着价格曲线跑要稳得多。