5090涨到3万5,3060涨了45%:跑大模型的人转头去买魔改卡,1GB显存到底值多少钱

源自20位全网作者

07:04

今年8月底,显卡市场给本地大模型玩家递上来一份残酷的账单。8月27日的显卡日报写道,今天显卡价格有所下跌,但是RTX5090D 32GB涨至34999元,又回到了历史最高价。知乎复产的RTX3060 12GB涨得更凶,这款显卡自7月初在美国市场重新上架以来,价格已上涨约45%,目前售价已超过性能更优的新款RTX5050。知乎

工作站卡市场同样火热,Marketplace将RTXPRO6000Blackwell工作站版的标价上调至16,000美元,折合人民币约11万元,这张卡2025年3月首发时的建议零售价是8,565美元,一年半涨了87%。知乎这些卡涨价的背后是同一个原因——显存荒。因为显存荒,老黄的核心产能实际上没那么紧张了,甚至有些富余,超大规模的核心配上不够的显存,刚好可以攒出一张游戏卡,再消化一部分产能。知乎

于是真正想跑本地大模型的人,把目光投向了咸鱼:大量显存翻倍的魔改卡正在涌入。最近显卡叕涨了一波,但好在一张2080Ti22GB魔改卡目前的价格大致是2.3k左右,不算太高。知乎RTX 3080 20G魔改卡价位如今已经暴涨到3千元左右。知乎RTX 4080魔改32G涡轮卡,价位方面也是高的吓人的存在,普遍超过了上万元的存在。知乎

最顶端的4090 48G魔改卡更夸张,其从24G显存容量魔改翻倍达到了48G的恐怖程度,当然价位也是极为恐怖,清一色的高达2万多,号称全新显卡!知乎对不少人来说,这已经是一整台工作站的年预算了。

5090涨到3万5,3060涨了45%:跑大模型的人转头去买魔改卡,1GB显存到底值多少钱

对跑本地大模型的人来说,真正的问题已经不是“买哪张卡”,而是“现在1GB显存到底值多少钱”。这篇文章就来把这笔账算清楚。

先算一笔账:你到底需要多少显存

以最近讨论度最高的开源模型Qwen3.8-27B为例,满血版要55.6G显存,量化版只要17G,8GB最低量化仅体验、16GB入门、24GB甜点(跑4bit)、32GB约8bit近无损、双卡48GB才能上满血。哔哩哔哩

所以买卡之前,先回答两个问题:你要跑什么模型,能不能接受量化?只跑27B的4bit量化,22GB就够了;想要近无损甚至满血,就得32GB起步或者上双卡。显存需求决定预算档位,卡型只是档位里的选项。

显存成本账:每1GB差价能到35倍

把咸鱼上讨论度最高的几张卡的行情价整理出来,按每1GB显存折算单价:

卡型

大致价格

显存

每GB单价

Tesla P100 16G

498元

16G

约31元

RTX 2080Ti魔改22G

约2300元

22G

约105元

RTX 3080魔改20G

约3000元

20G

约150元

RTX 4080魔改32G

10000元以上

32G

约313元

RTX 4090魔改48G

20000元以上

48G

约417元

RTX 5090D 32G

34999元

32G

约1094元

从31元到1094元,1GB显存的单价差了约35倍。最便宜的Tesla P100 16GB,流出价只要498元,16GB大显存可以轻松运行14B大模型。知乎但它是Pascal架构的GP100核心,没有Tensor Core,“能跑”的上限很清楚,只适合当入门练习机。

魔改卡靠硬改显存实现越级。以4080魔改卡为例,它是魔改扩容翻倍的显存容量版本,直接16G扩容到32G,通过更换显存颗粒实现容量翻倍,算是填补了“CUDA生态+32G显存+非专业卡”市场空白。知乎常见做法是把1GB颗粒换成2GB颗粒、改PCB配置电阻再刷入定制vBIOS,核心本身一般不动。

5090涨到3万5,3060涨了45%:跑大模型的人转头去买魔改卡,1GB显存到底值多少钱

所以魔改卡买的本质是“显存容量”,不一定是“速度”。这个差别在实测里体现得最明显。

速度不能只看显存:两组实测样本

最便宜的组合是2080Ti四卡并行。UP主用四张2080Ti魔改卡跑Qwen3.8-27B-FP8,最少两张卡也能部署,他自己实测速度是45tokens每秒,没有使用nvlink,听说使用nvlink更快,可以超过100tokens每秒。哔哩哔哩

评论区还有更极限的数据:有车主在540K上下文下跑出decode峰值58t/s,prefill速度1700+t/s。哔哩哔哩这个速度已经进入能正经干活的区间。

往上一档是魔改4080 Super 32G。5090 还是最快,约 220 token/s。它代表的是新一代旗舰的上限。魔改 4080 Super 32G 约 150 token/s,落后 5090 明显,但并不慢。粗略算一下,它达到了 5090 的 68% 左右。知乎

注意这个150 token/s是跑MoE模型的成绩。稠密模型就没这么轻松。比如 Qwen 3 类 27B、Gemma/Gemini 类 31B 这类 30B 级稠密模型,魔改 4080 Super 32G 大致能跑到 30 token/s 以上。知乎如果你的目标模型是稠密架构,速度预期要大幅下调。

5090涨到3万5,3060涨了45%:跑大模型的人转头去买魔改卡,1GB显存到底值多少钱

三个比显卡更便宜的坑

坑一:多卡并行不等于显存翻倍。RTX 4080 Super 没有 NVLink。多卡之间主要走 PCIe。PCIe 4.0 x16 理论带宽约 32GB/s,PCIe 5.0 x16 约 64GB/s。作为对比,3090 的 NVLink 3.0 约 100GB/s,而 4080 Super 自身显存带宽约 736GB/s。知乎卡间通信和本地显存访问根本不是一个量级。

所以把两张 4080 Super 32G 拼起来,不等于得到一张 64GB 大显存旗舰卡。知乎模型如果频繁跨卡交换数据,多卡性能会被通信拖住,下单前先确认你的框架和并行方式吃不吃得消。

坑二:FP8模型文件不等于FP8硬件加速。2080Ti四卡视频下有人直接问,为什么选择fp8不选择q8,2080ti不支持fp8。哔哩哔哩Turing架构本身没有FP8张量加速,40 系并不支持硬件 NVFP4 加速,低精度加速主要到 FP8 这条线。知乎想押注下一代超低精度模型,新架构的溢价是真实存在的。

坑三:软件层会吃掉硬件的功夫。有位AMD卡用户把折腾过程做成了视频,显卡反复黑屏掉驱动,他认定750W电源带不动7900XT,连1000W电源都加进了购物车,盯了一整晚监控才发现硬件全程无辜,凶手是全网教程第一步都让你装的Ollama,换LMStudio调对参数后,同一台机器同一个模型,token速度直接起飞。哔哩哔哩N卡阵营也一样,我们自己搭了GPU集群跑大模型,用的魔改48G的4090,vLLM部署,跑了大半年了。知乎同一张卡换一套部署框架,性能差距可能远超直觉。

按预算给出的购买建议

3000元以内档:2080Ti魔改22G基本是唯一选项,适合跑Q4量化模型。有条件组双卡的话,一个六七千的工作站双卡轻松44g显存,正好怼到现在能流畅干活的本地大模型配置上,模型智力够,上下文也够。知乎

8000—11000元档:魔改4080S 32G是主战场,卖家普遍号称大厂工包、三年质保。知乎但下单前必须把功课做足,要看改装工艺、压力测试、售后、质保,以及卖家是否长期做这类产品,不要只看32GB三个字就下单。知乎

5090涨到3万5,3060涨了45%:跑大模型的人转头去买魔改卡,1GB显存到底值多少钱

同时要清醒一点:魔改卡没有任何官方背书,魔改的缺陷极为明显,翻车率肯定是存在的,官方不认可,售后也难有保证。知乎接受不了翻车风险,攒钱买原生32G的新卡或者等行情回落,也是理性选择。

接下来值得盯的三个信号

一是显存荒是否缓解。魔改卡吃香的根源是新卡供给跟不上需求,一旦显存供应恢复,新卡和魔改卡的涨价逻辑会同时松动。

二是新产品定位。消息称英伟达今年将推出一款定位高于GeForceRTX5090的新显卡。知乎如果落地,高端消费卡的价格空间会被再挤压一次。

三是魔改卡的资产化。4090 48G魔改卡原先某宝入手价位2万3千多,如今暴涨三千多。知乎魔改卡已经在跟着行情当理财产品走,买来用就尽早用,想炒一把的风险不比炒卡小。

这一轮涨价里,1GB显存的价格从31元到1094元都有。先算清自己的模型到底要多少显存,再看哪张卡的每GB单价合理,这比追着价格曲线跑要稳得多。

内容由AI生成

精选参考来源

1. RTX3060价格暴涨|显卡日报8月28日

2. 也是一大坨:RTX306012G复产后,价格暴涨超过RTX5050

3. 如何看待RTXPro6000显卡被炒到10万?

4. 消息称英伟达今年将推出一款定位高于GeForceRTX5090的新显卡,对此你怎么看?

5. 炼丹老卡2080Ti能否驾驭本地大模型之王qwen3.8-27B(含模型能力测试)

6. 上万元的高端魔改显卡?咸鱼大量流出RTX 4080魔改32G显存容量显卡,还是全新涡轮散热显卡,能跑30B大模型,你敢入吗?

7. AI大模型秒杀5090显卡?咸鱼大量流出2万多全新RTX 4090 48G魔改公版涡轮显卡,48G翻倍显存容量,还是理财神器产品!

8. 咸鱼大量流出RTX 3080 20G 魔改显卡,显存翻倍高达20G,跑分超73W,速度达3090八成多,价格却只要一半,捡漏神卡还是入坑!

9. 咸鱼大量流出全新RTX4080S32G涡轮显卡,号称大厂工包三年质保,性能媲美RTX4090D显卡,AI炼丹师的梦中情卡?

10. 同样32GB显存,RTX 5090和魔改4080 Super怎么选?

11. 最低成本部署阿里最新开源的Qwen3.8-27B-FP8|2080Ti魔改版显卡本地化跑Qwen3.8-27B-FP8大模型

12. 千问3.8-27B本地部署全攻略:满血55.6Gvs量化17G,配置/显存/成本对比

13. 同一台机器速度5变60,我只是卸载了Ollama|AMD本地大模型全网教程纠错实录

14. 有必要自己将deepseek部署到本地吗?

15. 498元!咸鱼流出ITX版特斯拉 P100 16GB显卡,短款定制版,仅15cm卡长,还是双风扇版本,可轻松运行14B大模型!

16. 如何评价RTX2080Ti22G魔改版?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章