这周想给本地大模型添显卡的朋友,大概率被连锤了两下。
第一锤来自 DeepSeek。8月17日零点,DeepSeek 悄悄换了价目表:V4 系列 API 取消统一计费,改成行业里少见的峰谷分级计价,北京时间 9:00—12:00、14:00—18:00 算高峰时段,收费直接按空闲时段的翻倍来算。微博具体到数字,V4-Pro 高峰时段的输出价格到了 27 元/百万 tokens,缓存命中的输入价格从 0.05 元涨到 0.25 元/百万 tokens,一项就翻了 5 倍。知乎V4-Pro 也顺势结束测试,转成正式版商用服务。微博有重度用户算了笔账:这个价位下跑一个月,API 费用能顶上小半年电费。
于是很多人的第一反应是:惹不起我躲得起,转本地跑。然后第二锤就来了——显卡也涨了,而且涨得比 API 狠。
如果你这两周去过华强北,会发现显卡市场"封板"了。这个词用得跟股票涨停一样准确:商家集体停止报价、暂停出货。知乎不是不想卖,是没人敢定价——早上定的价,下午就亏本。有品牌的工厂直接封仓,订单取消,连之前已经付了钱的预售单都作废。界面新闻
价格是什么样的?按市场端整理的数据:5090 官方定价 1999 美元、折合人民币一万四出头,现在现货起步价 3 万,涡轮版报到 3.7 万,美国市场中位价 4700 美元,比建议零售价高出 135%。有黄牛在群里收 5090,一千片起步,含税 3.8 万一片,现货秒付——显卡已经被当理财产品收了。知乎5080 从七千三涨到一万二;连入门的 5060 Ti 都没放过,16G 版两个月涨了 39%,8G 版从 2350 涨到 3400。二手 3090 同样不是抄底价了:美国市场 12 个月低点 800 美元,8 月初已经到 1677 美元;国内从去年五六千涨到七八千。

为什么涨?源头不在显卡,在显存。三星、SK 海力士、美光把 70% 到 90% 的先进产能优先供给 AI 用的显存,留给普通显卡的颗粒不到一成,颗粒现货价半年涨了 200%。引用 IDC 的数据更直白:2026 年 AI 数据中心要吃掉全球 70% 的内存产能,2022 年这个数字还只有两三成。知乎同一波涨价已经外溢到全行业——临近开学,同配置笔记本较去年普遍涨了 800 到 1500 元。微博
先泼两盆冷水,因为不是所有人都需要慌。
第一盆:这次涨价只动 API。如果你平时就是用 DeepSeek 官网或 APP 聊天、写文案,不自己调接口,那官方没有对个人用户收费的计划,全程照旧免费,这条新闻跟你没关系,不用跟着焦虑。微博
第二盆:就算你是 API 用户,也要先算自己的量。峰谷价意味着想省钱可以把批量任务挪到凌晨跑(半价)。知乎一个月几百万 tokens 的轻中度用量,涨价后一个月也就多一顿饭钱。真正被锤到的是每天几十万 tokens 输出、跑 Agent、做批量处理的重度用户,以及靠廉价 API 堆业务的工具开发者——涨价公告下面"大批 AI 博主停更"的话题,说的就是这批人。微博
真被锤到了,再往下看。想解决"算力自由",现在摆在面前的其实是五条路,我把每条的账都算了一遍。
第一条路:先别买卡,把旧卡榨干。 这是很多人忽略的选项。跑大模型不一定需要 24G 显存——那是 Dense 模型的老逻辑。现在的旗舰模型基本都是 MoE 架构,每次推理只激活一小部分专家,大部分权重可以躺在内存里按需加载。实测下来,8G 显卡加 32G 内存的旧机器,跑 35B 级的 MoE(比如 Qwen3.6-35B-A3B 的量化版,文件 11GB 左右)绰绰有余,日常聊天、写代码都够用;要是有 24G 卡,用 moe-l2 这类工具,连 85GB 文件的 DeepSeek V4-Flash(157B 参数)都能跑起来,显存实际只占 17GB 上下,实测 35 tokens/秒。知乎电费一天几毛钱。这条路适合:手头有旧机器、主要做推理不训练的人。成本约等于零,先把这个选项榨干再谈买卡。

第二条路:租云算力,用时间换空间。 以 AutoDL 的 RTX 4090D 为例,常规价大约 2.58 元/GPU 小时,算一笔账:哪怕你每天跑满 12 小时,一个月约 929 元,一年 1.1 万出头;而自建一台 4090D 工作站,散件就要 2.3 万往上,加上整机供应商报价能到 3.6 万。知乎有人认真算过回本周期:按每小时电费 0.36 元对租金 2.58 元的差价,要用近两年半才回本——"每天跑 12 小时"并不是买了就省的分界线,真正进入经济优势区间得是每天 18 小时以上的持续高利用率。所以结论反直觉:这轮涨价里,租云反而是避险动作,你花租金买的是"不买在山顶"的期权。适合:训练需求断断续续、每天实际跑卡不到 12 小时的人。注意一个坑:部分平台关机后数据盘仍计费,长期项目要把存储成本一起算进去。知乎
第三条路:转投 AMD,这轮行情里的漏网之鱼。 逻辑很简单:AMD 这代卡用的是老一代显存,颗粒供货稳。不过涨幅的口径,渠道之间对不上。有装机党观察到,整卡官方通知涨 10%—15%,实际涨幅 5% 上下。知乎也有消息称,因显存成本上涨,RX9000 系列全产品线涨价,大显存型号涨幅最高接近 50%,RX 9070 XT 销售指导价到了 6999 元。微博但无论按哪个口径算,跟 N 卡普遍三成起步、旗舰翻倍相比都温和得多。至少到 8 月中旬,按装机党的观察,RX 9070 系列 16G 四五千块还能拿下,跑 7B、14B 模型绰绰有余,32B 量化也能试。但必须说清楚边界:AMD 的优势主要在推理端,如果你的"深度学习"是真的要训练模型,CUDA 生态的坑目前还是绕不开,ROCm 的算子覆盖和框架兼容性跟 CUDA 还有差距,别为了省钱把训练流程搭进去。适合:以本地推理为主、能接受折腾一点环境的人。

第四条路:必须 N 卡,那就躲开重灾区买涨幅小的。 如果工作流锁死 CUDA,非要现在买,原则是躲开被黄牛盯上的旗舰。这轮涨幅结构很清楚:5090 翻倍级、5080 涨六成,是重灾区;中端涨幅相对温和(5060 Ti 16G 两个月 39%)。但提醒一句:中端卡 16G 显存跑训练依然局促,这个价位更像是"先能用上"的过渡方案,不是终局配置。另外华强北封板期间渠道价一天一变,下单前多问几家、警惕矿卡,别在情绪最高的时候追单日最高价。界面新闻知乎
第五条路:等。 先说结论:可以等,但别指望等来大跳水。显存产能紧张预计要持续到 2027 年,新增产能放出来最快也是 2027 年下半年。知乎这是供给端明牌。需求端,AI 数据中心还在持续吃产能,这轮不是矿潮那种炒作型涨价,短期内没有崩盘的理由。所以"等"只适合两种人:需求本来就不急的,以及判断自己两年内需求会大幅变化的。等的过程中留意一件事:内存条也在涨,真到降价窗口,装机预算要整套重算,别只盯着显卡。
最后给几个可以持续盯的信号,比盯着情绪帖有用:显存颗粒的现货报价(这是所有硬件涨价的源头);云算力平台的时租价——如果租金开始跟涨,说明涨价已经传导到算力租赁端,"租"这条避险路也会变贵;还有 DeepSeek 峰谷价后续会不会继续调整,以及 Kimi 已经开始推 39—559 元的订阅套餐,API 普涨如果是行业趋势,本地化部署的价值只会更高。微博
一句话收个尾:这轮行情里最贵的操作不是买卡,是慌。免费用户不用跟着囤卡,轻度用户先算自己的 token 账单,重度用户把旧卡、租云这两个零/低成本选项试完,再决定要不要为翻倍的显卡掏钱——显存产能的账摆在 2027 年,你的钱不必现在就去山顶站岗。