这周的显卡圈,出现了一个有点魔幻的现象。
蹲在显卡日报下面看价格的,不再只是等装机的游戏党,还多了一群被 DeepSeek 账单劝退的 AI 用户。两拨原本井水不犯河水的人,现在盯上了同一张价格表。
一边,是 8 月 17 日零点生效的 DeepSeek 新价格:V4 Pro 高峰时段输出从 6 元涨到 27 元/百万 Token,一次涨了 350%;缓存命中输入从 0.025 元涨到 0.3 元,涨了 12 倍。微博社区情绪当场反转,曾经把 API 打到白菜价的“价格屠夫”,被网友戏称“梁文谷”——高峰期根本用不起。
另一边,是同一周阿里开源的 Qwen3.8-27B。社区为它沸腾的原因很具体:这个 27B 参数的模型,4 比特量化后刚好塞进一张 24GB 显存的消费级显卡,第三方榜单得分却追平了参数量大它几十倍的旗舰级模型。知乎有人一句话总结:“Qwen 3.8 is having a DeepSeek moment。”
两件事叠在一起,就催生了本周 AI 硬件圈最热的一个问题:API 变贵了,24G 显卡又刚好够用,我是不是该买张卡自己跑,实现“Token 自由”?
只不过,这个问题还有一个绕不开的背景板:显卡自己,正在涨价潮里。
一、为什么这次“买卡跑模型”是真火,不是极客自嗨
过去两年,本地部署一直是小圈子的爱好。这次不一样,它是被两个实实在在的变化推出来的。
第一个变化,是模型终于落到了“消费级甜点位”。以前是能在消费级显卡上跑的模型不够聪明,够聪明的模型消费级显卡塞不下。Qwen3.8-27B 把这个死结解开了:Q4_K_M 量化后权重约 15-17GB,一张 24GB 显存的卡连模型带 KV cache 约 22.3GB,能完整跑 64K 上下文;部署文档称其 4 比特量化后能保留全精度 95.59% 的能力。知乎第三方榜单 Artificial Analysis 给出 52 分,追平 284B 参数的 DeepSeek V4 Flash。翻译一下:原来要花高价 API 才能摸到的“旗舰级体验”,现在一张消费级显卡就能装下。

第二个变化,是 API 真的贵了,而且贵得很“结构性”。很多人以为 DeepSeek 涨价是为了赚钱,知乎热评一句话点破:峰看的不是用的人有多少,而是训练负载的峰值。峰谷定价的本质,是劝你白天别跟训练抢算力。问题在于,多数上班族的重度使用时段恰恰是白天,正好撞在最贵的峰段上。而从 8 月 23 日起,周末全天统一按低谷价计费,算是回应了社区情绪,但工作日白天依然是高价档。微博
社区的反应很直接。X 上开始有人发“今天起停掉 AI 编程订阅”。Reddit 上 799 赞的热帖晒单张 3090 让模型全自动执行 80 次工具调用。知乎B 站的显卡推荐视频,也已经把“本地部署大模型”列成了和游戏党并列的独立适用场景。
二、先泼盆冷水:卡本身在涨,大显存卡正是重灾区
这波显卡涨价,和以往任何一次“矿潮”都不同,它是从上游涨上来的。
链条大致是这样:AI 算力需求吃掉了存储芯片产能。云厂商和 AI 企业提前锁死多年长单,存储厂主动倾斜产能,于是先是 DDR 内存和 SSD 涨价,紧接着 GDDR 显存供货收紧、报价飙升,显卡被连带冲击。知乎上,“RTX5060Ti 显卡价格暴涨至 6000 元,其背后可能存在哪些原因?”已经成了热门问题。知乎显卡日报里,RTX 5050 在 8 月 24 日涨到 2488 元,刷新历史最高价。就连 SK 海力士的淘宝旗舰店,也在这两天宣布终止经营——内存原厂连零售渠道都在收缩,产能往哪边倾斜不言自明。

更关键的是,对“买卡跑模型”的人来说,涨得最凶的恰恰是大显存卡。“如何评价此次显卡涨价”的讨论里,被反复追问的问题之一就是:是不是只有大显存卡涨价了?闲鱼开始大量流出 RTX 3080 20G 魔改卡,号称“速度达 3090 八成多,价格却只要一半”;B 站一条“RTX 4090 48G”魔改卡视频两天播放近 10 万,评论区四百多人在吵它到底值不值。
这些信号说明什么?说明“买卡跑模型”的需求,已经开始外溢到灰色地带——正常的大显存卡太贵,人们就开始找魔改卡。这种行情下入场,你的回本账必须按今天的价格重算,而不是沿用去年卡价下的老结论。
三、回本账怎么算:别急着下单,先把自己的数填进去
本地部署的经济账不复杂,核心就一条公式:
回本月数 = 卡价 ÷(每月 API 账单 − 每月电费分摊)
先说电费。跑 27B 模型,显卡负载大致在 300W 上下,按居民电价估算:每天跑 8 小时,一天约 2.4 度电,一年电费 500 元上下;7×24 小时满载,一年 1500 元左右。这个数比很多人想象的小,不改变回本量级,但要算进去。
关键是公式左边的两个数。
卡价:以主流的 24G 二手卡为例,涨价潮下新卡、二手大显存卡的价格都和半年前不同,下单前请以当天显卡日报和闲鱼实际成交价为准。下面举例统一用 6000 元这个假设值,你换成自己的真实报价即可。
账单:分两档举例。
重度用户 A:API 月账单 1000 元(这轮涨价后,重度开发者普遍到了这个量级)。6000 ÷(1000 − 40)≈ 6 个月回本。第 7 个月起都是净省,而且卡用完还能出掉——涨价潮里二手显卡罕见地保值甚至增值,这是“一块二手 24GB 卡几个月回本”说法的由来。知乎

轻度用户 B:偶尔写文案、问问题,涨价后月账单从 50 涨到 100 元。6000 ÷(100 − 40)≈ 100 个月,八年多。届时模型都换了八代。
这就是本周争论的答案:“Token 自由”不是人人有份的福利,它只对账单过线的人成立。
社区其实早把账算过一遍。4090 48G 魔改卡的评论区里,有人给出了详细反算:2 万的 48G 卡、跑 32B 模型、每秒 30 token、对标云端 20 元/百万 token——要 7×24 拉满跑一年才回本,不算电费。而且这个算法还有两个隐藏前提:本地小模型的输出质量能顶替云端大模型、利用率真能拉满。这两条对个人几乎不可能成立,所以结论很直白:轻度使用,租算力永远比买卡划算。
四、三个坑,其中两个反直觉
坑一:双卡凑显存。 有人为省钱买两张 5060 Ti 16G 凑 32G 跑 27B。显存够不等于体验好——位宽和通讯带宽的瓶颈,会让同一个模型在双卡和单卡之间差出一个量级。知乎本地部署,显存宁大一卡,不拆两半。
坑二:别拿宣传速度当预期。 同一套 4090 24G + Qwen3.8-27B-Q4,社区实测约 80 tok/s;优化更激进的另一套 3090 方案,普通聊天提示词约 133 tok/s,而它宣传的 381 tok/s 是 RAG 场景下“答案大量复述上下文文档”的特例。日常使用请按 80-133 tok/s 建立预期——完全够用,但别按 381 规划体验。另外,4 比特量化“保留 95.59% 能力”目前也只有部署方口径,社区实测者自己强调:未测过的任务区间无法保证,这不等于证明无损。
坑三:别赌“买了就能用很久”。 模型月月换代,V2EX 上四月就有人提醒,两个月后出了 40-60B 新模型,你的硬件就跑不动了。知乎也别忽略反面教材:有人的单位去年为部署大模型买的 4090 工作站,现在正在吃灰。为可能不存在的需求买卡,才是最大的沉没成本。
顺带打消一个念头:“顺便帮别人跑算力回血”。按业内人士的说法,买卡转售算力在批发模式下普遍不划算——“单卡 5090 跑满 24 小时一年赚 3 万”是机房批发的账,不是自用的账。
五、决策表:该买的是这 3 类,不该买的是这 2 类
建议买:
重度用户:API 月账单长期过几百元,且重度时段正好撞在白天高峰档;
隐私刚需:数据不能出本地,云端再便宜也用不了;
手里已经有 24G 及以上显存显卡的人:不用买,直接部署,零成本纯赚。
不建议买:
月账单 100 元以内的轻度用户:涨价多花的钱,攒一年不够半张卡;
抱着“一次买好用五年”心态的人:硬件会过时,模型会换代,买卡买的是当下。
中间档的务实路线:先把能挪的负载挪到 API 低谷时段(DeepSeek 周末已全天谷价),再用云平台的免费额度把 Qwen3.8-27B 完整跑一遍,确认它真能接住你的活,再决定要不要为它买卡。
六、想等的人,盯住这三个信号
信号一:显卡价格是否已经见顶。 8 月 24 日的显卡日报已经注意到,大部分型号脱离了历史最高价、出现轻微背离,连作者都在问顶部是不是已经形成了。知乎背离是否延续,再看一周的日报数据就清楚,不必急着接。
信号二:上游产能何时回血。 这轮涨价的根源是存储产能被 AI 订单占走,SK 海力士收缩零售渠道说明原厂重心仍在大客户,零售端短期难松动。反过来,一旦内存价格停涨,显卡的成本压力就会缓解——内存报价是最早的观察哨。
信号三:模型两端的变化。 DeepSeek 周末谷价之后会不会继续让利,决定你的账单高度;下一代开源模型多久冒出来,决定你的卡能用多久。这两个变量,比显卡价格本身更影响这笔账。

说到底,这轮双向涨价的本质,是 AI 需求在给两头同时重新定价:API 在涨,显卡也在涨。“Token 自由”从来不是零成本,它只是给账单过线的人多一个选项。轻活用 API,重活、私事、自动化放本地——账算清楚了,买不买都有答案。