DeepSeek涨价350%把人逼向本地部署,结果显卡也在涨:Token自由这笔账,我用全网实测帮你算完了

源自343位全网作者

14:05

这半个月,B站一条8万播放的本地部署教程评论区里,最扎心的一条留言是——有谁和我一样,是看到DeepSeek涨价后来看本地部署的?哔哩哔哩

底下一排人举手。有人说以前是"登不完、用不完",现在"一天就用完好几十块钱";有人算了笔新账:想跑个像样的27B模型,得买大显存卡,而大显存卡恰好正处在一轮历史性涨价周期里——用评论区原话说:24G显存显卡贵,20B以下的模型蠢,上不去下不来,卡在那里了。哔哩哔哩

两头涨价撞在一起,"要不要转本地"从月度月经题变成了真金白银的决策题。这篇不做安装教程(B站喂饭视频多得是),只干一件事:把8月到9月全网的行情、实测样本和老玩家的账本拼到一起,帮你把这笔Token自由账算清楚。

先看发生了什么:两头都在涨

API这头,DeepSeek真涨了。 8月上旬DeepSeek官宣整体上调API定价,8月17日落地,配套峰谷计价。知乎8月23日又公告周六周日全天按低谷时段收费。知乎涨幅按社区测算,高峰时段输出价上调约350%,空闲时段约175%;调价后Pro版高峰时段百万token输出约27元,Flash版约9元。知乎横向对比,能力相近的Kimi K3百万输出约100元、GLM 5.2约28元、Grok 4.6约43元——所以涨完的DeepSeek依然不算贵,只是"没法像之前那样淌着用了"。

涨价原因更有意思。OpenCode工程师Dax Raad透露的说法是:不是亏钱,是需求过载。Flash正式版发布后,光OpenCode一天就消耗8万亿token,占平台80%以上的调用额度。知乎翻译一下:这轮涨价本质是用价格把轻度用户劝走,给重度用户保算力。轻度用户被劝走了,往哪去?一部分就去了本地部署——这正是B站那条评论区的故事背景。

显卡这头,涨价的源头在显存。 8月的华强北显卡市场一度"封板":商家集体停止报价、暂停出货,工厂封仓,连付了钱的预售单都作废。根因是显存颗粒和AI服务器抢同一条生产线——三星、SK海力士、美光把70%到90%的先进产能优先供给了AI显存,留给消费级显卡的不到一成,颗粒现货价半年涨了约200%,一颗2GB的GDDR7超过20美元。知乎

反映到零售价,按装机博主9月2日的行情记录:5060 Ti 8G约3300元、16G版约5000元,5070约6600元,5070 Ti约9300元,5080约12000元;A卡这边9060 XT 16G约3300元,9070 XT约5800元。知乎对比6月,涨幅"很恐怖"。但9月的最新消息是涨不动了——涨价后销量难看,N卡以稳为主,短期不用担心大涨,等活动还能再便宜300元左右。

DeepSeek涨价350%把人逼向本地部署,结果显卡也在涨:Token自由这笔账,我用全网实测帮你算完了

还有个时机背景必须交代:"Token自由"这个词能在8月中下旬火起来,是因为Qwen3.8-27B爆了。这个27B稠密模型原生体积50多GB,常用量化版13-17GB,社区普遍反馈量化后能力能摸到DeepSeek Flash这一档。哔哩哔哩中国信通院的测评里,27B级本地模型在Agent任务上的完成率甚至接近万亿参数旗舰——虽然榜首总成功率也只有40.55%,说明离"替代旗舰"还远,但"个人硬件跑得动的模型第一次够用了"这个判断是成立的。知乎只是"够用了"的入场券,被显卡涨价劫了一道。

DeepSeek涨价350%把人逼向本地部署,结果显卡也在涨:Token自由这笔账,我用全网实测帮你算完了

你的卡能跑成什么样:全网实测样本汇总

行情说完看实际效果。我把知乎、B站评论区里用户晒出的实测样本归拢成一张表(均为个人案例,调优水平不一,看量级就好):

硬件方案

参考成本

模型与量化

实测表现

RTX 5060 Ti 16G 单卡

约5000元(新购)

Qwen3.8-27B IQ3

约25 token/s,高强度推理降到20,上下文勉强96k

RTX 4080 16G 老卡

0元(已有)

Qwen3.8-27B Q3_K_XL

前16k上下文稳定约42 token/s,调优两天可用

RTX 5060 Ti 16G ×2

约10000元(新购)

Qwen3.8-27B Q5

约40 token/s,支持长上下文

MacBook Air M5 32G

0元(已有)

Qwen3.6-35B-A3B 4bit

约52 token/s,正常可用

RTX 5070 Ti

约9300元(新购)

Gemma4-26B QAT

文档翻译场景约110 token/s

表里藏着三个规律:

第一,16G显存是"能玩"线,24G才是"实用"线。 12G显存跑27B这一代基本没戏,社区原话"有点逗";16G能靠低比特量化把27B塞进去,代价是智商打折、上下文缩水;想舒服要24G起步,而24G档的卡全在高位,5090甚至被评论区断言28年之前都降不下来。哔哩哔哩夹在中间的尴尬,就是"上不去下不来"这句话的硬件版。

第二,旧设备是这波最大的隐藏折扣。 4080 16G老卡、32G内存以上的M系Mac,都能给出可用速度。买新卡之前,先翻翻自己抽屉里那台旧设备姓什么——这是整篇文章里最省钱的一条建议。

第三,量化有坑,稠密模型更稳。 有玩家实测提醒:35B级MoE模型在Q4量化下会出现"门问题和死循环",在llama.cpp里还会被放大。哔哩哔哩相比之下27B稠密模型量化后损失小、更稳定。所以老玩家现在的共识是:新手直接从稠密模型起步,别一上来就挑战MoE。

DeepSeek涨价350%把人逼向本地部署,结果显卡也在涨:Token自由这笔账,我用全网实测帮你算完了

Token自由的成本账:精确到月

进入正题。本地部署的真实成本 = 硬件折旧 + 电费 + 你的折腾时间。用社区行情价来算:

方案A:零投入,用现有PC或Mac。 只花电费。整机推理按250W、每天4小时、民用电0.55元/度算,月电费约16元。这基本等于免费,代价是速度和折腾时间。手里有16G显存卡或32G内存Mac的,强烈建议先把这条路跑通再说。

方案B:新购5060 Ti 16G,约5000元。 卡的保值社区有两种判断。乐观派认为本地部署相关硬件一年内保值,毕竟还在涨价周期里。知乎悲观派认为消费级硬件追大模型是在追移动靶,半年折旧严重。知乎取中间值按两年折旧:硬件月均约208元,加电费约20元,月度成本约230元

方案C:双16G卡或24G单卡,约10000元。 同样算法,月度成本约440元,换来的是27B满速+长上下文,或者跑更大模型的余地。

再看API那头你的月支出。社区口径相当一致:涨价后"一个月能花100就算用得多了"是轻度用户的水平;而用Agent写代码的重度用户"一天烧好几十块",月支出轻松600-1500元。哔哩哔哩

盈亏平衡线画出来,结论有点反常识:

  • 月AI支出低于150元:别为省钱买卡,两年都回不了本。你该做的是用足低谷价——现在周末全天都是低谷时段——或者免费模型凑合。

  • 月支出150-450元:灰色地带。方案B的月成本正好压在这个区间,买不买取决于你多看重"不限量"的心理安全感,纯财务上不赢不亏。

  • 月支出450元以上的高强度用户:本地明显回本,而且用得越狠省得越多。Token自由这个词,只有在这一档才成立。

顺带排掉一个"伪本地"的坑:有人琢磨云端租卡,5090时租约3元,听起来便宜。评论区有人帮你算过了:一天用5小时,月租450元,有这钱买啥plan不行。哔哩哔哩云租卡只适合两种场景——一次性验证某个大模型,或者临时需要80G以上显存跑全量参数,日常重度使用租卡是负优化。

三类人值得上车,三类人赶紧劝停

成本账只算了一半,另一半要看你到底想要什么。把知乎、B站、小红书的讨论归拢,本地部署人群的真实动机就三种,每种账法完全不同。

这三类人,值得上:

  1. 高强度重度用户。 每天用Agent写代码、批处理文档、跑翻译,月API支出450元以上。对你来说本地就是纯省钱,而且27B级模型应付日常工程任务已经被多方实测验证堪用了。有开发者的原话是:20多token/s的速度,不会让我觉得这任务得等到天荒地老。哔哩哔哩

  2. 隐私敏感需求。 合同、病历、公司代码、没发表的书稿,这些东西不能出内网。这是本地部署真正"无可替代"的一项,云端怎么降价都替代不了。评论区说得直白,本地部署唯一的好处就是私密安全。知乎但对这类人,一个好处就够付全款。

  3. 无限制创作人群。 写小说、做剧本分镜、各种会被云端审核拦下的创作。谁不知道云端模型更强啊,我想要的它给不了啊——这句话就是这个人群的宣言。哔哩哔哩他们的付费意愿一直最强,也最清楚自己为什么上车,反而不容易踩坑。

这三类人,先劝停:

  1. 偶尔用用的人。 买卡前就问自己一个问题:过去一个月,你认真用AI干过几次活?有人算过细账:为偶尔的图片处理需求把模型长期挂在显存里,不如直接调多模态API,一张图几厘钱。哔哩哔哩评论区还有个更损的版本:如果只是想吃鱼,买鱼肯定比钓鱼划算。哔哩哔哩本地部署对轻度用户是爱好,是钓鱼,不是省钱方案——想清楚这一点再花钱。

  2. 生产力依赖旗舰能力的人。 如果你的活必须靠顶级推理模型,本地的现实上限就是27B级量化模型。社区共识很清醒:本地只有Qwen 27B能打,但生产的话还是要API。别用一万元存款去挑战别人几百亿的数据中心,混合着用才是正解。

  3. 怕涨恐慌党。 9月的行情已经明牌:显卡涨不动了,销量难看,等活动还有折扣。而模型迭代比硬件降价快得多——今天的27B,半年后大概率被下一代小模型越级。这波里,等等党的折旧率反而是最低的。

还在纠结的,三条折中路线

其实老玩家早就给出了标准答案,本地和云端从来不是二选一:

混合路由。 隐私敏感、重复性高的任务放本地(摘要、翻译、格式转换、日常补全),复杂推理和高峰任务走API。哔哩哔哩评论区已经有人在自制可切换路由的工具,这个思路适合小团队,也适合个人。

峰谷套利。 DeepSeek现在周末全天按低谷价收费。知乎把批量任务、长文档分析攒到周末跑,API账单直接对折。这是零成本优化,所有人都该用上。

等新变量。 小米8月24日官宣了AI Cube原型机:三颗玄戒芯片、150W功耗、号称支持120B模型本地部署,快慢系统切换。知乎知乎上市时间和价格仍未公布,但按小米的定价习惯,大概率会把"大模型本地"的入场券重新定价。加上下一代显卡的显存配置悬念,等等党完全可以等到双十一再做决定。

DeepSeek涨价350%把人逼向本地部署,结果显卡也在涨:Token自由这笔账,我用全网实测帮你算完了

最后:值得盯的五个信号

把这篇文章的结论赖以成立的观察点汇总一下,任何一条变了,账就要重算:

  1. DeepSeek会不会降价回调——"涨价只是流量调控、热度过了会降回来"是社区的主流判断,正在被验证中;

  2. 显存颗粒现货价——本轮显卡涨价的总开关,它回头,卡价才有回头;

  3. 小米AI Cube的上市时间和定价;

  4. 下一代显卡(60系)会不会给出32G、48G显存的甜品配置——评论区已经在做梦"6080给32G就无敌了";

  5. 下一代27B级开源模型的表现——Qwen3.8-27B大火才半个月,追赶者已经在路上。

本地部署在2026年已经不是极客的玩具,但也绝不是全民的性价比答案。它更像钓鱼:对吃鱼量大的人,自己养塘真省钱;对只是想尝个鲜的人,市场买两条永远不亏。这笔账算到这里,你该知道自己是哪一类了。

内容由AI生成

精选参考来源

1. 本地部署DeepSeekHarness加Qwen3.8-27B教程,实现token自由!我还发现“梁圣”在源码中的彩蛋!

2. 2026本地大模型横评:13款开源模型,4000元丐版硬件本地部署实战!Qwen3.6、Gemma 4、Ornith 1.0 全部上场!

3. 天坑-本地部署大模型

4. 怎么看DeepSeek8月17日涨价后的价格,这个峰谷定价你接受吗?

5. DeepSeek最新公告将周六周日全天按低谷时段收费,这是否能说明先前涨价就是为了腾出算力?

6. DeepSeekV4大幅涨价后,现在谁才是你心中的大模型性价比之选?

7. 本地部署Deepseek,选择什么显卡最有性价比?

8. 9.2硬件价格(显卡涨不动了)

9. 中国信通院测评:27B本地模型接近万亿级旗舰模型,这意味着什么?

10. 既然订阅了ChatGPT,也有免费的Deepseek,本地部署大模型到底还有什么用?

11. 本地部署大模型越来越流行,普通用户为跑模型盲目堆硬盘内存,是不是走入新的硬件焦虑?

12. 雷军官宣小米AICube原型机,支持本地部署120B大模型,会如何改变个人AI体验?

13. 小米这波是真的猛!AICube迷你主机三颗自研芯片塞一起,150W还能本地跑大模型

14. 请问现在哪种开源大模型可以私有化部署,并支持上传文档和图片进行分析的?

15. 5090跑qwen3.8 27B:选Q4还是Q5

16. 27B实测:一张显卡,在家跑出Opus级智能

17. 小米三颗玄戒芯片小主机!本地跑120b模型

18. GeForce RTX 50 系列显卡官方页面

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章