这半个月,B站一条8万播放的本地部署教程评论区里,最扎心的一条留言是——有谁和我一样,是看到DeepSeek涨价后来看本地部署的?哔哩哔哩
底下一排人举手。有人说以前是"登不完、用不完",现在"一天就用完好几十块钱";有人算了笔新账:想跑个像样的27B模型,得买大显存卡,而大显存卡恰好正处在一轮历史性涨价周期里——用评论区原话说:24G显存显卡贵,20B以下的模型蠢,上不去下不来,卡在那里了。哔哩哔哩
两头涨价撞在一起,"要不要转本地"从月度月经题变成了真金白银的决策题。这篇不做安装教程(B站喂饭视频多得是),只干一件事:把8月到9月全网的行情、实测样本和老玩家的账本拼到一起,帮你把这笔Token自由账算清楚。
先看发生了什么:两头都在涨
API这头,DeepSeek真涨了。 8月上旬DeepSeek官宣整体上调API定价,8月17日落地,配套峰谷计价。知乎8月23日又公告周六周日全天按低谷时段收费。知乎涨幅按社区测算,高峰时段输出价上调约350%,空闲时段约175%;调价后Pro版高峰时段百万token输出约27元,Flash版约9元。知乎横向对比,能力相近的Kimi K3百万输出约100元、GLM 5.2约28元、Grok 4.6约43元——所以涨完的DeepSeek依然不算贵,只是"没法像之前那样淌着用了"。
涨价原因更有意思。OpenCode工程师Dax Raad透露的说法是:不是亏钱,是需求过载。Flash正式版发布后,光OpenCode一天就消耗8万亿token,占平台80%以上的调用额度。知乎翻译一下:这轮涨价本质是用价格把轻度用户劝走,给重度用户保算力。轻度用户被劝走了,往哪去?一部分就去了本地部署——这正是B站那条评论区的故事背景。
显卡这头,涨价的源头在显存。 8月的华强北显卡市场一度"封板":商家集体停止报价、暂停出货,工厂封仓,连付了钱的预售单都作废。根因是显存颗粒和AI服务器抢同一条生产线——三星、SK海力士、美光把70%到90%的先进产能优先供给了AI显存,留给消费级显卡的不到一成,颗粒现货价半年涨了约200%,一颗2GB的GDDR7超过20美元。知乎
反映到零售价,按装机博主9月2日的行情记录:5060 Ti 8G约3300元、16G版约5000元,5070约6600元,5070 Ti约9300元,5080约12000元;A卡这边9060 XT 16G约3300元,9070 XT约5800元。知乎对比6月,涨幅"很恐怖"。但9月的最新消息是涨不动了——涨价后销量难看,N卡以稳为主,短期不用担心大涨,等活动还能再便宜300元左右。

还有个时机背景必须交代:"Token自由"这个词能在8月中下旬火起来,是因为Qwen3.8-27B爆了。这个27B稠密模型原生体积50多GB,常用量化版13-17GB,社区普遍反馈量化后能力能摸到DeepSeek Flash这一档。哔哩哔哩中国信通院的测评里,27B级本地模型在Agent任务上的完成率甚至接近万亿参数旗舰——虽然榜首总成功率也只有40.55%,说明离"替代旗舰"还远,但"个人硬件跑得动的模型第一次够用了"这个判断是成立的。知乎只是"够用了"的入场券,被显卡涨价劫了一道。

你的卡能跑成什么样:全网实测样本汇总
行情说完看实际效果。我把知乎、B站评论区里用户晒出的实测样本归拢成一张表(均为个人案例,调优水平不一,看量级就好):
硬件方案 | 参考成本 | 模型与量化 | 实测表现 |
|---|---|---|---|
RTX 5060 Ti 16G 单卡 | 约5000元(新购) | Qwen3.8-27B IQ3 | 约25 token/s,高强度推理降到20,上下文勉强96k |
RTX 4080 16G 老卡 | 0元(已有) | Qwen3.8-27B Q3_K_XL | 前16k上下文稳定约42 token/s,调优两天可用 |
RTX 5060 Ti 16G ×2 | 约10000元(新购) | Qwen3.8-27B Q5 | 约40 token/s,支持长上下文 |
MacBook Air M5 32G | 0元(已有) | Qwen3.6-35B-A3B 4bit | 约52 token/s,正常可用 |
RTX 5070 Ti | 约9300元(新购) | Gemma4-26B QAT | 文档翻译场景约110 token/s |
表里藏着三个规律:
第一,16G显存是"能玩"线,24G才是"实用"线。 12G显存跑27B这一代基本没戏,社区原话"有点逗";16G能靠低比特量化把27B塞进去,代价是智商打折、上下文缩水;想舒服要24G起步,而24G档的卡全在高位,5090甚至被评论区断言28年之前都降不下来。哔哩哔哩夹在中间的尴尬,就是"上不去下不来"这句话的硬件版。
第二,旧设备是这波最大的隐藏折扣。 4080 16G老卡、32G内存以上的M系Mac,都能给出可用速度。买新卡之前,先翻翻自己抽屉里那台旧设备姓什么——这是整篇文章里最省钱的一条建议。
第三,量化有坑,稠密模型更稳。 有玩家实测提醒:35B级MoE模型在Q4量化下会出现"门问题和死循环",在llama.cpp里还会被放大。哔哩哔哩相比之下27B稠密模型量化后损失小、更稳定。所以老玩家现在的共识是:新手直接从稠密模型起步,别一上来就挑战MoE。

Token自由的成本账:精确到月
进入正题。本地部署的真实成本 = 硬件折旧 + 电费 + 你的折腾时间。用社区行情价来算:
方案A:零投入,用现有PC或Mac。 只花电费。整机推理按250W、每天4小时、民用电0.55元/度算,月电费约16元。这基本等于免费,代价是速度和折腾时间。手里有16G显存卡或32G内存Mac的,强烈建议先把这条路跑通再说。
方案B:新购5060 Ti 16G,约5000元。 卡的保值社区有两种判断。乐观派认为本地部署相关硬件一年内保值,毕竟还在涨价周期里。知乎悲观派认为消费级硬件追大模型是在追移动靶,半年折旧严重。知乎取中间值按两年折旧:硬件月均约208元,加电费约20元,月度成本约230元。
方案C:双16G卡或24G单卡,约10000元。 同样算法,月度成本约440元,换来的是27B满速+长上下文,或者跑更大模型的余地。
再看API那头你的月支出。社区口径相当一致:涨价后"一个月能花100就算用得多了"是轻度用户的水平;而用Agent写代码的重度用户"一天烧好几十块",月支出轻松600-1500元。哔哩哔哩
盈亏平衡线画出来,结论有点反常识:
月AI支出低于150元:别为省钱买卡,两年都回不了本。你该做的是用足低谷价——现在周末全天都是低谷时段——或者免费模型凑合。
月支出150-450元:灰色地带。方案B的月成本正好压在这个区间,买不买取决于你多看重"不限量"的心理安全感,纯财务上不赢不亏。
月支出450元以上的高强度用户:本地明显回本,而且用得越狠省得越多。Token自由这个词,只有在这一档才成立。
顺带排掉一个"伪本地"的坑:有人琢磨云端租卡,5090时租约3元,听起来便宜。评论区有人帮你算过了:一天用5小时,月租450元,有这钱买啥plan不行。哔哩哔哩云租卡只适合两种场景——一次性验证某个大模型,或者临时需要80G以上显存跑全量参数,日常重度使用租卡是负优化。
三类人值得上车,三类人赶紧劝停
成本账只算了一半,另一半要看你到底想要什么。把知乎、B站、小红书的讨论归拢,本地部署人群的真实动机就三种,每种账法完全不同。
这三类人,值得上:
高强度重度用户。 每天用Agent写代码、批处理文档、跑翻译,月API支出450元以上。对你来说本地就是纯省钱,而且27B级模型应付日常工程任务已经被多方实测验证堪用了。有开发者的原话是:20多token/s的速度,不会让我觉得这任务得等到天荒地老。哔哩哔哩
隐私敏感需求。 合同、病历、公司代码、没发表的书稿,这些东西不能出内网。这是本地部署真正"无可替代"的一项,云端怎么降价都替代不了。评论区说得直白,本地部署唯一的好处就是私密安全。知乎但对这类人,一个好处就够付全款。
无限制创作人群。 写小说、做剧本分镜、各种会被云端审核拦下的创作。谁不知道云端模型更强啊,我想要的它给不了啊——这句话就是这个人群的宣言。哔哩哔哩他们的付费意愿一直最强,也最清楚自己为什么上车,反而不容易踩坑。
这三类人,先劝停:
偶尔用用的人。 买卡前就问自己一个问题:过去一个月,你认真用AI干过几次活?有人算过细账:为偶尔的图片处理需求把模型长期挂在显存里,不如直接调多模态API,一张图几厘钱。哔哩哔哩评论区还有个更损的版本:如果只是想吃鱼,买鱼肯定比钓鱼划算。哔哩哔哩本地部署对轻度用户是爱好,是钓鱼,不是省钱方案——想清楚这一点再花钱。
生产力依赖旗舰能力的人。 如果你的活必须靠顶级推理模型,本地的现实上限就是27B级量化模型。社区共识很清醒:本地只有Qwen 27B能打,但生产的话还是要API。别用一万元存款去挑战别人几百亿的数据中心,混合着用才是正解。
怕涨恐慌党。 9月的行情已经明牌:显卡涨不动了,销量难看,等活动还有折扣。而模型迭代比硬件降价快得多——今天的27B,半年后大概率被下一代小模型越级。这波里,等等党的折旧率反而是最低的。
还在纠结的,三条折中路线
其实老玩家早就给出了标准答案,本地和云端从来不是二选一:
混合路由。 隐私敏感、重复性高的任务放本地(摘要、翻译、格式转换、日常补全),复杂推理和高峰任务走API。哔哩哔哩评论区已经有人在自制可切换路由的工具,这个思路适合小团队,也适合个人。
峰谷套利。 DeepSeek现在周末全天按低谷价收费。知乎把批量任务、长文档分析攒到周末跑,API账单直接对折。这是零成本优化,所有人都该用上。
等新变量。 小米8月24日官宣了AI Cube原型机:三颗玄戒芯片、150W功耗、号称支持120B模型本地部署,快慢系统切换。知乎知乎上市时间和价格仍未公布,但按小米的定价习惯,大概率会把"大模型本地"的入场券重新定价。加上下一代显卡的显存配置悬念,等等党完全可以等到双十一再做决定。

最后:值得盯的五个信号
把这篇文章的结论赖以成立的观察点汇总一下,任何一条变了,账就要重算:
DeepSeek会不会降价回调——"涨价只是流量调控、热度过了会降回来"是社区的主流判断,正在被验证中;
显存颗粒现货价——本轮显卡涨价的总开关,它回头,卡价才有回头;
小米AI Cube的上市时间和定价;
下一代显卡(60系)会不会给出32G、48G显存的甜品配置——评论区已经在做梦"6080给32G就无敌了";
下一代27B级开源模型的表现——Qwen3.8-27B大火才半个月,追赶者已经在路上。
本地部署在2026年已经不是极客的玩具,但也绝不是全民的性价比答案。它更像钓鱼:对吃鱼量大的人,自己养塘真省钱;对只是想尝个鲜的人,市场买两条永远不亏。这笔账算到这里,你该知道自己是哪一类了。