输出价打到4元/百万token:先别急着装主机,我替三类人算了"token自由"的账

源自263位全网作者

06:23

9月9日到10日这48小时,DeepSeek连着出牌:V4.1-Flash正式发布,Flash系列输出价官宣打到每百万token 4元档。并且从9月14日中午起,所有指向V4-Pro的旧API请求会自动路由到新模型、按更低价格计费,老用户一行代码不用改。同一周,Qwen3.8-27B Apache 2.0开源、被本地圈称为可商用的"本地主力",知乎"本地部署token自由"的问题下攒了几十条回答,小红书那条《本地部署大模型到底有意义吗》挂在379个赞、496条评论的争论里。知乎知乎知乎

一边是云端降价,一边是"本地自由",很多手里攥着16G、24G显卡、或者正准备加钱上卡的人,纠结的是同一个问题:现在装一台本地主机,到底是不是省钱?

我把两边的账摊开算了一遍。先说结论:这轮降价,恰好把"为新省钱而买卡"的计划作废了大半;真该装主机的,是另外两类人。

第一本账:云端token现在什么价

翻了11家主流API的2026年6-8月核价(统一百万token口径):海外旗舰GPT-5.5输出约30美元、Claude Opus 4.8输出25美元;国产这边,V4-Flash全场最便宜,输出0.28美元,这次降价后直接进入4元人民币档;GLM-5.2、Kimi K2.6、Qwen3.7 Max在中间,混元Hy3 0.13/0.53美元贴着地板;DeepSeek V4-Pro输入0.44/输出0.87美元,缓存命中的输入只要0.0036美元,长提示词场景成本趋近于零。知乎

三个容易被忽略的计价细节:输出普遍比输入贵3-5倍,长文本任务大头在输出。同时DeepSeek有峰谷定价,9:00-12:00、14:00-18:00翻倍,批量任务挪到晚上直接省一半。超过一定上下文的"长文加价"还会让账面单价失真。而把账算到任务级别:同样一段任务,不同模型的成本能差30倍以上,能力差距却远没有价格差距大——这才是"该用哪个模型"的真实答案。知乎知乎

换算成人话:一个日常写文案、做总结的轻度用户,拿Flash档跑,一个月账单是几十块人民币的量级。至于小红书那位退了GPT会员换本地的朋友——她原话是算了笔账,一年一千多,大部分时候只是写写文案、做做总结。省下的确实是订阅费,但如果这笔订阅换成Flash API,本来也花不了多少。小红书

第二本账:本地一百万token真实成本——电费这个数字很有意思

社区实测速度摆在这里:5090D跑Qwen3.8-27B的nvfp4量化、开MTP约100 tok/s,160K上下文内安全、再开高会降速。4090 24G用LM Studio跑Qwen3.6-27B Q4只有30 tok/s左右。4060Ti 16G跑Qwen3.6-35B-A3B-MTP反而能到50 tok/s,两张22G魔改2080Ti跑35B decode 50-60、prefill明显拖后腿。小红书小红书小红书
拿最乐观的100 tok/s算:生成一百万输出token要2.8小时,整机按600W、电价0.6元/度估,电费约1块钱/百万token;按4090的30 tok/s算就是3块上下。也就是说:本地跑大模型的边际电费,和这轮降价后的云端输出价(4元档)已经是一个数量级。再叠上硬件折旧——小红书那位砸1万块装34G双卡的帖子是一类,二手市场上挂着出掉的4090-48G大显存主机(晒出鲁大师整机三百四十万分截图的那种)是另一类:不管哪类,按三年摊每月都是两百元起步,还没算装机、调环境、模型一周一更你要反复重下的时间。

输出价打到4元/百万token:先别急着装主机,我替三类人算了

输出价打到4元/百万token:先别急着装主机,我替三类人算了

所以那条万元双卡主机帖子下最高赞的评论——“你的显卡还可以卖钱,实际上是电费vs充值费”——现在算下来很扎心:纯为省钱新买卡,回本周期在云端连降一轮之后基本看不到头。小红书

更别扭的是硬件这头在往上涨。7月31日时代周报记者实探华强北:RTX 5060Ti 8GB从约2800元涨到3400-3500元,RTX 5070从5000元档涨到6000元档,RTX 5090系列一周从30200元附近涨到34000元。导火索是英伟达再次向全球授权显卡厂发出新一轮GPU套装(GPU+显存)涨价通知,显存产能正被HBM订单整体抢走。连矿卡都被本地AI需求带进坑:一张闲鱼三五百没人要的CMP 170HX如今破万还要抢。 云端token在跌、显卡在涨的剪刀差里,"等等党"两头输。36氪36氪小红书

唯一能赢的账:你的云端账单是"旗舰档"

上面作废的是"拿本地去替4元档"的方案。反过来,如果你现在烧的是Opus/GPT级别的账单,账是另一种算法:Claude Opus 4.8输出25美元/百万token,约合人民币180元。按一个月2000万输出token的重度用量算,云端月账单3600元上下;换成5090级主机——光显卡按华强北现价约34000元、整机约42000元——36个月摊销每月约1170元,电费20元,回本约17个月,这还是最乐观口径。知乎那篇攒了61条评论的回答给过更极端的参照:单路Claude Code 24小时跑,一天1.1亿token。但注意,这笔账只在你替换的是海外旗舰账单时成立——同样的量换成DeepSeek V4 Pro(输出约0.87美元/百万token,折合人民币6元档),月账单才120元上下,本地装机连回本的资格都没有。真想用低价多卡方案塞满血模型的,社区有人晒过6000元魔改机跑R1-671B的实测截图:eval只有5.37 tok/s——能跑,和能干活,是两回事。知乎知乎小红书

输出价打到4元/百万token:先别急着装主机,我替三类人算了

但这里必须接一句社区公认的冷水。同一位5090D用户给的期望管理很具体:几百页的PPT要先拆分喂、上下文开高了降速、视频转写交给VLM+ASR工作流而不是硬塞给语言模型。更狠的是做知识库的那位:1.5万份PDF,27B本地跑导读3000份要两天,他果断换回API做生成,数据库建好后继续让本地27B当RAG用——重度用户今天的真实形态是混合的:云端负责"聪明",本地负责"无限"。小红书

三类人,三个结论

A. 卡已在手(16G+):别纠结,现在就装。卡钱是沉没成本,你的token自由不需要回本。Qwen3.8-27B这个档位的本地体验确实到了"能干日常活"的拐点,社区里被反复引用的一个判断是:单卡5090能跑的优化好的Qwen,已经能赶上一年前的世界顶级大模型。按上面那位的四条冷水管理好预期即可。知乎

B. 正打算为新装机掏钱"省钱":本轮建议等。不是等降价——是等你的需求被验证:先老老实实把云端API账单晒出来跑一个月,月账单不到三位数,本地装机的第一推动力就该换成"隐私、断网、无审查"这三个词,而不是省钱。

C. 数据不能出机器的人(财务、法务、敏感文档岗,小红书上有整批这样的用户):这账跟云端价格无关,跟降价更无关,本地部署是合规成本不是消费选择。按业务需要配机,但别再用"省钱"说服自己,说服力不够,也没必要。

接下来盯什么

一看DeepSeek这轮4元档之后,Kimi、GLM的下一轮报价会不会跟(价格战打到脚踝,通常不会只有一家);二看显卡涨价会不会回调——英伟达这轮GPU套装涨价波及GDDR6老卡,装机窗口是按周在关的;三看Qwen3.8-27B的nvfp4+MTP方案会不会下沉到16G卡(5090D的100 tok/s是天花板,不是地板);四看WorkBuddy这类办公工具内置"一键本地模型"之后,部署门槛归零时,本地电费党会不会变成真正的多数派。

你的月账单多少、卡什么配置,这笔账算下来站哪边?评论区报个数,咱们把回本表凑成一张真图。

内容由AI生成

精选参考来源

1. 把 11 家主流大模型 API 的价格和优缺点查了一遍,说几句实话

2. 2026 国内能稳定使用的大模型 API 终极对照表:20+ 厂商全收录(价格 · 上下文 · 场景 · 避坑)

3. 目前最热门的Qwen大模型都有哪些?各个模型之间都有哪些亮点?

4. 很多人认为本地部署一个大模型,就实现token自由,就可以干活了,真的吗?

5. 很多人认为本地部署一个大模型,就实现token自由,就可以干活了,真的吗?

6. 又打价格战!DeepSeek把大模型输出价打到4元档

7. DeepSeek筹备科创板IPO:新模型把大模型价格打到8块钱

8. 实探华强北显卡涨价潮,有显卡一周暴涨4000元,商户:贵到我都不敢进货

9. NVIDIA 显卡全线涨价,等等党输麻了……

10. 求助|有没有老师用本地Qwen 27B做过这些?

11. 砸了1W块,搞了个34G显存的双卡本地AI主机

12. GPT会员我退了,找到了不花钱的

13. 一万多买暴涨的矿卡跑AI是不是冤大头?

14. 6k预算本地部署DeepSeek R1 671B满血版🚀

15. Qwen2.6 27b本地部署求助

16. 本地部署大模型到底有意义吗

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章