这周本地大模型圈子里被问得最凶的,不是"我的卡能跑多大的模型"——12G卡跑125B这事,Strata那波已经把答案交完了。真正让很多人停下来的是官方账单口径:10月7日微软博客官宣,DeepSeek V4 Flash(2840亿参数、MoE、激活13B、百万上下文)将本地运行于RTX Spark机型,llama.cpp同一天进入WindowsML,GGUF/ONNX双格式。看过发布会的现场转述是:1.6bit量化后权重约60GB——但前提是128G内存。这些目前都还是公司演示口径,连Yahoo Finance转载的那段视频都特意标注"性能与兼容性描述非独立测试"。B站评论区那句反应最诚实:“看了一下,好像也是要内存的,那没事了(笑)。”哔哩哔哩小红书哔哩哔哩

机器的事官方说了不算,但它确实给很多人拨了个开关:那我是不是可以把订阅退了?10月7日知乎问题"很多人认为本地部署一个大模型,就实现token自由,就可以干活了,真的吗?“两天冲到124万曝光,最高赞回答直接甩出两组数字——一台5090单卡机全天拉满跑Qwen3.8-27B,约100 token/s,一天能吐900万token;整机稳定负载约350W,24小时3到4度电,电费一块多。同样900万token,走DeepSeek官网API、按缓存命中50%峰谷通算,折合2到3块钱。评论区当场劈成两拨:一拨算完觉得"电比API便宜”,另一拨(也是高赞)说"自己干的那些活,花不了多少token,花点小钱买API key吧"。知乎
我把这两天散在知乎、B站、微博、小红书里的电表数字、账单数字、折旧数字摆进同一张表。结论先放在这:电费不是这本账的大头,但它能把"真能退订的人"和"凭情绪退订的人"分开。
第一本账:电表到底烧多少?电表按功率×时间收费,时间由吐字速度决定
来源(均为作者自述实测) | 硬件 | 模型/有效吞吐 | 实测功率 | 每百万Token折算 |
|---|---|---|---|---|
知乎·潜龙勿用 10-07 | 5090单卡 | Qwen3.8-27B,约100 tok/s | 约350W | 约0.4度电(其口径:全天900万token、3-4度电、电费一块多) |
B站·linuxdo视频评论区 10-09 | 3060 12G | 50 tok/s场景 | 约110W | 约0.6度电 |
海外·Arsen Apostolov实测(Web极客码7-15转引) | 3090+Ollama Q4_K_M | GLM-4.5-Air 106B | — | €1.040,比€0.55的云端基准贵一倍 |
同上 | 3090 | Qwen3-Coder 30.5B | 快吐字档 | 明显低于云端基准 |
同上 | 3090 | DeepSeek-R1-Distill 32.8B,有效吞吐仅3.7 tok/s | 平均仅141W | €1.526全场最贵;按功率×时间折算近10度电/百万token |
这张表里有两个被不同信源相互印证的反直觉:第一,功耗低不等于省电。R1-Distill平均功耗才141W、参数量也不算最大,但它是全场最贵——因为它"干思考、不吐字",思维链期间显卡空烧,电表照转。Gemma 3 27B满载283W反而更省,因为快。linuxdo那条10月8日的电表视频给的标尺完全一致:别看瓦数,看"每生成100万Token耗几度电"。决定本地成本的既不是参数量、也不是瞬时功率,是有效吞吐速度。哔哩哔哩知乎
还有两个细节数字得记进账本:V100待机40W/卡保底、满载单卡能到300W——全天账里23小时的待机也得算钱。爱玩游戏的Luna学姐10-09那台3600元E5丐板的评论区有更直白的一句:双2080Ti"纯纯浪费电,prefill不涨,decode只提30%",还有玩家干脆把每张卡限到150W。堆卡不是提速,是给电表加人。哔哩哔哩哔哩哔哩
第二本账:比电表大的,是折旧表
电费本身是小钱。按潜龙勿用的口径折算,5090全天拉满的电费约合每百万token一毛到一毛五——已经是"顺手"的量级。真正让账倾斜的是机器。
丐板侧有张真配置单(B站10-09,UP自述):3600元(E5 2620v2双路+DDR3 64G×2+2080Ti 22G)跑flash-next 125B的Q2量化,40 tok/s;加到6000元上双卡,80 tok/s。评论区还有人问"2350的2080Ti 22G在哪能买到"——二手卡价在往上走。把它摊成折旧:3600元按24个月算,每月150元。再看云端把单价打到多低:WP建站10-08用同一个任务(生成一篇5000字HTML教程页)实测,阿里Token Plan 39元/月套餐,混合成本0.057元/百万token;DeepSeek官方API闲时0.122元/百万token(其中未缓存输入1元/百万、缓存命中读取只要0.02元,命中后差50倍)。150元折旧,按官方闲时价能买12亿token/月——而那台40 tok/s的丐板机全天拉满,一个月只吐得出一亿出头。按"每token省钱"的思路,本地机器全年拉满也填不平折旧;在中国市场的低价账单面前,电表账根本赢不了批发账。哔哩哔哩知乎

“退订"唯一能赢的账,是月费对月费。前提是你的订阅烧到了肉疼的量级——微博上营养师顾中一自述两个月烧光Kimi K3的699元套餐、还基本用满GLM MAX,赴美续上ChatGPT Pro后第一件事就是退订Kimi。当本地折旧加电费摊到每月200元上下、对上的是几百元月费且智能档够用时,退订才在数学上成立。門吉10-08那篇知乎文章标题就是全场最清醒的一句:《本地部署大模型,省的不是钱,是存在感》——他算的70B档位"两张二手3090配齐小两三万”,这笔钱拿去买API,中度用户够用好几年;而且多数人真实的使用频率是"想起来了才跑一下",闲置折旧才是吞金兽。微博知乎
第三本账:退订前先对号,这四类人才轮得到你算电费
适合退的:每天稳定海量跑agent、月消耗上亿token、且任务能接受27B档智能的重度用户——全天拉满才立得住折旧,月费对月费才有得赢。
账本不适用的:数据不能出内网、断网环境、合规硬要求——“本地不是选项,是必须项”。tombkeeper那条850赞的老微博也早就定了调:对大部分人来说本地跑大模型经济上不划算,买的不是性价比,是"去限制+数据不出本机",简单说,自由。评论区那句NAS类比最贴切:买的未必是性价比,而是选择权和边界控制。知乎微博
必亏的:中度订阅用户。评论区原话就是自己干的那些活,花不了多少token,还是花点小钱买点api key吧。你省下的电费(约0.1-0.15元/百万)填不平0.057元的Plan批发价,还搭进去折腾时间——周二晚上拍脑袋"我要搞本地部署"、周四发现效果不如线上API、周五默默放弃,是門吉总结的高频剧本。知乎
别顺手干的:拿慢思考模型跑本地agent。€1.526/百万token的例子挂在最上面,141W的"低功耗"照样最贵。Luna学姐评论区那句"智力跟得上嘛?q2了都"就是这第二本账。潜龙勿用也说得直接:官网模型的DeepSeek 4.1 flash能力其实超过本地部署的Qwen3.8 27B。哔哩哔哩知乎
接下来盯这三件事
微软"284B装进笔记本"的口径经不经得起独立实测:60GB权重+128G内存只是入场券,WindowsML+GGUF这条路在真实工作负载下的吐字速度,丐帮们还没交作业。
电价与时段账:0.057/0.122两组云端单价都是夜里10点后闲时半价测出来的——白天跑和夜里批量跑是两本账,电费侧同理,跑满型用户的本地账会越来越好算。知乎
2080Ti 22G这一档拆机件的价格线:2350元有人在线求购、二手价在涨——如果第三本账算完你确实在"适合退的"那一栏,硬件宜早;不在,就看戏。

一句话收掉这周的账:电表烧不垮你,烧垮你的从来是那台只在周末开机收折旧的机器。退订之前,先算清你在哪一栏——是全天拉满,还是想起来了才跑一下;是买自由,还是省钱。这两件事,历来不是一回事。