「跑满一天电费一块多」和「百万Token近10度电」都是真的:微软演示284B本地跑这2天,我把电表、账单和折旧的13组数字摆进同一张表——退订前,先算你那台机器的有效吞吐

源自263位全网作者

13:46

这周本地大模型圈子里被问得最凶的,不是"我的卡能跑多大的模型"——12G卡跑125B这事,Strata那波已经把答案交完了。真正让很多人停下来的是官方账单口径:10月7日微软博客官宣,DeepSeek V4 Flash(2840亿参数、MoE、激活13B、百万上下文)将本地运行于RTX Spark机型,llama.cpp同一天进入WindowsML,GGUF/ONNX双格式。看过发布会的现场转述是:1.6bit量化后权重约60GB——但前提是128G内存。这些目前都还是公司演示口径,连Yahoo Finance转载的那段视频都特意标注"性能与兼容性描述非独立测试"。B站评论区那句反应最诚实:“看了一下,好像也是要内存的,那没事了(笑)。”哔哩哔哩小红书哔哩哔哩

「跑满一天电费一块多」和「百万Token近10度电」都是真的:微软演示284B本地跑这2天,我把电表、账单和折旧的13组数字摆进同一张表——退订前,先算你那台机器的有效吞吐

机器的事官方说了不算,但它确实给很多人拨了个开关:那我是不是可以把订阅退了?10月7日知乎问题"很多人认为本地部署一个大模型,就实现token自由,就可以干活了,真的吗?“两天冲到124万曝光,最高赞回答直接甩出两组数字——一台5090单卡机全天拉满跑Qwen3.8-27B,约100 token/s,一天能吐900万token;整机稳定负载约350W,24小时3到4度电,电费一块多。同样900万token,走DeepSeek官网API、按缓存命中50%峰谷通算,折合2到3块钱。评论区当场劈成两拨:一拨算完觉得"电比API便宜”,另一拨(也是高赞)说"自己干的那些活,花不了多少token,花点小钱买API key吧"。知乎

我把这两天散在知乎、B站、微博、小红书里的电表数字、账单数字、折旧数字摆进同一张表。结论先放在这:电费不是这本账的大头,但它能把"真能退订的人"和"凭情绪退订的人"分开。

第一本账:电表到底烧多少?电表按功率×时间收费,时间由吐字速度决定

来源(均为作者自述实测)

硬件

模型/有效吞吐

实测功率

每百万Token折算

知乎·潜龙勿用 10-07

5090单卡

Qwen3.8-27B,约100 tok/s

约350W

约0.4度电(其口径:全天900万token、3-4度电、电费一块多)

B站·linuxdo视频评论区 10-09

3060 12G

50 tok/s场景

约110W

约0.6度电

海外·Arsen Apostolov实测(Web极客码7-15转引)

3090+Ollama Q4_K_M

GLM-4.5-Air 106B

—

€1.040,比€0.55的云端基准贵一倍

同上

3090

Qwen3-Coder 30.5B

快吐字档

明显低于云端基准

同上

3090

DeepSeek-R1-Distill 32.8B,有效吞吐仅3.7 tok/s

平均仅141W

€1.526全场最贵;按功率×时间折算近10度电/百万token

这张表里有两个被不同信源相互印证的反直觉:第一,功耗低不等于省电。R1-Distill平均功耗才141W、参数量也不算最大,但它是全场最贵——因为它"干思考、不吐字",思维链期间显卡空烧,电表照转。Gemma 3 27B满载283W反而更省,因为快。linuxdo那条10月8日的电表视频给的标尺完全一致:别看瓦数,看"每生成100万Token耗几度电"。决定本地成本的既不是参数量、也不是瞬时功率,是有效吞吐速度。哔哩哔哩知乎

还有两个细节数字得记进账本:V100待机40W/卡保底、满载单卡能到300W——全天账里23小时的待机也得算钱。爱玩游戏的Luna学姐10-09那台3600元E5丐板的评论区有更直白的一句:双2080Ti"纯纯浪费电,prefill不涨,decode只提30%",还有玩家干脆把每张卡限到150W。堆卡不是提速,是给电表加人。哔哩哔哩哔哩哔哩

第二本账:比电表大的,是折旧表

电费本身是小钱。按潜龙勿用的口径折算,5090全天拉满的电费约合每百万token一毛到一毛五——已经是"顺手"的量级。真正让账倾斜的是机器。

丐板侧有张真配置单(B站10-09,UP自述):3600元(E5 2620v2双路+DDR3 64G×2+2080Ti 22G)跑flash-next 125B的Q2量化,40 tok/s;加到6000元上双卡,80 tok/s。评论区还有人问"2350的2080Ti 22G在哪能买到"——二手卡价在往上走。把它摊成折旧:3600元按24个月算,每月150元。再看云端把单价打到多低:WP建站10-08用同一个任务(生成一篇5000字HTML教程页)实测,阿里Token Plan 39元/月套餐,混合成本0.057元/百万token;DeepSeek官方API闲时0.122元/百万token(其中未缓存输入1元/百万、缓存命中读取只要0.02元,命中后差50倍)。150元折旧,按官方闲时价能买12亿token/月——而那台40 tok/s的丐板机全天拉满,一个月只吐得出一亿出头。按"每token省钱"的思路,本地机器全年拉满也填不平折旧;在中国市场的低价账单面前,电表账根本赢不了批发账。哔哩哔哩知乎

「跑满一天电费一块多」和「百万Token近10度电」都是真的:微软演示284B本地跑这2天,我把电表、账单和折旧的13组数字摆进同一张表——退订前,先算你那台机器的有效吞吐

“退订"唯一能赢的账,是月费对月费。前提是你的订阅烧到了肉疼的量级——微博上营养师顾中一自述两个月烧光Kimi K3的699元套餐、还基本用满GLM MAX,赴美续上ChatGPT Pro后第一件事就是退订Kimi。当本地折旧加电费摊到每月200元上下、对上的是几百元月费且智能档够用时,退订才在数学上成立。門吉10-08那篇知乎文章标题就是全场最清醒的一句:《本地部署大模型,省的不是钱,是存在感》——他算的70B档位"两张二手3090配齐小两三万”,这笔钱拿去买API,中度用户够用好几年;而且多数人真实的使用频率是"想起来了才跑一下",闲置折旧才是吞金兽。微博知乎

第三本账:退订前先对号,这四类人才轮得到你算电费

  • 适合退的:每天稳定海量跑agent、月消耗上亿token、且任务能接受27B档智能的重度用户——全天拉满才立得住折旧,月费对月费才有得赢。

  • 账本不适用的:数据不能出内网、断网环境、合规硬要求——“本地不是选项,是必须项”。tombkeeper那条850赞的老微博也早就定了调:对大部分人来说本地跑大模型经济上不划算,买的不是性价比,是"去限制+数据不出本机",简单说,自由。评论区那句NAS类比最贴切:买的未必是性价比,而是选择权和边界控制。知乎微博

  • 必亏的:中度订阅用户。评论区原话就是自己干的那些活,花不了多少token,还是花点小钱买点api key吧。你省下的电费(约0.1-0.15元/百万)填不平0.057元的Plan批发价,还搭进去折腾时间——周二晚上拍脑袋"我要搞本地部署"、周四发现效果不如线上API、周五默默放弃,是門吉总结的高频剧本。知乎

  • 别顺手干的:拿慢思考模型跑本地agent。€1.526/百万token的例子挂在最上面,141W的"低功耗"照样最贵。Luna学姐评论区那句"智力跟得上嘛?q2了都"就是这第二本账。潜龙勿用也说得直接:官网模型的DeepSeek 4.1 flash能力其实超过本地部署的Qwen3.8 27B。哔哩哔哩知乎

接下来盯这三件事

  1. 微软"284B装进笔记本"的口径经不经得起独立实测:60GB权重+128G内存只是入场券,WindowsML+GGUF这条路在真实工作负载下的吐字速度,丐帮们还没交作业。

  2. 电价与时段账:0.057/0.122两组云端单价都是夜里10点后闲时半价测出来的——白天跑和夜里批量跑是两本账,电费侧同理,跑满型用户的本地账会越来越好算。知乎

  3. 2080Ti 22G这一档拆机件的价格线:2350元有人在线求购、二手价在涨——如果第三本账算完你确实在"适合退的"那一栏,硬件宜早;不在,就看戏。

「跑满一天电费一块多」和「百万Token近10度电」都是真的:微软演示284B本地跑这2天,我把电表、账单和折旧的13组数字摆进同一张表——退订前,先算你那台机器的有效吞吐

一句话收掉这周的账:电表烧不垮你,烧垮你的从来是那台只在周末开机收折旧的机器。退订之前,先算清你在哪一栏——是全天拉满,还是想起来了才跑一下;是买自由,还是省钱。这两件事,历来不是一回事。

内容由AI生成

精选参考来源

1. 微软官宣:Windows本地跑DeepSeek V4 Flash!284B大模型怎么装进电脑?

2. 2026/10/07YahooFinance:微软演示DeepSeek本地运行,大模型开始进入个人电脑

3. 微软发力,将模型跑在本地

4. 很多人认为本地部署一个大模型,就实现token自由,就可以干活了,真的吗?

5. 很多人认为本地部署一个大模型,就实现token自由,就可以干活了,真的吗?

6. 50Token每秒耗多少电-本地大模型性能功耗比

7. 本地跑大模型真的“免费”吗?我用 3090 算出了每百万 Token 的真实电费!

8. 3千多的主机实测Qwen3.7flash-next125B大模型-速度竟能达到40token/s

9. 实测对比:阿里Token Plan vs DeepSeek官方API,混合成本差了53%

10. 本地部署大模型,省的不是钱,是存在感

11. 对大部分人来说,本地运行大模型从经济上讲都是不划算的。除了技术研究需要外,自己跑模型主要有两个意义:1、能使用去除了限制的模型。2、能确保数据完全在本地。简单地说,自由。

12. 用了两个月的KIMIK3,699套餐基本全花光,另外还有GLMMAX也基本用满。来美国续上chatgptpro套餐以后把kimi退订了

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章