9月11日,一篇零刻车主的自算账单在本地AI圈里落了地:SER6 Pro + 天钡EG02显卡坞 + 二手RTX 3090水神,24小时挂着一台Qwen3.8-27B推理服务,按广东居民阶梯电价(粤价〔2012〕135号)从头算到尾。两个反直觉的数字:知乎
24小时不间断满载推理,一年电费2914元——这套系统真实满载墙功耗只有482W,比很多人脑补的"电费刺客"便宜得多。
反过来,每天只用1小时,月电费仍有44.7元,其中37元是82W待机烧掉的——"挂着不用"一年也要430元。
这张账单真正的杀伤力不在"电费贵不贵",而在于它把本地AI的成本结构掀开了:贵的从来不是推理,是挂着。而"挂着"这个动作,恰好踩中了零刻车主这一个月最纠结的三条路——SEi AI整机、AI Max+ 395、老机器+显卡坞+二手3090。多数人选路的第一步,是反的。
零刻圈子里,“能不能跑27B"刚取代"能不能养虾”
这个9月,零刻车主社区聊本地大模型的密度明显上来了,而且三条路各自都有人交作业:
NPU路线:零刻8月官宣SEi13 AI/SEi14 AI,主打"x86+独立NPU算力卡+24G专用推理内存",官方视频里直接点名场景是"数据安全、断网使用和长期成本"。首发实测视频2.4万播放、216条评论,热评第一(107赞)说这就是低功耗边缘计算的推理小卡,2000块一张2080ti 22g直接碾压这个了。还有更直白的:“这价格,24g显存,不如去买正儿八经的3090”。我们上个月做过SEi AI上市一个月的长测,结论是27B只跑6 tok/s上下、NPU卡几乎占了半台机器价格——评论区有人对号入座算到"售价约1.2万",另一个补刀说这卡可能得占三分之二。哔哩哔哩哔哩哔哩
395路线:AI Max+ 395整机被内存硬盘涨价顶到2.2万上下。我们前阵子也写过卖到2万6的游戏旗舰"涨价的不是核显,是那128G焊死内存"。8月25日有395车主在知乎晒27B速度曲线:ollama 10 tok/s起步,换成适配过的llama.cpp跑到20,再看到别人同样型号跑出40的截图——同一台机器,框架不同差4倍。知乎知乎
坞+卡路线:9月5日知乎回答已经把话挑明,跑AI你要的是"显存在哪里",不是"显卡焊在哪里"——“3000元档坞里塞张24G的3090”,就是它给出的现实路线。9月11日那份成本测算,是这条路第一次有人把电费、折旧、盈亏平衡点全算穿。知乎
另外,知乎"QWEN3.8-27B大家的速度都是多少"的问题下面聚了68条回答,连2080Ti 22G涡轮魔改+洋垃圾E5+机械硬盘都跑起来了(120赞)。跑27B已经从极客行为变成了零刻车主的"新货币"。知乎

三条路先上牌桌:速度和钱,分开看
路线 | 预算口径 | Qwen3.8-27B单流速度 | 数据出处 |
|---|---|---|---|
SEi14 AI(独立NPU+24G专用推理内存) | 约1.2万,NPU占近半 | 约6 tok/s(ZDM上市一个月实测) | B站首发实测评论区+站内长测 |
AI Max+ 395整机(SER9 Max/GTR9系列) | 社区口径2.2万上下 | 10→20→40 tok/s,全看框架适配 | 知乎8/25车主实测 |
老零刻+EG02坞+二手3090 | 主机卡自有:新增约2100元(EG02 1299+电源500+线材300) | 40 tok/s;4-6路并发总吞吐90-130 | 知乎9/11成本测算 |
云API(参照线) | 零硬件 | —— | 约7.5元/百万token,RPM 5000/TPM 500万,1M上下文 |

注意这张表里没有"谁最好",因为速度只决定体验,单位token成本才决定该不该上路。9/11那张账单最值钱的部分,是把坞+3090路线按用量分成了三档:
使用方式(广东口径) | 每百万token成本 | 对比API(7.5元/M) |
|---|---|---|
每天1小时、单路串行 | 含折旧8.20元(仅电费2.83元) | 贵了 |
每天≥8小时、4-6路连续批处理 | 含折旧3.64元(仅电费1.26元) | 省51%-83% |
同上+批量任务全排谷段 | 仅电费0.866元 | 省近九成 |
3090和主机都已有的车主 | 折旧仅35元/月,盈亏平衡13.2M token/月 | 批处理90 t/s下每天跑满1.5小时即回本 |
一句话总结这份成本模型:"自建一定比API便宜"是错觉,"并发+时长"才是开关。单路串行调用,你花7600元买的算力只用了一小部分,摊出来每百万token比API还贵;一旦日均8小时+连续批处理打开,边际成本只剩电费。原话很扎心:不是电费贵,是你花7,600元买算力却只用了一小部分。知乎

第二个账:待机才是主要成本,峰谷电有个30%决策线
把电费单再拆开,三个可以直接抄的结论:
待机比推理费钱(低负载时):整套系统待机82W。S1场景每天只用1小时,月电费44.7元里有37元是待机。长期低负载的车主,先开休眠、限功耗墙,再谈优化。知乎
峰谷电价有一条"30%决策线":如果30%以上推理量属于可延时批量任务,全排谷段一年省488元(降幅37.3%);如果几乎全是交互式请求,申请峰谷反而可能因为峰段涨价20%而亏。申请前用南网在线App让95598帮你估。知乎
电源不是越小越省:800W金牌在待机时负载率仅7.6%、效率掉到80%;但跑满载482W的机器别换500W电源,保持750-850W金牌,靠功耗墙和休眠优化。深圳车主注意本地独立电价整体贵11.6%(S5场景年电费3218元),但不改变任何结论。知乎
上路前的三堵墙
接口墙:EG02的OCuLink口是PCIe 4.0×4(约64Gbps双向),但SER6 Pro机身只有USB4(40Gbps),没有OCuLink出线口——除非拆机走M.2转接,只能靠雷电5口向下兼容。这就是我们之前写三款Mate坞时说的"80Gbps的坞,先看你主机的口":先看自家零刻有什么口,再决定买什么坞,别反过来。知乎
生态墙:SEi AI评论区技术流提醒(15赞):虽然用的是llama.cpp,但支持没进主线,后续新模型得靠NPU厂家一点点支持;另一派说得更直接,指望NPU来prefill不太现实,现在主流方案是GPU管prefill、NPU管decode。NPU整机买的是挂机电量,不是速度,别看160TOPS宣传下单。哔哩哔哩
门槛墙:2100元新增投入只属于"3090和主机都已有了"的车主。从零起步别忘了二手市场把门槛一路往下砸——有人2000块的2080Ti 22G魔改卡已经在碾压24G新卡的价格锚,2-bit量化又见下文。

谁配哪条路
手里既有老零刻又有3090:唯一一条"闭眼上"的路,边际成本只剩电费。必做四件事:开4-6路批处理、限功耗墙、低负载开休眠、批量任务排谷段。
日均交互≤2小时、单路为主:别自建。含折旧8.2元/M已经输给API的7.5元,买硬件等于买了个很贵的爱好——评论区那句"有这钱充API能用好多年"虽然招骂(对面回怼"何不食肉糜"),但对轻用量的人就是对的。
要24小时挂机+断网隐私+桌面安静:你付费的不是速度,是"7×24身份"。395为核显战3A和128G统一内存买单(还要替内存涨价行情买单);SEi AI为待机功耗和维护成本买单,评论区原话就是这种更适合24小时挂机、省电、维护成本不高。两者之间,按你每天挂多久、能不能忍6-20 tok/s来选。哔哩哔哩
只是OpenClaw养虾党:速度本来就不是你的第一指标,半年复盘那篇说过"留下的是认真养虾机的人"——按"挂机账"而不是"token账"来选就行。
接下来盯三个信号
显存墙在拆:Escha-W2把27B压到10.15GB权重,模型卡(9月4日前口径)里5090单流87.1、4090 67.0、3090 40.7 tok/s,连16G的5060 Ti都能跑29-30 tok/s、4路并发97.9。"必须24G卡才能跑27B"这个前提正在失效。值得盯的是它承诺的GGUF版和第三方完整长上下文评测(8月22日Kaitchup的质疑还没被回答),在那之前,把它当强候选,别直接替代FP8生产环境。知乎
内存行情:这份测算自己写了口径:数据随电价政策、硬件行情与llama.cpp版本变化,建议每半年复核一次。395哪天从2.2万跌回来,三条路的成本表要全部重算。知乎
你家那张电费单:先在南网/国网App里看一眼自己有没有进第三阶梯、能不能开峰谷,再决定"挂机党"这个身份值不值——广东车主和黑龙江车主,跑同一个模型真不是一个价。