两条消息撞在同一周,对家里蹲着服务器的人来说,这不是热闹,是决策时刻。
8月12日晚,DeepSeek V4-Pro 正式版上线,定价输入3元、输出6元每百万token;8月17日0点,新一轮调价正式生效,V4-Pro 峰时缓存命中输入价从0.025元直接拉到0.3元/百万token,涨幅1100%,这已经是年内第四次调价。知乎
几乎同一时间,8月14日阿里 Qwen 团队把 Qwen3.8 系列全系开源。知乎其中"真的能在家里跑起来"的 27B,两天登顶 HuggingFace 全球趋势榜,下载量突破100万。知乎
一边是云 API 变贵,一边是本地部署最强开源模型到位。所以这几天 HomeLab 圈子里的气氛有点微妙:大家都在算同一个问题——AI 负载,是不是该搬回家了?
先别急着下结论,我们把三笔账算清楚:能力账、钱账、坑账。
第一笔账,能力账:27B 在家里到底什么水平
先看官方给的能力答案。这波 Qwen3.8 系列的旗舰是2.4万亿参数的 MoE 模型,官方口径性能比肩 Fable 5,也是阿里千问首次开源 Max 级别模型。36氪

而本文主角 27B,作为系列里对消费级硬件最友好的稠密多模态模型,官方数据是 SWE-bench Pro 61.7、OSWorld 84.3、WebArena 64.8、CoWorkBench 70.7。哔哩哔哩
但跑分告诉你的是它多聪明,不是它跑多快。对 HomeLab 来说,速度矩阵更现实。速度方面,我们汇总了 B 站 UP 主和社区的一批实测(Q4 级量化)。哔哩哔哩现在的局面大概是:
显卡/平台 | 大致速度 | 备注 |
|---|---|---|
RTX 5090 | 约157 tok/s | Q4 级量化 |
RTX 3090(GGUF) | 约53 tok/s | 常规跑法 |
RTX 3090(vLLM+INT8+MTP) | 单流82 tok/s @250W | 64并发约417,峰值672 |
2080Ti 22G 魔改 | 39.5 tok/s(IQ4_NL+MTP) | vLLM FP8 约60 tok/s |
AMD 7900XTX | 约62 tok/s | ROCm 生态继续进步 |
16GB 显存 | 约40 tok/s | 需要 q3 量化 |
Mac M 系列 | 15-30 tok/s | 统一内存优劣参半 |
8GB 显存 | 能跑 | 上下文和量化大幅缩水 |
三个结论,对着自己的显存对号入座:
24GB 是舒适线。 3090、4090、7900XTX 这个级别能完整跑 Q4,速度在日常对话、写代码场景完全够用;3090 用 vLLM+INT8 抠显存后,单流能跑82 tok/s,64路并发约417、峰值672。知乎
16GB 是可用线。 q3 量化加40 tok/s 左右,体验打个折,但个人用足够"能用"。哔哩哔哩
12GB 及以下,别硬上。 8GB 确实能跑,可上下文和量化都缩水严重,属于"跑得起来"而不是"用得舒服"。哔哩哔哩
第二笔账,钱账:云端和本地,到底谁更贵
这才是这次涨价逼着大家算的账。
先拆 DeepSeek 的新价格。这次调价不是一刀切涨价,而是峰谷定价:峰时是北京时间9-12点、14-18点,谷时价格减半。知乎1100%的涨幅,打的是"V4-Pro、峰时、缓存命中输入"这个组合——如果你的调用模式正好落在这个区间,成本结构就是被重写了。但如果你主力用 V4-Flash、又能把任务挪到谷时,缓存命中输入还是0.05元/百万token,影响其实有限。
所以钱账的第一个问题,不是"云贵不贵",而是"你的调用落在峰谷表的哪一格"。
再算本地。本地成本就两项:硬件加电费。机器本来就是游戏主机或者已经在机架里吃灰的,硬件算沉没成本,增量主要是电费:以3090整机约350W、每天跑4小时算,一个月大概42度电,按居民电价折合二十五到三十块——这个数字比很多人想的便宜。

当然社区里也有人把这笔账算到极致:有硬核玩家直接把8块工作站显卡塞进家里机架,组成私人算力池。小红书这种玩法仅供参考,普通人先看自己的电表和电源。
钱账里还有两个容易漏掉的点:
别追高买卡。 社区已经在讨论"显卡又要涨价",这波 AI 算力需求已经传导到二手市场,现在为跑 27B 临时买卡,大概率买在溢价上。
警惕魔改卡。 闲鱼上大量2080Ti 22G魔改卡以"机房卡"名义流入。知乎植球工艺是否扎实决定寿命,工艺差的返修率可以到100%。哔哩哔哩
最后说本地真正买到的东西:不只是省 API 费用。数据不出家门,隐私在自己手里;不限速、没有 token 焦虑;更重要的是能直接接进 HomeLab 现有的 NAS、Jellyfin、家庭自动化——这层联动的价值,云 API 给不了。
第三笔账,坑账:别人替你踩过的坑
能力和价格都定了,先别急着 pull 镜像。这周最有价值的信息,其实藏在 B 站一条叫"Qwen3.8-27B 三宗罪"的视频评论区里。
第一宗罪:默认设置过度思考,模型默认使用 xhigh 推理强度。Simon Willison 实测让它画一张鹈鹕骑自行车的 SVG,这一张图足足跑了21分钟,光推理就用掉22276个token。知乎社区里有人让它算一条线段长度:32G显存跑Q6量化,速度只有25 tok/s,一道小题用了30分钟、吃掉50K上下文才做完。哔哩哔哩

不过也要听完反方:热评指出,思考强度本来就是可以改的设置,这种体量的模型想跟几百B的闭源模型掰扯能力,天生思维链就要长。哔哩哔哩两边都有道理,关键是你要会调。
社区已经给出三个验证过的解法:
换模板、降思考档。 用 HuggingFace 的 V22 chat template 加中度思考,实测对比深度思考正确率不变、耗时缩短47%、上下文最多省86%;直接关思考虽快,正确率会掉到85%左右,不推荐。哔哩哔哩这个模型的能力就长在思考上,降档别拔管。
MTP 一定要开。 Simon 的实测里,启用多 token 预测(MTP)后,速度比默认设置提高约72%。知乎社区普遍反馈,不开 MTP 输出只有40多 tok/s,开了能到60-80。哔哩哔哩坑在量化版本差异大,部分民间量化不支持 MTP,部署前看清版本说明。
上下文别拉满。 原生262K、可扩展到1M听着吓人,但长输入 prefill 很慢:100K输入 prefill 约795 tok/s,首 token 要等2分钟左右。知乎用不满就别开满。
还有一条值得留意的传闻:社区有人说,阿里官方已经把 Qwen 3.8 35B A3B 从 Modelscope 和 ms-swift 注册表中移除。哔哩哔哩官方尚未证实,但如果这个 MoE 版本最终放出,对显存小的用户会比稠密 27B 友好得多。
那么,谁现在就该动手
把三笔账的结论合起来,给三类人发行动卡:
手里已经有24GB显存的卡:直接上。 vLLM 或 Ollama 加 Q4 量化的组合足够成熟,记得 V22 模板、中度思考、MTP 必开这三件事。API 省下来的钱,电费很快就赚回来。
16GB 显存:先试量化版,别急着买卡。 q3 量化入门够用,同时盯住 35B A3B MoE 的动向——真放出来,它才是你的显存最优解。
12GB 及以下:别硬上,谷时 API 不丢人。 重任务挪到 DeepSeek 谷时段、用 V4-Flash,成本依然可控;本地留给轻量任务就好。涨价周期里追高买卡,谁买谁站岗。
接下来值得盯的信号
Qwen 3.8 35B A3B 会不会正式出现、以什么形式出现;
DeepSeek 峰谷定价跑完一个周期后,生态和调用量怎么变化;
这波开源模型发布,会不会把二手显卡价格进一步推高。
最后问一句:你 HomeLab 里的 AI 负载,现在是本地跑还是调 API?这次涨价有没有让你改变计划?评论区聊聊。