DeepSeek 涨价最高 1100%,Qwen3.8-27B 同一周开源:把 AI 搬回 HomeLab 之前,先算清这三笔账

源自15位全网作者

11:17

两条消息撞在同一周,对家里蹲着服务器的人来说,这不是热闹,是决策时刻。

8月12日晚,DeepSeek V4-Pro 正式版上线,定价输入3元、输出6元每百万token;8月17日0点,新一轮调价正式生效,V4-Pro 峰时缓存命中输入价从0.025元直接拉到0.3元/百万token,涨幅1100%,这已经是年内第四次调价。知乎

几乎同一时间,8月14日阿里 Qwen 团队把 Qwen3.8 系列全系开源。知乎其中"真的能在家里跑起来"的 27B,两天登顶 HuggingFace 全球趋势榜,下载量突破100万。知乎

一边是云 API 变贵,一边是本地部署最强开源模型到位。所以这几天 HomeLab 圈子里的气氛有点微妙:大家都在算同一个问题——AI 负载,是不是该搬回家了?

先别急着下结论,我们把三笔账算清楚:能力账、钱账、坑账。

第一笔账,能力账:27B 在家里到底什么水平

先看官方给的能力答案。这波 Qwen3.8 系列的旗舰是2.4万亿参数的 MoE 模型,官方口径性能比肩 Fable 5,也是阿里千问首次开源 Max 级别模型。36氪

DeepSeek 涨价最高 1100%,Qwen3.8-27B 同一周开源:把 AI 搬回 HomeLab 之前,先算清这三笔账

而本文主角 27B,作为系列里对消费级硬件最友好的稠密多模态模型,官方数据是 SWE-bench Pro 61.7、OSWorld 84.3、WebArena 64.8、CoWorkBench 70.7。哔哩哔哩

但跑分告诉你的是它多聪明,不是它跑多快。对 HomeLab 来说,速度矩阵更现实。速度方面,我们汇总了 B 站 UP 主和社区的一批实测(Q4 级量化)。哔哩哔哩现在的局面大概是:

显卡/平台

大致速度

备注

RTX 5090

约157 tok/s

Q4 级量化

RTX 3090(GGUF)

约53 tok/s

常规跑法

RTX 3090(vLLM+INT8+MTP)

单流82 tok/s @250W

64并发约417,峰值672

2080Ti 22G 魔改

39.5 tok/s(IQ4_NL+MTP)

vLLM FP8 约60 tok/s

AMD 7900XTX

约62 tok/s

ROCm 生态继续进步

16GB 显存

约40 tok/s

需要 q3 量化

Mac M 系列

15-30 tok/s

统一内存优劣参半

8GB 显存

能跑

上下文和量化大幅缩水

三个结论,对着自己的显存对号入座:

  1. 24GB 是舒适线。 3090、4090、7900XTX 这个级别能完整跑 Q4,速度在日常对话、写代码场景完全够用;3090 用 vLLM+INT8 抠显存后,单流能跑82 tok/s,64路并发约417、峰值672。知乎

  2. 16GB 是可用线。 q3 量化加40 tok/s 左右,体验打个折,但个人用足够"能用"。哔哩哔哩

  3. 12GB 及以下,别硬上。 8GB 确实能跑,可上下文和量化都缩水严重,属于"跑得起来"而不是"用得舒服"。哔哩哔哩

第二笔账,钱账:云端和本地,到底谁更贵

这才是这次涨价逼着大家算的账。

先拆 DeepSeek 的新价格。这次调价不是一刀切涨价,而是峰谷定价:峰时是北京时间9-12点、14-18点,谷时价格减半。知乎1100%的涨幅,打的是"V4-Pro、峰时、缓存命中输入"这个组合——如果你的调用模式正好落在这个区间,成本结构就是被重写了。但如果你主力用 V4-Flash、又能把任务挪到谷时,缓存命中输入还是0.05元/百万token,影响其实有限。

所以钱账的第一个问题,不是"云贵不贵",而是"你的调用落在峰谷表的哪一格"。

再算本地。本地成本就两项:硬件加电费。机器本来就是游戏主机或者已经在机架里吃灰的,硬件算沉没成本,增量主要是电费:以3090整机约350W、每天跑4小时算,一个月大概42度电,按居民电价折合二十五到三十块——这个数字比很多人想的便宜。

DeepSeek 涨价最高 1100%,Qwen3.8-27B 同一周开源:把 AI 搬回 HomeLab 之前,先算清这三笔账

当然社区里也有人把这笔账算到极致:有硬核玩家直接把8块工作站显卡塞进家里机架,组成私人算力池。小红书这种玩法仅供参考,普通人先看自己的电表和电源。

钱账里还有两个容易漏掉的点:

  1. 别追高买卡。 社区已经在讨论"显卡又要涨价",这波 AI 算力需求已经传导到二手市场,现在为跑 27B 临时买卡,大概率买在溢价上。

  2. 警惕魔改卡。 闲鱼上大量2080Ti 22G魔改卡以"机房卡"名义流入。知乎植球工艺是否扎实决定寿命,工艺差的返修率可以到100%。哔哩哔哩

最后说本地真正买到的东西:不只是省 API 费用。数据不出家门,隐私在自己手里;不限速、没有 token 焦虑;更重要的是能直接接进 HomeLab 现有的 NAS、Jellyfin、家庭自动化——这层联动的价值,云 API 给不了。

第三笔账,坑账:别人替你踩过的坑

能力和价格都定了,先别急着 pull 镜像。这周最有价值的信息,其实藏在 B 站一条叫"Qwen3.8-27B 三宗罪"的视频评论区里。

第一宗罪:默认设置过度思考,模型默认使用 xhigh 推理强度。Simon Willison 实测让它画一张鹈鹕骑自行车的 SVG,这一张图足足跑了21分钟,光推理就用掉22276个token。知乎社区里有人让它算一条线段长度:32G显存跑Q6量化,速度只有25 tok/s,一道小题用了30分钟、吃掉50K上下文才做完。哔哩哔哩

DeepSeek 涨价最高 1100%,Qwen3.8-27B 同一周开源:把 AI 搬回 HomeLab 之前,先算清这三笔账

不过也要听完反方:热评指出,思考强度本来就是可以改的设置,这种体量的模型想跟几百B的闭源模型掰扯能力,天生思维链就要长。哔哩哔哩两边都有道理,关键是你要会调。

社区已经给出三个验证过的解法:

  1. 换模板、降思考档。 用 HuggingFace 的 V22 chat template 加中度思考,实测对比深度思考正确率不变、耗时缩短47%、上下文最多省86%;直接关思考虽快,正确率会掉到85%左右,不推荐。哔哩哔哩这个模型的能力就长在思考上,降档别拔管。

  2. MTP 一定要开。 Simon 的实测里,启用多 token 预测(MTP)后,速度比默认设置提高约72%。知乎社区普遍反馈,不开 MTP 输出只有40多 tok/s,开了能到60-80。哔哩哔哩坑在量化版本差异大,部分民间量化不支持 MTP,部署前看清版本说明。

  3. 上下文别拉满。 原生262K、可扩展到1M听着吓人,但长输入 prefill 很慢:100K输入 prefill 约795 tok/s,首 token 要等2分钟左右。知乎用不满就别开满。

还有一条值得留意的传闻:社区有人说,阿里官方已经把 Qwen 3.8 35B A3B 从 Modelscope 和 ms-swift 注册表中移除。哔哩哔哩官方尚未证实,但如果这个 MoE 版本最终放出,对显存小的用户会比稠密 27B 友好得多。

那么,谁现在就该动手

把三笔账的结论合起来,给三类人发行动卡:

  1. 手里已经有24GB显存的卡:直接上。 vLLM 或 Ollama 加 Q4 量化的组合足够成熟,记得 V22 模板、中度思考、MTP 必开这三件事。API 省下来的钱,电费很快就赚回来。

  2. 16GB 显存:先试量化版,别急着买卡。 q3 量化入门够用,同时盯住 35B A3B MoE 的动向——真放出来,它才是你的显存最优解。

  3. 12GB 及以下:别硬上,谷时 API 不丢人。 重任务挪到 DeepSeek 谷时段、用 V4-Flash,成本依然可控;本地留给轻量任务就好。涨价周期里追高买卡,谁买谁站岗。

接下来值得盯的信号

  • Qwen 3.8 35B A3B 会不会正式出现、以什么形式出现;

  • DeepSeek 峰谷定价跑完一个周期后,生态和调用量怎么变化;

  • 这波开源模型发布,会不会把二手显卡价格进一步推高。

最后问一句:你 HomeLab 里的 AI 负载,现在是本地跑还是调 API?这次涨价有没有让你改变计划?评论区聊聊。

内容由AI生成

精选参考来源

1. DeepSeek今日涨价最高1100%,中国大模型连续16周全球第一:从"白菜价"到"开始赚钱"的拐点

2. 国产芯片大模型推理优化系列(第六期)-Qwen3.8-27b+Hermes

3. Qwen3.8开源2天破100万下载、登顶全球第一!美国刚逼30国”选边站”,中国AI就用实力撕碎了技术铁幕

4. 刚刚,阿里开源2.4万亿参数大模型,性能比肩Fable 5

5. Qwen3.8-27B正式开源:官方跑分、架构与本地部署成本

6. Qwen3.8-27B本地实测:5090跑到157Token/s!3090也有53Token/s,Mac约30Token/s,170HX达43Token

7. DeepSeek把价格切成峰谷,Qwen在3090里抠回2.6GB显存

8. 16G显存跑27B大模型?Qwen3.8-27B本地实测:40T/s,这次真的封神了!

9. Qwen3.8-27B正式开源!越狱无审查!媲美顶级闭源模型,最低8GB显存就能跑!本地部署实测|零度解说

10. 男生闺房-homelab & 算力定妆照

11. 大量几乎全新RTX2080Ti魔改22G显卡涌入咸鱼,号称itc机房卡,300A核心,引2万人次浏览,超两百人想要!

12. 2080TI魔改22G后的那批显卡,还稳定吗

13. Qwen3.8-27B本地部署实测:很好但别用默认设置,社区优化后潜力很大,可稍晚入手!

14. 泼冷水!Qwen3.827B三宗罪:很强!很难伺候!很难用!

15. 【分享】改善Qwen3.8雷霆大思考

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章