DeepSeek涨价、开源、逼走Pro之后:"本地化DeepSeek"这场竞赛,我劝你先对号入座

源自144位全网作者

20:06

9月25日凌晨开始,微博上#曝DeepSeek完成75亿美元融资#的词条下面刷了一夜。比融资本身更炸的是梁文锋在投资会上交底的那几个数:年化营收从几个月前的不到5亿美元冲到10亿美元;API调用价上个月提到原来的2.3-4.5倍,客户没跑,需求反而更猛;七成以上算力砸去训新模型,留给推理服务的不到三成。微博

前两条是DeepSeek自己的事。第三条,对本地大模型圈的人来说,才是该停下来看的那条:推理算力被压到三成以下,意味着晚高峰限流、响应变慢这些"云端老毛病",接下来大概率只会更明显。而恰好两周前,DeepSeek把新旗舰V4.1-Flash直接开源了。"把DeepSeek搬回家"这件事,从没像现在这样既有动力、又有素材。

但先泼盆冷水:开源不等于你能跑。这两天我把8月以来的时间线、社区两条部署路线的实测细节和各档硬件的账对完了,结论是——这场竞赛里值得你上车的只有特定档位,对不上号的,老老实实继续用云端反而更划算。

先把时间线钉死:刀是怎么一步步落到API用户头上的

  • 8月13日,V4-Pro正式版(GA),结束测试转商用。

  • 8月14日公告、17日0时生效:V4系列取消统一计费,搞峰谷定价——北京时间9:00-12:00、14:00-18:00算高峰,闲时价是高峰的一半;相比旧价,闲时输入涨50%、输出涨125%,高峰再往上翻倍。东方财富当时的标题是"API最高涨11倍"。社区情绪两极:骂声是"低价抢完市场就开始割",另一边的现实是调用量没掉。微博东方财富

  • 9月10日,V4.1-Flash发布并同步开源:552B主干的MoE,注意力从CSA换成CSA2,首次整合Engram、DSpark、Single-Pass,原生多模态。最狠的是两件事——正式版跑分反超自家V4-Pro,API价格砍到旗舰的三分之一;然后9月14日12点后,发给Pro的请求全部路由到Flash按新价计费,Pro上线才一个月就被强制退役。知乎

  • 9月25日,就是这次的融资爆料:钱70%进训练、30%都留不到给推理。

看清楚这个节奏:8月涨的是旗舰价,9月给的Flash替代价其实降回了旗舰的三分之一。所以"本地化省钱"这笔账,对轻度用户根本不成立——真正被涨价+限流风险两头挤的,是那种拿API接Claude Code、各类harness、多Agent工作流、一个月烧几百上千块的重度调用党。你们才是这次的主角。

DeepSeek涨价、开源、逼走Pro之后:

开源模型的真相:552B权重只是门槛,200GB"记忆表"才是深渊

V4.1-Flash是MoE,每token只激活一部分参数,带宽压力不算顶天——问题在于它新加的两张Engram n-gram查找表,总规模超过200GB。社区9月12日那篇疯传的复盘文章把话说得很直白:模型发布当天就有人开始"塞机竞赛",而标准vLLM会把这些表整个塞进主机内存,统一内存架构下,主机内存占多少,留给权重、KV Cache和CUDA Graph的就少多少。知乎

这场竞赛现在跑出两条路线,成本完全不是一个量级:

DeepSeek涨价、开源、逼走Pro之后:

路线A:四台DGX Spark拼集群。 每台128GB统一内存,合计512GB,用TP4+DCP跑vLLM的MXFP4/MXFP8相对高精度版本。即便如此,默认加载方式下4台还是塞不下。社区给出的解法相当野:Engram不整个进内存,留在NVMe上,每台Spark只备自己那约47.2GiB的分片,推理时按输入n-gram哈希去盘里按需捞行,CPU处理完再喂给模型。硬件账:DGX Spark首发约3.4万,现在官方价奔着4万去了——一个多月的行情,涨了近20%,“首发买和现在买差约1.31万,硬件却没升级”。四台加互联,这台机器立起来就是15万上下。知乎知乎知乎

DeepSeek涨价、开源、逼走Pro之后:

路线B:一到两台大内存Mac。 Apple Silicon统一内存打底,靠激进的混合量化加专用Metal推理引擎硬压,antirez这类大佬也下场给个人硬件搓专用本地推理系统。参考B站那位花5万买Mac Studio跑AI、复盘了一年的UP主的说法,本地token经济学就是买更大的内存,等于买和最先进模型之间的时间差。代价是量化到什么程度、掉多少能力,目前全靠社区版本迭代,9月中旬第一波上手的人反馈并不稳——知乎甚至有人发帖骂V4.1-Flash是"体验最差、最不严谨的版本",部署端只会更难。知乎哔哩哔哩知乎

一句话:"免费开源"的V4.1-Flash,完整跑起来的门票是10万+,半完整是5万级且质量存疑。对号入座之前,先看看自己的机器在哪一档。

对号入座:三档机器,三套完全不同的动作

第一档:16-24G显存/32G以内统一内存——别想V4.1,Flash档才是你的主场。
这档的本地最优解根本不是"本地化DeepSeek",而是这两周集中放出的小激活MoE:Qwen3.8-Flash-Next,176B总参6B激活,知乎有人直接喊它"SuperUMA圣体"——Max+395这类32G统一内存机器就为它而生,9月19日已经有Windows平台的社区引擎gfx1151把它跑通;纯国产的Xing4.0-29B-A4B也在9月22日被发帖安利。哔哩哔哩知乎知乎

16G独显(比如5060Ti 16G)这档,9月21日的B站测评把Qwen3.8-27B直接定成"16G显卡最佳选择",配套的还有跑稳150t/s的开源加速项目。注意反面教材:24G卡想硬上27B稠密q4的,知乎老玩家的算盘是权重就吃掉约19G,再放KV和MTP,上下文小气、并发免谈。你这档的正确姿势:本地跑Flash档干隐私活、批量活,V4.1该调API调API——反正现在它是旗舰三分之一的价。哔哩哔哩哔哩哔哩知乎

DeepSeek涨价、开源、逼走Pro之后:

第二档:单台128GB统一内存(Spark或Mac Studio大内存版)——能当"27B自由"节点,别硬啃V4.1。
已购Spark的朋友亲测"单机跑27B没问题,转协议给Agent当本地节点,不用买API了";知乎上甚至有深度优化教程把量化版V4-Flash塞进单台Spark,跑出最高35 token/s。但要认清带宽是硬伤:9月23日的实测报告结论是推理速度比不过5090,只有长上下文预填充阶段能扳回来。这档买的是"整夜挂Agent不心疼token"的底气,不是前沿模型本体。知乎知乎知乎

DeepSeek涨价、开源、逼走Pro之后:

第三档:15万级预算的硬核玩家——恭喜,竞赛门票给你留着。
4×Spark集群或双大内存Mac,适合两类人:数据一天都不能出域(公司标书、病历、未公开稿),以及日均调用大到把折旧摊成零头的。其余所有人,这档看看热闹就好——DGX Spark现在还在涨价通道里,追高入场等于给"理财产品"接盘。

这笔账最后怎么算

把三个数放一起:V4.1-Flash API是旗舰三分之一价;你硬件一个月不回本的都不算"免费";而DeepSeek把七成算力拿去训练,意味着云端给你留的那三成,质量红利吃不了太久。所以我的判断是——2026年秋天的"本地化DeepSeek",情绪价值大于经济账:对多数人它是一次"再等等",对第一档用户它其实已经发生了,只是名字不叫DeepSeek,叫Flash。也别高估眼下的本地阵营:知乎有重度玩家复盘过本地模型的三个用途,结论是"读整个工程、跨文件改代码、跑测试再自我修正"这条云端Agent链路,本地目前接不住。知乎

接下来盯四个信号,任何一个兑现再回头改作业:1)10月底这轮交割完成、IPO推进后,API是否二次调价;2)推理算力占比有没有从三成往回抬;3)社区混合量化版V4.1-Flash的跑分/速度对比,是否做到"掉点不明显";4)DGX Spark行情——它跌回3.4万那天,集群门票才算打折。至于顺手党,Qwen3.8-Flash在Qoder的免费窗口只开到9月底,这波不薅,等涨价了就真成别人的免费午餐了。微博

你最接近哪一档?评论区报一下显存/内存和月均token账单,我帮你看看这笔账到底该不该算。

内容由AI生成

精选参考来源

1. AI圈又炸了:据两名知情人士透露,DeepSeek当前年化营收运行率已达10亿美元,短短数月前还不足5亿。CEO梁文锋在近期投资会上说,增长靠两件事——API提价+模型继续被疯抢。上月调用价涨到原来2.3—4.5倍,他直言没流失客户,需求反

2. DeepSeek发布API涨价公告DeepSeek发布API涨价公告,将对DeepSeekAPI价格进行更新调整,采用峰谷定价,空闲时段价格为高峰时段价格的一半。高峰时段为北京时间9:00-12:00、14:00-18:00(其余为空闲时段

3. #东方财富##股票#【DeepSeek不再白菜价?API最高涨11倍】鼓励用户根据实际使用情况调整任务时间。网页链接(来自@东方财富网)抢占完市场份额后,提价割韭菜,还是玩互联网时代的老套路

4. DeepSeek开源V4.1Flash新架构,价格砍到旗舰三分之一,自家V4Pro强制退役

5. 疯狂的 DeepSeek V4.1:一场由社区推动的本地部署竞赛

6. DGX Spark涨了20%,我为什么一点也不后悔?

7. 英伟达 DGX Spark GB10 值得买吗?又一个理财产品?

8. 花5万买MacStudio跑AI值不值?用了一年终于能回答了。附模型评论和硬件对比,部署指南

9. DeepSeekV4.1FLASH是当前深度求索发布体验最差、最不严谨的版本

10. 激情燃烧!395在Windows上跑Qwen3.8-Flash-Next!

11. 又发现一个适合本地部署的宝藏模型,Xing4.0-29B-A4B模型,还是纯国产化的

12. 现在怎么没有人提用AMDMAX395去跑本地大模型了?

13. Qwen3.827BGSQRCO测评:它就是16G显卡最佳选择!

14. Qwen3.827B火箭一样飞奔!这开源项目:让它稳跑150t/s!

15. 目前有什么可以本地部署的大模型推荐?

16. 我朋友买了两台NVIDIADGXSPARK4TB个人超级计算机,这玩意能干什么很酷的事情么?

17. 最高35token/s!DGXSpark深度优化DeepSeek-V4-Flash教程分享

18. DGXSpark跑Qwen3.827B推理实测:内存带宽是硬伤

19. 我测了本地大模型的三个用途,两个行不通

20. DeepSeek二轮融资近500亿落定:年化收入破10亿美元,首任CFO到岗冲科创板DeepSeek这次不是"又拿了一笔钱",而是把IPO前的最后一块拼图补上了。1️⃣收入翻倍,但要注意口径年化收入从7月的4-5亿跳到1

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章