DeepSeek涨价4.5倍客户一个没跑:想趁API变贵入坑本地部署的,这三笔账先算完

源自162位全网作者

15:39

9月24日那则消息,把一群本来在观望的人彻底搞心态了:DeepSeek年化营收突破10亿美元、估值三个月内从近4000亿人民币涨到5000亿,而这轮收入爆发,是在把API价格上调最高4.5倍之后实现的——涨价了,客户一个没跑,收入反而翻倍。据The Information报道,梁文锋在投资者会议上透露,按近期收入折算的年化收入已达10亿美元,较几个月前翻了一倍多。微博微博

这边是"API越来越贵"的焦虑,那边是小红书上"本地部署大模型"火到离谱,连平时不碰代码的朋友都开始问:是不是买台好电脑,就能拥有自己的DeepSeek?两边一夹,很多人的第一反应变成了:要不我买台机器,一劳永逸?小红书

先别急着下单。这笔账比你想的复杂,我把它拆成三笔,一笔一笔算。算完你会发现,"为了省钱搞本地部署"这个动机本身,可能就是错的。

先把事实钉死:API到底贵了多少

8月17日那波调价,DeepSeek把API价格上调了2.3到4.5倍。新价格表还引入了分时段设计,工作日白天被划成高峰,别的时间明显便宜,批处理的活挪到晚上跑相当于白捡个折扣。更扎心的是,涨价之后客户群没有缩小,需求依然强劲,毛利率还做到了82.9%。微博知乎微博

但注意另一面:价格战没停,只是换了方向。OpenAI的GPT-6 Luna同期把价格打了下来,输入每百万token约0.67元、输出约3.35元——已经比DeepSeek的低价档还便宜。也就是说,旗舰API在涨,但"够用的API"在跌。这直接影响到后面算账的结论。知乎

个人用户的真实量级也先摆出来:按DeepSeek官方定价,百万token输入最低1元、输出最低2元。一个每天聊天加写文案10万token的普通重度用户,一个月大概300万token,月账单也就几块钱到十几块钱。API对你的"贵",大概率是情绪,不是账单。知乎

第一笔账:进门的票价,比票本身贵得多

真要本地部署,第一个拦路虎是显存和内存,第二个是它们的价格。

看一个真实样本。小红书博主方华Foina为了"敏感数据不上云",前后淘了两台大内存Mac:2023款M2 Max 96GB和M3 Max 128GB,实测结果差距残酷——M3 Max 128GB跑Qwen 3.8 Flash-Next,长文和代码压力测试下长期稳定在38~40 tok/s,属于能正常干活的水平;M2 Max 96GB连Flash-Next都加载不了,退到27B的Q4量化,只剩12 tok/s左右。她的结论是,本地大模型选机器不能只看芯片新不新、GPU核心多不多,内存够不够、实际能跑多少tok/s才是硬指标。小红书

DeepSeek涨价4.5倍客户一个没跑:想趁API变贵入坑本地部署的,这三笔账先算完

这背后的现实是:2026年这波内存涨价还没到头。知乎上关于内存何时回归正常价的讨论热度很高,高赞回答的判断是,降价要等长鑫产能爬上来,最快也是27年底到28年底的事。也就是说,你想配一台128G大内存机器来"一劳永逸",恰恰买在了价格高位。已经有人纠结到发帖求助:32G显卡加128G DDR5都下单了,要不要退掉内存换64G——这种拧巴,就是当前硬件行情的缩影。知乎

粗算一下:一台能舒服跑27B级模型的机器(16G+显存或96G+统一内存),眼下普遍1.5万到3万起步;按3年折旧,每年成本5000到10000元。对照上面那笔"月账单十几块"的API费用,光第一笔账,纯省钱动机就已经不成立了。

第二笔账:那些不会写在配置单上的成本

企业级的算法可以参考着下放到个人。知乎上一篇专门算这笔账的专栏给过几个数:一张A100满负荷跑,一天电费约20元;GPU有30%到65%的时间在闲置;GPU两年一换代,你的卡第二年起就是旧卡。知乎

DeepSeek涨价4.5倍客户一个没跑:想趁API变贵入坑本地部署的,这三笔账先算完

换成个人场景:你的卡满载几百瓦,天天开着跑,一年电费几百块;你不可能7×24满负荷用,机器大部分时间在吃灰;最狠的是换代——开源模型半年一茬新旗舰,你现在为跑Qwen 3.8配的显存,半年后可能又只是"刚好装得下"。硬件折旧追不上模型迭代,这是本地部署最容易被忽略的账。

还有一项没法标价的:折腾时间。装环境、选量化格式、调启动参数、排CUDA报错,每一次模型更新都要再来一遍。小红书上已经催生了"远程付费安装"的灰产,恰恰说明这条路对普通人并不友好。

第三笔账:token自由是真的,能干活是假的

这是最关键、也最少有人提前告诉你的一笔。知乎一位自托管爱好者的回答说得非常直白:token自由是真的,能干活是假的。知乎

他的理由有三条,条条戳中要害:一是上下文长度被显存钉死,KV cache随上下文线性涨,模型装得下,一上长上下文就爆;二是长链路agent明显不行,让它读仓库、找问题、改代码、跑测试、写报告,本地模型会在第五步丢掉第一步的约束;三是速度决定了它只能干慢活,你盯着进度条等输出,工作方式就退化成了批处理。知乎

DeepSeek涨价4.5倍客户一个没跑:想趁API变贵入坑本地部署的,这三笔账先算完

所以他给本地的定位是:本地部署给你的是"数据主权"和"边际成本为零",不是一个不要钱的员工,把它当成一个不知疲倦、但只有短期记忆的实习生,预期就对了。知乎

另一位帮人参谋27B配置的答主,最后给出的建议更干脆——如果代码没有涉密或审核需求,更建议直接跑在线调用,用各家flash档位,1000块能用好几个月。而企业侧那篇算账专栏的结论也一致:本地部署对90%的人没意义,但对剩下10%,它是目前最划算的生产力投资。问题只剩一个:你是不是那10%。知乎知乎

你是哪种人,决定这笔账怎么算

把三笔账叠起来,按人群给结论:

隐私刚需党(买):合同、客户资料、涉密代码、不想出网的私人材料——这些场景本地部署无可替代,别算钱,算安全感。方华那3万块买的本质就是这个。这是本地部署唯一"不讲性价比"也成立的理由。

批量重复任务党(值得搞,但别上旗舰):大量改写、分类、抽取、翻译、embedding这类"简单高频"活儿,本地小模型(7B到32B)+通宵跑,边际成本为零的优势才真正兑现。任务越像流水线,本地越划算。

Agent重度党(别硬上本地):AI Coding、长文档分析、多步Agent——后台一次指令调几十次模型,token消耗是大了,但这些恰恰是最吃长上下文和模型智商的场景,本地27B和云端旗舰的差距会在长链路里被指数放大。这类人该做的是错峰调API、把批量任务挪到低谷时段,而不是买显卡。

纯FOMO新手(先一分钱别花):如果你还没搞清楚自己一个月到底用多少token,先老老实实用一个月API,看清自己的真实调用量和任务类型,再决定哪些任务值得本地化。那位劝退帖博主的建议就是新手先用API入门。

混合党(多数人的最优解):私密材料和简单任务走本地,复杂推理走云端。企业侧的案例数据显示,这种混合方案能省40%到70%。个人同理。知乎

接下来盯这几个信号

这笔账不是静态的,三个变量在动:一是DeepSeek的定价——它已经聘请中信证券筹备科创板IPO,涨价换营收的故事讲通了,降价动机就弱,但GPT-6 Luna已经杀进它的价格腹地,价格战随时可能反扑。二是内存价格周期——高赞判断降价最快也要27年底到28年底,大内存机器现在就是高位,不急可以等。三是开源模型的换代节奏——下一代开源旗舰能不能把"能干活"的门槛从128G内存压到64G,直接决定你现在买的机器能坚挺多久。微博

一句话总结:API涨价涨的是重度用户和企业,普通人拿它当买机器的理由,是把别人的账单当成了自己的动机。真要花这1万到3万,先确认你要买的是数据主权,不是省钱幻觉。

评论区聊聊:你现在一个月API花多少?本地机器花了多少?帮你看看这笔账到底值不值。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章