涨价一周,梗已经先更新了:曾经被尊称为"梁圣"的梁文锋,如今被很多人叫作"梁文谷",因为高峰时段实在太贵。知乎8月17日零点,DeepSeek API新价格正式生效:V4 Pro高峰时段输出价从6元涨到27元/百万Token,涨幅350%;缓存命中输入涨了12倍;峰谷定价首次进入V4系列,高峰恰好是9:00-12:00和14:00-18:00,全是打工时间。知乎微博上,"梁爷爷"降级成"梁仔"的段子一天就传开了。微博
被涨价挤到墙边的重度用户,目光齐刷刷转向了同一个目标:已经开源的DeepSeek-V4-Flash-0731。这个284B的MoE模型正式版以MIT许可开源,带1M上下文,社区里"本地跑V4 Flash"的帖子从8月初火到现在。知乎各路实测帖都非常亢奋:矿卡能跑、8张3090能跑、单张5090也能跑,口径清一色"Token自由了"。
但我们把这周的5条路线实测逐一对了一遍,发现差距根本不在"能不能跑",而在跑起来之后,宣传帖里没写的那几个数字。
先对齐一下,这是个多大的模型
硬件门槛都写在规格表里:
284B参数,MoE架构,每个token只激活13B;
原生FP8+MXFP4混合量化,落盘166.9GB;转成GGUF/MXFP4大约155GB;
训练上下文1,048,576,也就是宣传里的1M。
结论很直接:满血部署的显存/内存门槛从128GB起步,想用单张24GB、32GB的卡装下它,就得靠offload。5条路线的区别,本质上就是"显存不够,拿什么来凑"。
五条路线,逐条对答案
路线一:4张CMP 170HX矿卡,4.4万元一台4U服务器

B站UP主鲲鹏Talk用一台4U服务器做了5.7小时压测,23个测试点位、15268条GPU采样:4张 CMP 170HX 本地部署 DeepSeek-V4-Flash 可行,日常 32K 以内上下文首字可做到秒级,解码约 80 Tok/s。哔哩哔哩
宣传视频没告诉你的是:104 万 Token 上下文成功跑通,但单请求首字约需 11 分钟,更适合长文档、代码库等离线批处理。哔哩哔哩
回本账同样有前提:按每日 2,000 次重度调用、峰谷加权 API 价格计算,自建机器电费约 4 元/天,对比官方 API 约 126 元/天;44,000 元硬件投入约 12 个月回本。哔哩哔哩注意这是每天2000次重度调用的口径,用量减半,回本期就要翻倍。另外有个反面证据要摆出来:另一条实测显示 170hx大矿卡Qwen3.827b战v100速度一样,但稳定性堪忧价格离谱。哔哩哔哩矿卡本身也没闲着,咸鱼上早就被炒成了一卡难求的存在,价位直接起飞。知乎
路线二:8张RTX 3090,6.5万-6.9万元

这条知乎部署记录值得细看,因为作者自己就把口径说破了:复杂代码生成任务实测,页面左下角显示首字时延 680ms、39 tokens/s,并强调这是本次环境、当前请求的实测结果,而不是硬件通用跑分。知乎

真正该圈出来的是这张终端截图里的两个参数:n_ctx_train=1048576 表示模型训练/官方能力对应约 1M 上下文;本次服务返回的 n_ctx=8192 表示当前实例配置为 8K 上下文。知乎模型支持1M,不等于这台8卡机就在1M下跑。
宣传帖不会告诉你的还有电费:RTX 3090 的参考功耗上限约为 350W,8 张卡仅 GPU 名义功耗就达到 2.8kW。知乎整机满载进入3kW区间后,24小时运转的月度电费很容易到千元级。
电路是另一道隐形门槛:3.5kW 在 220V 下已经接近 16A。知乎散热、噪音、供电线路都得单独解决,老小区住宅电路尤其要先确认。
预算端也别只看卡价:GPU 约占整机预算的 61%–64%;二手卡采购还应预留返修与备件预算。知乎
路线三:8张A100 80GB PCIe,用机房里现成的卡
这是今天刚发布的一篇生产级实录:在官方支持名单之外的Ampere卡上,把284B跑到了单流约40 tok/s,代价是全套工程活。V4-Flash-0731是按Hopper/Blackwell的张量核心发布的,vLLM依赖的对应算子只编译了SM90/SM100,SM80压根没有。注意不是「回落到慢实现」,是这个算子在 Ampere 上压根不存在。知乎
只能走社区fork,而且带了 DeepSeek 自家投机解码(DSpark)在 Ampere 上能用的实现。我们最终上的是这个:单流 ~40 tok/s。知乎
坑在后面:这个fork后来被force-push过,记住要锁 commit,而且必须按 SHA 拉,不能按分支。知乎
更要命的是正确性:这一系的 fork 有明确的历史问题:并发压力下会产出读着通顺、其实是胡说的内容,泄漏训练片段、content 变 null、陷入复读,而 API 该返 200 还是返 200,token 数也看着挺正常。知乎
作者给出的验收办法是:在长文档中间埋一个唯一的 secret,然后点名去问。我们在 20K 到 893K token 的范围都测了。知乎
路线四:FreeToken+单张RTX 5090,32GB显存+192GB内存

前几天伯克利、MIT等团队开源的FreeToken,思路是把CPU、内存、PCIe总线当成统一调度平台:专家池常驻主机内存,GPU里只用LRU缓存热门专家,靠"动态带宽感知+双缓冲+状态复用"把284B满血塞进消费级单卡。在处理长 Prompt(如 4-16k 上下文)时,传统 Offloading 方案因逐层从系统内存拉取 Expert 导致严重 I/O 阻塞。FreeToken 将首 Token 延迟(TTFT)降低了 42-58%。知乎多轮Agent场景收益更大,后续多轮交互的TTFT减少65-80%,官方基准以Codex生产trace中位33 token/s的decode速度为参照线。
宣传帖没写的是内存门槛:比如 DeepSeek V4 Flash 的专家池约 140GB,就需要 32GB 显存(RTX 5090)加上最好有 192GB 的内存来跑才比较稳。知乎"显存不够内存来凑"的前提,是你先有192GB内存,而且长prompt的prefill阶段仍要把接近完整的专家池过一遍PCIe。这条路线适合个人开发者搭Agent,多人并发场景它扛不住。
路线五:128GB统一内存一体机

这条路线本月早就有出圈案例:一位同学因为一个月花了学校将近500美元的token被警告,转而在一台128GB显存的机器上成功部署了V4 Flash。小红书从截图看,本地ds4端点已经接进开发工具,1M上下文就位。优点很明确:安静、省电、插电即用;速度上限则低于多卡服务器。
另外要提醒一句:近期 DGX Spark 等同类产品都在大幅涨价,大内存、大显存设备的价格趋势肉眼可见。小红书这类机器的入场费并不低。
不买硬件的人,还有三条退路
第一,官方API+峰谷套利。8月23日起规则又变了:调整后,周末(周六及周日)全天将不再区分峰谷时段,统一按低谷时段价格计费。微博批处理、压测、跑数据这种不急的活,全排到周末,账单能下来一大截。
第二,第三方平台。硅基流动按原价上架了0731,但评论区体验两极:有人吐槽DeepSeek官网可能5分钟就做好了,这个做了10多分钟也没见完成,又卡又慢。知乎OpenCode的V4 Flash免费渠道也在涨价后下架了,白嫖路子越来越少。
第三,最实在的一条:轻度用户偶尔写文案、问问题——涨价后一年多花的钱,可能不够一张 3090 的一半。知乎算不过账,就别急着买卡。
"能跑"和"可用"之间,隔着四个数字
五条路线对完答案,踩的其实是同一组坑:
服务上下文≠训练上下文。n_ctx_train=1M是模型的能力,服务的n_ctx配多少才是你的体验。104万上下文的首字等待,是11分钟起步。
Decode速度≠并发体验。宣传帖都爱贴decode,但多人同时用的瓶颈在prefill:短提示稳态解码在 10 并发下达到 518.5 Tok/s;预填充则不会因并发而提速,长上下文多用户排队需要特别注意。哔哩哔哩518 tok/s很好看,长上下文多用户照样排队。
返回200≠答案正确。fork路线在并发下有胡说、泄漏、复读的前科,状态码和token数都正常,能验的只有大海捞针+逐条读输出这两件事。
硬件价≠总成本。卡只占整机六成上下,剩下的是电源、散热、电路、备件、每月千元级的电费,以及矿卡路线额外的稳定性折扣。
那么,你该怎么选
每天2000次级别的重度调用、API月账单上千:重度用户每天都在跑编程 agent、批量文档、自动化流水线,API 月账单已经上千。一块二手 24GB 卡几个月回本。知乎矿卡4卡路线、3090八卡路线的回本逻辑都成立,但先把供电散热电路解决掉,再接受二手硬件的维修风险。
公司机房已有A100/H100:fork路线可行,但请把正确性验收和锁commit排进工期,这不是可选项。
个人开发者搭Agent:FreeToken+单卡是眼下最优雅的答案,先去确认内存插槽够不够192GB。
数据绝对不能出内网:这笔账不用算回本,按预算直接选路线,数据不出内网本身就是收益。
只是偶尔写代码问问题:别买卡。折旧加电费比涨价后的API还贵,重活排到周末吃谷价就好。

最后给决定自建的人提个醒:整条链路是"业务应用→OpenAI兼容API→推理引擎→显卡",现有的RAG、Copilot、Agent应用通常只需要改Base URL和模型名,迁移成本比想象中低,这部分反而是整个决策里最不用纠结的。
接下来值得盯的三个信号
一是vLLM官方仓库已有issue跟进该模型的SM8x(Ampere)支持,维护者的态度仍是"更适合放在fork里做"——官方支持落地前,A100路线的正确性风险要自己担。二是视觉版V4-Flash-Vision-Exp已于8月21日上线API:今天,全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp上线DeepSeekAPI平台。知乎它目前只在API端,权重会不会开源给本地部署,值得盯。三是硬件端,内存、显卡、大内存设备今年都在涨价通道里,"等等党"和"早买早享受"两边都得把电费算进总账。
本地部署最大的价值,从来不是省token,而是成本变得可计算、数据留在自己手里。只是这一切的前提,是你看的是"可用"的数字,不是"能跑"的数字。