8月13日晚,深度求索把V4-Pro正式版上线和一份新价目表塞进了同一份公告:8月17日零时起,旗舰模型V4-Pro高峰时段的输出价从每百万Tokens 6元涨到27元,涨幅350%;缓存命中的输入价从0.025元涨到0.30元,是原来的12倍。一同引入的还有峰谷计价,也就是每天上午9点到12点、下午2点到6点算高峰,其余时段半价。知乎 六天后又是一次反向操作:8月23日起,周六周日全天不再区分峰谷,统一按低谷价收。一周两调,一次抬价一次变相降价,社区给出的读法很一致——高峰时段的算力不够分了,价格开始承担调度职能。
轻度用户其实无感,但重度玩家第一次感到了疼:涨得最狠的是走量最大的Flash线,8月17日,DeepSeek正式执行新价格。V4-Flash的缓存未命中输入从0.1元涨到1元/百万tokens,输出从0.2元涨到2元。知乎 微博上月初涨价风声刚传出时,就有一条467赞的高热评论说得很直白——吓得他又开了一个月ChatGPT会员,70一个月不香吗。微博
而几乎同一周(8月14日),阿里巴巴开源了Qwen3.8-27B:这是一款270亿参数视觉语言模型,采用Apache 2许可证。知乎 涨价单和开源权重撞在同一周,这不是巧合,是供需两侧同时到了拐点。对机柜里躺着N100、旧显卡、二手服务器的HomeLab玩家来说,真正的问题只剩一个:要不要把AI负载搬回自己家?我把全网这几周的实测、账单和踩坑帖翻了一遍,先把三本账算完再谈情怀。

第一本账:云端现在的账单长什么样
以V4-Flash现价(1元/M输入、2元/M输出)算,日常问答一个月也就几百万Token,一顿早饭钱。但Agent和编程工作流是另一个量级,一个做英语素材的博主晒出自己的Token消耗统计:DeepSeek涨价后,随便干点啥都几块钱,一天随随便便就几十块了。微博 平台侧的数据更夸张:OpenCode这家全球调用量最大的中文模型聚合平台,平日里每天经手8万亿Token,涨价后的那个周末直接掉到了不足此前峰值的一半。知乎

订阅路线也没给"逃回月付"留多少面子。智谱对CodingPlan动手了:新版对新订阅用户改为积分制,GLM之前的Lite套餐确实性价比高,一下子变成118,涨量还减量。知乎 额度看着有公式,重度Agent根本撑不住——有用户晒单:买了109块glm,兴致冲冲地打开了项目,10分钟后5小时额度用完,乖乖换回ds4。知乎
替代供应商倒是打疯了。8月26日深夜,智谱官宣OpenRouter匿名模型Ox Alpha就是GLM-5.3-Flash:MIT开源、权重同步上传,促销期价格只有DeepSeek的三分之一;阿里同夜把Qwen3.8-Flash打到输入1元/百万tokens、输出3元。知乎 但同一篇分析也泼了冷水:促销价9月9日截止,原价算下来,有开发者测算GLM-5.3-Flash比DeepSeek涨价后还贵约46.6%,9月9日之后还能不能打,要看智谱的续价诚意。
结论一:云端没到"用不起",但白菜价时代结束了——涨价前那种"使劲蹬"的用法,现在每一脚都是钱。先别急着锁任何一家长约,9月9日是个天然的对账日。
第二本账:本地这台机器,到底跑不跑得动
这个月本地部署最大的变化不是硬件,是开源模型第一次对上了HomeLab的存量显卡。实测者加载同一个 17GB 的 Q4_K_M 量化版本,在一台128GB内存的MacBook Pro和一台DGX Spark上都跑通了;群里用 AMD 7900 XTX(24GB显存)的反馈是输出速度大概62tok/s。知乎 换句话说:不用买新机器,你抽屉里那张24G卡就是入场券。我按硬件档位把全网这几周的实测速度整理成一张表(口径不完全一致,看数量级即可):
硬件 | 实测表现 | 状态 |
|---|---|---|
RX 7900 XTX 24G | 62 tok/s | 流畅干活 |
双V100S 32G(服役8年的老服务器) | 单流59.3 tok/s、并发220 tok/s、256K上下文 | 全链路跑通,但换了三套引擎 |
Tesla V100 32G 单卡(llama.cpp) | decode 约26 tok/s | 能用,远低于预期 |
128GB M3 Mac(V4-Flash量化版) | 输出约25 tok/s | 勉强能追 |
RTX 3080 16G | Q4_0塞得下,一开32K上下文就OOM | 只能8K,Agent工作流截肢 |
铭凡N5 MAX(AI Max+395,64G统一内存) | 35B级模型本地流畅运行 | 存算一体样板 |
3080那行值得展开:"塞得下权重"和"跑得起任务"是两回事。unsloth 出了 Qwen3.8-27B 的 GGUF,Q4_0 才 15GB,正好塞进一张16GB 的 RTX 3080。结果跑起来直接傻眼——agent 编程任务一开 32K 上下文就 OOM,连问答都只能开 8K。知乎 16G档的瓶颈在KV缓存没地方落——这个月社区反馈最集中的坑,不是模型不行,是你的上下文被显存裁了。
老服务器党则贡献了本月最提气的一条实测路线:一台服役8年的老机器插两块Tesla V100S,跑8月14日刚发布的Qwen3.8-27B,vLLM主线开局三连败,最后靠一个683星的SM70特化fork翻盘,最后跑出来的数字是:单流 59.3 tok/s,并发 220 tok/s,256K 上下文。知乎 这位作者的自我总结很扎心:老卡玩家真正要投入的不是钱,是折腾时间。
统一内存路线是这个月的新变量。铭凡8月18日官宣AI NAS N5 MAX,海外版把128GB配置标价3,599美元、原价4,499美元,预计9月中旬发货。知乎 国内版反而更卷:目前国补64GB版本只要一万五,它跑的就是Ryzen AI Max+395配64GB统一内存、本地推理容器常驻系统的方案:

小米也来敲门:AI Cube目前只是一台工程原型机,售价、上市时间、操作系统都没公布,公开信息里最扎眼的是80GB统一内存、宣称本地部署120B级别大模型。知乎 也就是说:这个时间点专门为本地AI买新硬件,恰好站在"内存涨价"和"新机未量产"中间——现在买个64GB的内存要五六千,高频板载的只能说更贵。知乎 谁现在接盘,谁给渠道清库存。

结论二:手里有24G级显卡的,此刻就是低成本入场窗口;只有16G或纯N100的,这个月的答案是"能点亮、不能用";想为涨价专门换机的,等9月中旬N5 MAX发货、小米AI Cube报出价格之后再说。
第三本账:搬回家的隐性成本,和"本地不如官方版"的元凶
电费其实是小账。双V100S按每卡TDP 250W加平台估算,满载约600W上下,按居民电价0.6元/度、每天推理8小时算,一个月约90元——比涨价后的云端账单小一个数量级。真正的大账在"稳定性"三个字上:你的机柜从"存文件的"变成了"必须7x24在线推理的"。

量子位8月29日转述的Level1Techs实验,值得每个打算本地跑Agent的人读一遍:论坛用户做了一系列实验,10万token工作流里仅切换vLLM的注意力后端,就会出现"Top-1翻转"——FlashAttention 2搞错了,导致接口变成了GigabitEthernet0/1/4,随后模型又在两次后续工具调用中执行了错误的命令。知乎
更针对HomeLab省钱姿势的是KV缓存量化:INT4 KV缓存在长上下文中的Top-1翻转率急剧攀升,最终导致工具调用无法恢复。知乎
而排查这类问题有多无从下手,作者数完自己随手拉下来的容器就有答案:随手下载的vLLM nightly容器镜像里包含734个软件包,其中252个是Python的uv/pip包。知乎 翻译成人话:本地部署的模型不是"免费的云端",是"另一家你自己当运维的供应商"——跑问答和文本生成感知不到差异,跑工具调用密集的Agent工作流,量化精度直接决定它会不会半夜把错误命令发到你的软路由上。
还有一个新手必踩的默认值坑:实测者第一次用这个模型画一只骑自行车的鹈鹕,这一张图足足跑了 21 分钟:光推理就用了 22,276 个 token。知乎 元凶是Qwen文档写明的默认xhigh推理强度,作者的建议很直接:第一次用先把推理强度调到low,甚至直接关闭推理。他关掉推理重跑同一条提示词,只用了137秒,也就是两分多钟——又一个"先调设置再怪显卡"的样本。
结论三:本地化收益最大的是高频、可容忍重试、对隐私敏感的后台负载——整理媒体库、相册打标、夜间批量Agent;对"必须一次答对"的交互任务,云端订阅仍是更便宜的SLA。
九月值得盯的四个信号
9月9日:GLM-5.3-Flash促销截止。原价和DeepSeek现价谁更贵,届时见分晓,之前别签任何年付;
9月中旬:铭凡N5 MAX 128G发货、小米AI Cube若公布定价——统一内存档"每GB多少钱"会决定这轮是旧卡续命还是设备换代;
9月9日之后:两篇复盘的口径一致——“价格战已经打到了尽头”,DeepSeek留着算力憋下一代旗舰,新模型落地后,本地27B和云端旗舰的差距会重排一次;
随时盯:64GB内存五六千的行情不见顶的话,"为AI扩容"的性价比只会继续变差。
一句话收束:这轮涨价对HomeLab党不是灾难,是一份迟到的对账单——AI第一次在家用显卡上转到"流畅干活"的转速,云端第一次贵到值得你认真算自己的账。有24G卡的,今晚就可以把API密钥换成局域网地址;只有N100的,把这轮当行情看,别当军令状;正想为省钱买新机器的那位,先把手从下单键上拿开,等9月三件事落地再说。