模型的倒计时和硬件的倒计时,在这个十月对撞了。这是本地部署圈子这两年最拧巴的一个窗口期。
一条倒计时是模型。9月22日云栖大会开幕式上,通义千问负责人刘大一恒第一次把Qwen4家族摆上台面:Qwen4-Max、Qwen4-Flash、Qwen4-Plus,以及承担开源任务的那一款——Qwen4-27B。发布时间没给。于是社区开始自己算:千问官网的新模型内测排到了9月底。有人按Qwen系列大概两个月的发布节奏推演,Qwen3.8-27B是8月中旬开源的,那Qwen4-27B大概率落在10月中旬。10月3日今天的AI日报,已经在传Cursor里出现了疑似Qwen4的神秘模型条目。微博知乎知乎
另一条倒计时是价格,而且方向和"等等党"的期待完全相反。这轮涨价不是普通周期波动。有财经博主统计,DDR5内存颗粒现货价从去年9月到现在累计涨了300%以上,16GB内存条从四五百块涨到近1500,1TB固态硬盘从300多涨到1100。微博
华强北商户早前确认过显卡全面封仓、价格大涨约30%,RTX 5060 Ti一度被抬到6000元档。连服务器淘汰下来的Tesla V100 32G,都从几百块"当半个废品卖"涨到4000以上,而它这波翻身的直接导火索,就是Qwen3.8-27B和MiniMax-H3这类"能干活"的开源模型集中落地——大显存卡的行情是被本地部署用户自己抬起来的。知乎知乎
两条倒计时叠在一起,就把"要不要现在配一台跑本地大模型的机器"变成了一个真正需要算的决策题。而这篇想服务的人也很具体:懂llama.cpp或Ollama、知道量化档位、但设备还停在"凑合跑不动正经模型"这一档,正卡在下单页面前的那批人。

先把最反直觉的结论放前面:等降价是高风险,等模型是低成本的
"等等党"的默认假设是价格会回来。但供给侧的信号不太给面子:微博上"内存涨价或持续至2028年"的话题从9月就挂着。手机厂商这边,上一代旗舰机已经完成了一轮1000元档位的普涨。10月1日TrendForce发布的四季度展望更直接:一般DRAM合约价预计环比上涨10~15%,计入HBM后的整体DRAM合约价上涨15~20%,NAND闪存同样上涨15~20%。微博微博微博
半导体的强周期判断当然有人信——评论区也有人说"存储C端四季度就要开始跌"“DDR6普及了DDR5自然就便宜”。但"四季度见顶回落"的说法至少目前没有机构数据背书,"等两年"对一个模型两个月一发新版本的圈子来说,本身就是一个巨大的机会成本。知乎
反过来,"等Qwen4-27B开源"这个动作几乎不花钱:晚两周下载一个权重文件的事,而且它可能直接决定你现在该买什么配置。所以"买不买"之前,先分清你在等的是什么。
先算"背刺"这笔账:Qwen4-27B开源,会不会让你现在买的硬件作废?
这是追新党最担心的问题,但把硬件占用的逻辑摊开看,风险比想象中小。

Qwen3.8-27B之所以被社区叫作"模型斩杀线"——星空灵核那句流传很广的断言是"第一个能正儿八经工作交付的本地模型"——关键不在参数,在于它把可用的量化档位压进了普通机器的范围。按Unsloth的部署文档,UD-Q4_K_XL量化文件17.9GB,加视觉投影约0.93GB,17~19GB总内存能启动,24GB是比较稳的起点;官方档位表是16GB机器上UD-Q3_K_XL(约13.4GB)、24GB上Q4、48~64GB可以考虑UD-Q8_K_XL(约31.5GB)。NVFP4这种保真度更高、速度还快1.5倍的格式,则只认Blackwell一代的卡。注意这些分数和档位都出自官方模型卡与Unsloth文档的口径,自报跑分打个折扣看,但硬件门槛的数字是实打实可复现的。知乎知乎

注意这个结构:Qwen4-27B顾名思义还是27B这个量级,按这个系列一路走来的惯性(3.6、3.8的27B都稳在24~32GB甜点档),Qwen4-27B开源后大概率还是被同一批量化档位接住。也就是说,一台现在按24~32GB档配齐的机器,两周后"背刺"你的最坏结果,是下载一个新GGUF重新跑一遍;真正会被新架构重新洗牌的是"想上更大MoE、拉更长上下文"的激进党——对那部分人,等模型卡才是刚需。B站横评区那条高赞评论说得很直白,上下文才是本地部署的"杀猪刀"。哔哩哔哩
三类人,三个答案
手里已经有24GB级统一内存Mac、16GB以上N卡或64GB大内存机器的:什么都别买。你的存量设备就在甜点档上,Qwen3.8-27B今天就能跑起来干活,等Qwen4-27B开源只是换个文件下载。唯一要做的功课是知道自己设备的脾气:Mac的内存带宽是短板,实测M5 Air 32G跑35B MoE能到52 token/s顺利用,跑27B稠密模型却只有7 token/s——“Mac用户抱紧MoE"是社区用真金白银换来的经验。而稠密27B的价值在另一个场景:M1 Max用户的实测感受是"MoE适合有人盯着干活的活,稠密27B适合无人值守时慢但稳地推进”。哔哩哔哩

从零配机、预算准备上消费级新卡的:先等10月中旬那张模型卡,再定配置,但别等降价。涨价行情里"追高"和"不追"都吃过亏——8月底就有开发者花2888元收V100想拼最低门票,而当时这张卡已经被炒到4K以上。他折腾一个多月的结论是:V100无输出接口、重启掉驱动哀嚎一片、CUDA 13已经放弃Volta、不支持FlashAttention-2,Q4量化开MTP3最高50多token/s,上下文一长直接掉到20以下,“非经验丰富的程序员强烈不推荐”。也别迷信"整机永远只涨不跌":9月底刚开售的Mac mini M6,官方起售价6999元还嫌丐,一周内就被电商平台补贴砸到最终到手4999元。知乎知乎
真正在评论区沉淀下来的省钱路线从来不是新卡:魔改3070 16G/3080 20G多卡拼显存、四通DDR4大内存平台、或者像小红书晒的单子那样用128GB统一内存的小主机(铭凡MS-S1 MAX、Mac mini这一档)直接跑MiniMax-H3。4000元丐版硬件跑13款模型的横评能拿到近万收藏,说明大家愿意买的从来不是"最贵的卡",而是"确定的下限"。小红书哔哩哔哩
被API涨价逼到想转本地的:先想清楚你买的是省钱还是可控性。这波折腾本地部署的很多人,起因是DeepSeek全线数倍涨价后,单次调用成本从几毛涨到1~3块钱、完全不可接受。但跑过大半年的人给出的反调值得先读:整机一万五的3090用户直言,本地部署跑了小半年之后想唱个反调——“本地部署不是省钱方案,是可控性方案”。知乎知乎
算账口径很简单:你月API账单撑不起一张涨价后的显卡,就别把本地部署当成本工具;断网可用、数据不出门、没人给你限流、以及评论区那句"图个开心"的拥有感,才是这批人真正的付费理由。反过来,云模型的免费额度这两个月送得有多疯狂,也在评论区被反复念叨——只是"永久免费"这四个字,你过去两年见过多少次了。哔哩哔哩知乎
接下来盯什么
给还站在店门口的人留四个观察信号:一是Qwen4-27B正式开源落地、官方模型卡给出硬件占用档位——如果还是24~32GB级,存量甜点档用户彻底安心,配置党照表配机;二是10月底前内存、固态现货价的环比走势,以及华强北封仓是否松动,那是"涨价见顶"最早的温度计;三是"存储C端四季度降价"的说法有没有兑现,兑现了再动手不迟,社区里有人炒存储股也有人等算力冗余崩盘,这两种声音都值得当反向指标听;四是Unsloth那批量化版本对Qwen4-27B的跟进速度——当年3.8的Q4放出当天,"斩杀线"讨论就已经在替新机配好档位了。
本地部署这两年最大的变化,是门槛从"看不懂"变成了"不敢买"。而涨价窗口里的纪律其实就一条:等模型几乎免费,等降价可能要等到2028,只有"等自己有明确的活要干"这件事,什么时候都不算晚。