上周五发布的 Qwen3.8-27B,大概率是今年本地部署圈讨论度最高的模型。17GB 的 Q4 量化权重,一台像样的电脑就能装下,官方跑分超过闭源的 Qwen3.7-Plus。知乎社区里有人直接叫它“本地 Opus”。开源两天下载量突破 100 万次,在 HuggingFace 趋势榜上连续霸榜。36氪有文章把它称为本地大模型的“甜点位”——尺寸刚好、能力够强,许可证还是可商用的 Apache 2。知乎

但同一时间,另一件事也在发生:8 月的显卡涨价潮。RTX 5090、5080 市场价一路走高,AMD 宣布 RX 9000 系列提价 10%-15%。微博Intel 那款 32GB 显存的锐炫 Pro B70 在美欧韩市场涨了 26%-48%。微博
最强的本地模型,撞上了近年来最不适合买硬件的窗口期。大家真正关心的问题其实只有一个:这波上车,到底要花多少钱,怎么上才不亏?
我把这几天 B 站、知乎上分散的实测数据汇总了一遍,结合显卡市场的行情,拆成三条路。哔哩哔哩知乎对照自己的情况看就行。
先看清楚:这台模型在不同设备上到底多快
设备 | 量化/跑法 | 解码速度(tok/s) | 来源 |
|---|---|---|---|
M4 Max 128G | NVFP4 + MLX + MTP | 短上下文 63,16K 内 42,31K 掉到 12 左右 | B站 UP 主全天实测 |
RX 7900 XTX 24G | 社区常用配置 | 约 62 | 智能体交流群用户反馈(单一来源) |
M2 Max 96G | MLX | 28-54,随上下文变长下降 | B站评论区实测 |
RTX 5060 Ti 16G | Q5/NVFP4 | 约 40(上下文开法存争议) | B站评论区(单一来源) |
RTX 3080 20G | IQ4_XS | 约 33 | B站评论区(单一来源) |
M5 Max / DGX Spark | LM Studio 默认 | 15-30 | Simon Willison 评测(编译) |
几个结论比数字本身更重要。
第一,软件栈比硬件升级更要紧。同一台 M5 Max 或 DGX Spark,LM Studio 默认跑只有 15-30 tok/s,换 llama.cpp 并开启 MTP 多 token 预测,提速约 72%。知乎Mac 上用 MLX 后端的方案,M4 Max 能跑到 60 以上。哔哩哔哩模型同一个,钱同一份,跑法不同,速度差出 2-4 倍。所以动钱包之前,先把免费的那部分调明白。
第二,27B 稠密模型的瓶颈是内存带宽,不是算力。这解释了为什么 M 系列芯片跑得不算快但很稳,也解释了评论区反复出现的“带宽问题,无解”。哔哩哔哩选卡和选机器时,带宽比纸面算力更值得看。
第三,长上下文是断崖,不是线性下降。M4 Max 在 16K 以内能稳 42 tok/s,31K 直接掉到 12 左右。哔哩哔哩统一内存的 Mac 和 16GB 显存的卡,跑日常问答没问题,但要拿它做长上下文的 Agent 重度任务,得先掂量一下。
第四,显存门槛。Q4 权重 17GB,B 站实测内存占用峰值 22.1GB。哔哩哔哩24GB 显存是刚好舒服的甜点位,16GB 要靠低比特量化挤进去,上下文还得省着用。

再看行情:涨价是真的,但信号是互相矛盾的
这波涨价的主角其实不是 GPU 芯片,而是 GDDR7 显存,真正推高成本的是过去不起眼的显存颗粒。微博

但市场上的判断是分裂的,两边都有道理:
一边是 PCPartner 的警告:未来数月 GPU 供应将进一步恶化,入门级显卡断供风险尤为突出,想买便宜卡趁现在。微博另一边是追踪显卡行业 25 年的分析师 Jon Peddie 的说法:厂商在借显存涨价的报道顺势抬利润,零售价的实际涨幅超过了成本涨幅。微博换句话说,现在买,有一部分钱交的是“情绪税”。
还有一组容易被忽略的信号:租赁市场反而在松。RTX 4090 的时租价普遍不到 2 元,H100 的租金今年更是直接雪崩。知乎买卡的人在焦虑,租卡的人在捡漏。
所以不存在“必须买”或“必须等”的标准答案,只有不同情况下的不同答案。
三条路,对照自己的情况选
路径一:手里已经有卡(成本:0 元)
24GB 显存的卡——RTX 3090、4090、RX 7900 XTX——正好是这台模型的甜点位。你要做的不是看行情,而是把软件栈调好:换支持 MTP 的推理后端,选对量化版本,给上下文留好预算。有用户在 7900 XTX 上跑到 62 tok/s,日常 Agent 使用完全够。知乎16GB 显存也不是不能用:评论区有人用 5060 Ti 16G 配 NVFP4 量化挤了进去,速度约 40 tok/s,代价是上下文要精打细算。哔哩哔哩这波涨价跟这群人没有关系。你们是现在社区里最被羡慕的人。
路径二:准备认真配一台(预算:1 万-5 万)
社区讨论指向的性价比答案,是二手 RTX 4090,今年年中的行情还在 1.5 万元左右徘徊。知乎但要提醒一句:二手卡水很深,矿卡、翻新、无保修都是真实风险,这条路只适合有验货能力的人。小红书

不想折腾、在意开箱即用的,可以看 48GB 以上统一内存的 Mac。知乎上有高赞回答观点很鲜明:如果把大战 CUDA、配环境、修权限的折腾成本算进去,Mac 反而是经济方案。知乎Ollama、MLX 一行命令装好,机器还能当 24 小时待机的低功耗服务器。但要清楚它的边界:带宽决定了速度上限,长上下文有断崖。
预算更高的选项:DGX Spark 约 2.9 万,M5 Max 128GB 配置按海外价格折算约 4 万-5 万。知乎而此刻花 2 万+ 买一张全新 RTX 5090,是三条路里交涨价税最多的选项。不是卡不好,是时机不好。
路径三:没有独显,或者想再等等(成本:20 元以内)
先租云 GPU 验证需求。时租不到 2 元的 4090,足够把 Qwen3.8-27B 跑得舒舒服服。知乎有视频实测过:在 8GB 显存的笔记本上功能全都能用,但慢到难以忍受,同任务换租来的 4090 快了几百倍。哔哩哔哩低配硬跑和租卡之间,差的不是体验,是可用性。
租上 10 个小时,不到 20 块钱,足够想清楚这台模型到底能不能进你的日常工作流,再决定要不要买硬件。这条路同样适合在等 RTX 5070 Ti Super 的人:这张卡目前没有任何官方时间表和定价,干等不如先用起来。
如果选择等,盯住这三个信号
社区优化的成熟度。MTP、MLX 适配、各种量化版本正在以肉眼可见的速度补齐——这模型才发布没几天,接下来几周大概率还会冒出新的提速方案。36氪现在的“慢”有一部分是生态没跟上,不是模型的天花板。
GDDR7 显存价格走势和 50 系新卡的消息。涨价的根源在显存,如果颗粒价格回落,或者 5070 Ti Super 这类 24GB 级别新卡落地,装机的性价比窗口会重新打开。
云端 API 的价格变化。DeepSeek 今年已经大幅调价,如果云端继续降,本地部署的必要性要重新算账。知乎本地真正的护城河从来不是便宜,是数据不出门和无限次调用。
最后说两句
在多数测试里,Qwen3.8-27B 的表现明显超出 27B 参数规模该有的水平。36氪它把“本地跑一个准旗舰”的门票降到了一个 17GB 的文件,这是实打实的门槛下降。知乎智能密度正在取代参数规模成为新的竞争维度,这对本地部署玩家是长期的好消息。
但这个 8 月,硬件价格在往反方向走。值得花钱的从来不是抢一张新卡,而是先用免费的软件优化把手里的硬件榨干;真要买,二手市场和大内存 Mac 目前比追高新机更稳;不急的话,先花 20 块钱租云跑 10 个小时,等涨价退潮或者下一张卡出来,都不迟。