这周本地大模型圈,两件事撞在了一起。先是DeepSeek涨价:2026年8月17日零点,V4系列API新价格正式生效,工作日9:00-12:00、14:00-18:00定为高峰时段,V4 Pro高峰输出价到了27元/百万Token,缓存命中输入的涨幅更凶——反复调用相似提示词、靠缓存省钱的做法,以前花的钱现在要翻12倍。知乎8月23日,官方又补了一个周末全天谷价。36氪这波涨价,直接把不少"全靠API"的人推回了自己的机箱前面。
另一件事:8月14日晚,阿里千问团队把Qwen3.8-27B的权重完整开源,Apache 2.0协议,个人和商用都不要钱。知乎这个27B参数的模型,成绩单有点反常:SWE-bench Verified拿了72.4分,LiveCodeBench v6拿到80.7分,编程能力接近更大一号的模型。知乎第三方榜单Artificial Analysis给出52分,追平了284B参数的DeepSeek V4 Flash,超过所有40B到150B的中型模型。知乎
热度也说明问题:发布一周内,Hugging Face上点赞破万,月下载量冲到172万以上,社区量化版本刷出了700个。知乎社区有句话总结这周特别准:Qwen 3.8正在经历自己的DeepSeek时刻。知乎

API变贵,恰好撞上一个免费、能打的开源模型落地,大家问的就是同一个问题:我家里这张显卡,到底能不能跑它?我把这一周知乎、B站、小红书上的实测翻了一遍,整理成这份"显存档位对照+避坑指南",直接说结论。
先算清楚一笔账:显存到底要装下什么
很多人判断"能不能跑"只看模型文件多大,这不对。本地部署的显存要装下三样东西:需要的显存 ≈ 模型文件体积(体重) + KV缓存(桌面大小) + 系统余量。知乎其中模型文件最直观:BF16原始权重约28B参数×2字节=54GB,16G显存想都别想,量化压缩后,IQ3_S约12GB,Q4_K_M约16.5GB,Q6_K、Q8_0再往上走。
第二笔账KV缓存,是大多数人忽略的——那是模型"记住"聊天上下文的开销。Qwen3.8-27B恰好在这里占了个便宜:它的64层里,48层是Gated DeltaNet线性注意力,只有16层是标准注意力。打个比方:标准注意力像每聊一句就往课桌上贴一张便签,聊得越多便签越多;线性注意力像在同一张摘要卡片上反复改写,聊多少都还是那一张。落到实测,这个模型的长上下文显存压力,大约只有同尺寸传统模型的四分之一:每个token的注意力缓存约256KB,8K上下文约2GB,32K上下文约8GB。知乎

显存档位对照:这周全网友实测出来的速度
下面是各平台最近一周实测汇总,速度受量化版本、上下文长度、是否开启MTP影响,都当区间参考。
16GB显存(RTX 5060 Ti 16G、4060 Ti 16G这类):这一档的正确打开方式是IQ3_S全量入显存+8K上下文+KV缓存压成q8_0,而不是硬上Q4,预期生成速度30~45 tok/s,日常对话和轻度Agent够用。知乎常见翻车姿势是硬上Q4_K_M:文件约16.5GB装不下,只能把几层卸载到内存里,而稠密模型是"全员上岗"制,每生成一个token所有参数都要过一遍,任何一层放在慢速内存里,全队陪它散步,速度立刻打骨折。
22~24GB显存(2080 Ti 22G魔改、3090、4090):这一档是甜区,Q4_K_M能全量入显存。双2080 Ti 22G+NVLink实测,开启MTP后输出速度最高能到50+ tok/s,一张2080Ti 22GB魔改卡目前大致2.3K元,是这波行情里的性价比入门。知乎再往上一档,单张3090跑社区的投机解码方案,模型加KV缓存共占约22.3GB就能开64K上下文,普通聊天约133 tok/s,在"同一份长文档反复提问"的RAG场景,每个验证步平均接受15/16个token,能冲到382 tok/s——后者是场景加成,别当普适速度。知乎双3090跑Q6_K也有人测了:NVLink有无确实有差距,但更值得注意的是主板PCIe通道这个隐形瓶颈——有人的三卡只能跑在pcie4.0*4上,直接拖慢。哔哩哔哩另外提醒:MTP接受度受输出内容影响较大,别人测出来的速度,你的负载未必复现。
极致省钱路线是多卡。B站有个硬核实测:6卡V100 16G,生成速度22 tok/s,prefill预处理速度1800 tok/s,上下文默认支持256K,并发4路,全套一万出头。哔哩哔哩小红书有帖子专门测了V100多卡扩展:从1卡到2卡提升很明显,但8卡的输出速度大幅下降,不推荐8卡;同一组实测里,4卡V100开MTP把生成速度从58.2提到68.8 tok/s,提升约18%——MTP不是免费午餐,但确实有真实收益。小红书

32GB显存以上:这档可以讲精度了,直接上Q6_K、Q8_0。B站一个三档精度对比的结论很直接:精度更高的模型更稳定,思考效率和token消耗都比低精度有优势,尽量还是用高精度模型;同一条视频也提醒,NVFP4版本在卡冈图雅黑洞测试里出过两次思考无限循环,对输出稳定性敏感的场景慎用。哔哩哔哩
没有独显怎么办? 有人实测纯CPU+18GB内存的迷你主机跑这个模型:3-bit量化,速度约11 tok/s,属于"能跑"线,体验就别期待了。哔哩哔哩Mac走统一内存,建议24GB以上统一内存的Mac跑IQ3_S,32GB以上再考虑Q4_K_M。知乎
三个坑,社区已经替你交过学费
坑一:同名量化文件,不是同一个东西。 Q4_K_M只是"菜谱名",不是标准:同一个Q4_K_M,lmstudio-community版16.8GB,ggml-org版19.0GB,AtomicChat版17.1GB,体积能差出2GB多,质量也天差地别。知乎更糟的是,权重正式发布前,Hugging Face上还出现过一大批同名假仓库。记住口诀:看体积、看实测,不看名字。
坑二:显存够,不等于好用。 本周最典型的反例:有用户为省钱用双RTX 5060 Ti 16G凑显存跑27B——显存够不等于体验好,位宽、通讯带宽、单卡还是双卡,会让同一个模型在不同硬件上差出一个量级的体验。知乎尤其是稠密模型,任何一层被放进慢速通道,全队陪着散步。
坑三:默认思考档位,是token碎钞机。 Qwen3.8-27B默认开启思考模式,而且档位是最高的xhigh,有开发者实测发现模型遇到难题会持续推理、却迟迟不给最终答案。对15道难题做的小样本配对测试里,medium档的成本不到xhigh一半,准确率反而更高。知乎样本很小,不能当结论,但值得在你自己的任务上做一次A/B——默认设置,往往不是最优设置。
灵魂拷问:那到底要不要买卡
最实际的问题来了:要不要买卡?我汇总下来的判断是三个字,看用量。
该买的人: 重度Agent用户。每天跑编程Agent、批量文档、自动化流水线,一个任务就是几十万token的消耗,API月账单上千很常见,这种用量,一块二手24GB卡几个月就能回本——买的不是"省钱",是把成本从不可控变成可控。知乎隐私刚需也一样:公司数据不能出门、内部代码不能上云,本地是唯一选项。
不该买的人: 轻度用户。偶尔写文案、问个问题,算一算涨价之后一年多花的钱,大概率不够半张3090。而且别忽略一个事实:Qwen3.8-27B在OpenRouter上的API价格已经低到每百万输入token只要0.40~0.45美元。知乎

V2EX上还有一句流传的提醒值得听:两个月后出了40-60B的新模型,手里的硬件可能就跑不动了。知乎消费级硬件追大模型,追的是移动靶,别抱着"一劳永逸"的心态买。
最后说一条今天的新闻,它直接影响上面这个判断:英伟达刚在Hot Chips 2026上,首次公布了下一代旗舰机柜Vera Rubin NVL72的片上实测数据,对比现役主力GB300 NVL72,每兆瓦吞吐量最高提升30倍,每百万Token成本最高降35倍。36氪

这类官方发布的数据听听就好,但方向是明确的:云端推理的成本还会继续跳水。这意味着,买硬件更不是一件"一步到位"的事——买够用当前需求的就好,剩下的交给时间。
总结一下:Token自由的本质不是零成本,而是多一个选项。日常轻量用云端,重活、私事、自动化放本地,是这周对大多数人最稳的姿势。接下来值得盯的信号有三个:DeepSeek定价的后续调整、年底新的40~60B开源模型还能不能塞进24G显存、NVFP4量化生态什么时候成熟。这三个里任何一个有进展,这份对照就得更新一轮。