三天前,小红书有人拿5060Ti把游戏、光追、剪辑、本地大模型全测了一遍,结论斩钉截铁:30B以上的模型,8G和16G都跑不动,“至少上24G显存的卡”。小红书两天前,一张流传很广的分档部署表同样干脆:12G及以下,去试蒸馏的9B,“不如直接买token用”。微博
可你打开B站最新发布页,看到的是另一拨人:搬运翻译的教程拆解了"27B全精度要54GB"怎么靠量化、KV-cache设置和CPU卸载塞进8G到32G的消费级显卡。哔哩哔哩已经有人把9GB体积的IQ2量化27B装进12G的5070,32K上下文报出60t/s。哔哩哔哩
三拨人都是社区实测,没人说谎——只是"能跑"的定义不同:前两种说"无损好用",后两种是"配置到极致的可用"。值得关注的是,8月底到9月初这半个月,这两个定义正在快速靠近:量化、架构、引擎三头各砍了老规则一刀。这才是显卡按显存涨价的当口,你最不该冲动下单的原因。

一、先把老账本撕开:显存是零和游戏
老直觉一句话:显存占用≈参数量×每参数字节数,27B全精度约54GB。现在社区把它一层层往下砍,同一份27B权重出现了从55.6GB到9GB的多个体积版本。小红书一个Agent团队拿24G卡做过三条路线对比:W4A16+vLLM权重27GB级别配200K KV池、EXL3+exllamav3把权重压到14.2G换262K池、NVFP4留给批量任务。小红书9月1日社区又放出基于量化感知训练的QUASAR NVFP4版:全网络496个线性层W4A4量化,55.6GB压到19.7GB,vLLM/SGLang原生支持。小红书
这里的关键认知不是"哪个量化最强",而是那句"显存预算是零和游戏":权重省下的每一GB都会变成KV池,直接决定上下文上限——14.2GB和27GB权重差出的5GB,就是262K和200K的差距。小红书量化的本质,是卖权重给上下文腾地。
这笔账在24GB的Mac Mini上算得更狼狈:Q4权重约15GB,KV缓存吃2-3GB,系统再占3-4GB,MLX单开就能把24GB吃到只剩两三GB余量——博主的原话是"连微信都不敢挂"。小红书反过来,把固定前缀算进缓存几乎白捡性能:200K池下第二轮对话首token从16秒砍到0.6秒,实测者称prefix cache是"免费的午餐"。小红书
生态坑也顺手提醒:EXL3格式喂不进vLLM,“看到别人跑通,先查它用的什么引擎”。小红书16G档位的横评党已经把功课做绝:一张RTX 4070 Ti SUPER,131K上下文,20个量化档×3种加载方案共60组实测,张量级FFN分载平均比按整层分载快18%,prefill最高1427 tok/s。小红书

二、真正改写规则的是架构:参数量不等于显存
如果说量化是把账算细,8月26日发布的Qwen3.8-Flash就是换了账本:主模型125B参数,额外搭载51B的N-gram Embedding查表,推理时每token只激活6B参数,开源权重同步公开。微博表放硬盘、不常驻显存,小红书一个技术账号实测这个125B推理生成"只要5.95GB"(单一来源自测,当线索看,别当购卡依据),并称Kimi K3(2.8T)生成阶段不到4GB。小红书
更狠的是训练侧:同一账号的方案在一张RTX 3060 Ti 8GB上跑通了这款查表模型的训练,同一套方法训练Qwen3.8-27B在seq 512下只用了约2GB显存,基座是HuggingFace完整权重、没做4bit量化。小红书
DGX Spark(128GB统一内存、273GB/s带宽)博主的一周三模型接力,把新规则里的取舍拍得很清楚:27B、35B-A3B、176B总参的Flash-Next轮值当家,三任内存占用几乎一样(79~82GB),聪明度却差了一代;但176B旗舰不比35B快,速度被273GB/s带宽焊死,“大的只是更聪明”。小红书多人并发是只激活3B的MoE赢,写代码反而是最老的稠密27B最快——投机解码开满能到57~68t/s。社区把这一节总结成一句选型铁律:速度、聪明度、并发,三样最多握两样。

学费也在:35B-A3B四天跑了147万token"快是真快",摸球概率题却翻车卸任;小红书Flash-Next从"无思考"切到medium档,同一台Mac Studio跑完九项8817题,正确数从7132涨到8064,整轮总耗时却从约2小时58分涨到12小时46分。哔哩哔哩聪明和快之间的权衡没消失,只是标了新价。
三、快不快看带宽和调度,稳不稳看生态
新账本里,"买什么卡"是最不重要的变量。B站有人对27B解码做220W到280W四档功耗对比:220W仍能达到约52.3token/s,峰值温度从95℃压到83℃——功耗拉满不等于更快。哔哩哔哩微博博主"斌叔OKmath"租了一台RTX 6000,用基准线、MTP、DFlash、DFlash2四种方式跑同一份Qwen3.8-27B,结论是投机解码最高提速4倍。微博Mac阵营同样热闹:Mac Studio统一内存配oMLX部署27B,实测50+Tokens/s。哔哩哔哩
A卡阵营是两种情绪的混合体:RX 9070 XT复测新出的GSQ量化,五维质量全面反超此前社区定案的UD-IQ3_S,原作者声称的"中文能力严重受损"没有被复现。哔哩哔哩而折腾16G的A卡玩家已经晒出最佳实践:UD-IQ3_S权重14.5GB上下,128K上下文稳定40+ token/s,全程离线数据不出本机。小红书
但另一边的坑也真实存在:ROCm 10在Strix Halo(gfx1151)上性能不升反降,PyTorch+ROCm生图后CPU占用100%的老bug也还有人踩。AMD官方笔记的评论区里64个人排队等教程,"想看qwen3.8教程,最近一直在找"是最典型的一句。小红书A卡用户的瓶颈从来不是硬件,是环境和文档。

四、对号入座:2026年9月社区显存账本
把散在各平台的实测拼成一张表(均为社区自测口径,"能不能忍"因人而异):
你的显存 | 社区正在怎么玩 | 一句话点评 |
|---|---|---|
8GB | Flash-Next式查表模型、9B蒸馏;训练党已在跑通125B的"穷鬼版" | 想要27B的聪明就别硬撑,先看架构红利 |
12GB | IQ2量化27B,32K上下文60t/s(单一实测) | 极限配置能用,代价是精度和折腾 |
16GB | UD-IQ3_S约14.5GB权重,128K上下文40+ tok/s;20档横评的舒适区 | 游戏+AI双修,这代真该买16G不买8G |
24GB | W4A16求稳、EXL3顶上下文;要vision+长文本同时开选前者 | 主力的位置 |
32GB+ | 该实测团队原话:“量化hack不存在”——NVFP4/FP8满血用 | 有这卡你不需要这张表 |
48GB | 有社区结论:FP8对比Q4感知提升有限,又没有合适的中间大模型 | 钱要花在跳档,不是刚好够上 |
72~96GB | Flash 180B分块量化约68~88GB,“模型装得进去,上下文就基本不占地方” | 上下文终于不缺,带宽开始排队 |
128GB(DGX Spark/Strix Halo) | 三种架构随便换着测 | 统一内存解决容量,不解决速度 |
48G的尴尬,那张流传很广的分档表说得很直白:FP8对比FP4和Q4其实没啥提升。微博16G档位跑通40+ tok/s的那位,晒出的整机配置就是一张R9 9600X配16G RX 9070的清单——量不大,全是白捡的性能。

五、涨价周期,换卡前先回答三个问题
这轮行情的底色是"按显存收钱":知乎第36周硬件价格周报里,英伟达显卡整体小幅上涨、RTX5090大幅上涨。知乎微博上有人晒出涨价通知,5080单卡一个月内站上13000+,等等党"一败涂地"。微博
连小主机都不放过:8月25日有人晒两台刚到货的DGX Spark,隔天每台涨了五百五。微博36氪9月2日仍在讨论那个问题:算力普涨,到此为止?36氪硬件越贵,挤压旧卡的工程手段就越值钱。所以下单前,按顺序过三关:
你缺的是容量还是速度?如果t/s已经够、只是上下文想再长,先换引擎和量化格式,别换卡——权重和KV的零和游戏里,你还有牌可打。
配置极限摸到了吗?KV池有没有被权重挤死、prefix cache开没开、思考档位值不值、功耗墙锁到哪一档——Spark博主那十条调参心得,每一条都是免费性能。
你是不是"长上下文+并发+多模态"三项全要?三项全要才轮到升级或租算力。买卡前先去租卡测你的真实工作负载——那位得出4倍提速结论的博主,用的就是租来的RTX 6000,这比对参数表下单靠谱得多。
接下来值得盯的信号:ROCm 10对Strix Halo的修复进度,决定A卡用户的2026下半年顺不顺;"参数放硬盘"的查表架构会不会成为开源标配——越来越多模型把参数挪出显存的那天,消费级高显存卡的溢价逻辑就要被重估,到时候再谈买不买,比现在追涨冷静。
你那张卡,到底能跑什么?
这个9月本地大模型最大的变化,不是模型又变强了,而是"能跑"第一次没有统一答案:8G能进训练场,12G能喂饱32K,27B塞得进24G、16G忍得下Q3——你的答案取决于愿意用多少精度、多少折腾,换多少容量。评论区报个配置:卡、模型、量化档、t/s,这本实测账,值钱的正是它还在每天被改写。