这周折腾党的群里,热闹得有点不像同一个圈。有人转9月4日刚发布的 Unsloth 桌面版,官方文档口径是 QLoRA 四比特下训练 7B 模型仅需 5GB 显存。有人甩出一张"8G 到 32G 显存表",博主晒的是自己折腾的战绩:一个月下来,API 账单直接归零。还有人在刷二手 3090 的行情——8 月底刚看完"绝对金额损失创纪录"的暴跌标题,9 月初这张卡又出现在"涨价周期硬通货"的名单里。今日头条微信今日头条
再加一条背景:9 月第一周,Anthropic、Meta、Google、OpenAI 连着各发了新模型,据外媒报道,CNBC 在 9 月 6 日给这事起了个名字,叫"模型疲劳"(model fatigue)——用户的反应不再是兴奋,而是"那我这个月还得交多少"。微信
三件事拼到一起,就是这个 9 月数码折腾党最真实的问题:云端的钱越交越肉疼,本地的大模型,到底能不能搬?
能搬的人确实存在,但先把三笔账算完:容量账、成本账、质量账。少算一笔,你的本地大模型体验就会从生产力变成 PPT。

第一笔账:容量账——显存是墙,不是坡
本地部署教程最大的误导,就是"8G 显存能跑 7B"。能跑吗?能。一位跑了两个月实测的知乎博主给的是体感数字:8G 显存跑 7B 量化版,生成速度大概每秒 5-8 个 token,比人打字还慢;12G 跑 14B 勉强 10-15 tok/s,上下文一长就爆;24G 跑 32B 才到每秒 20-30 个,"能跟上人"是从这一档开始的。知乎
正确的算法不是"参数量×量化"一项,而是三项:模型权重 + KV Cache + 运行时开销。权重大小先看这张流传版显存表(Ollama 官方库 Qwen3 系列 2026 年 8 月的标签页数据):4B 约 2.6GB、8B 约 5.2GB、14B 约 9.3GB、32B 约 20GB——全是 Q4_K_M 量化档。这里有个反常识点:不带后缀的默认 tag 本身就是 q4_K_M 构建版,你 `ollama run qwen3:8b` 拉到的就是量化版,不用再"自找轻量版"。微信

真正没人提醒你的是 KV Cache:模型"说话"要占地方,4K 上下文可能只要 1GB,128K 长上下文能吃掉几十 GB。有人按参数买卡、跑起来提示显存不足,不是模型太大,是你让它记的东西太多。一个能背的公式是:Gemma 4 12B 这种小模型,INT4+4K 只要 6.1GB,但 INT8+128K 就要 20.4GB——同一张卡,上下文档位不同,完全不是一个占用。微信
还有一项静默惩罚:装不下时 Ollama 和 llama.cpp 不报错,会把放不下的层悄悄挪进内存,速度掉 5 到 20 倍、中值约 10 倍。你以为卡在加载,其实它在用 PCIe 总线搬数据。微信
把各档位串起来(流传显存表 + 两个月实测 + 统一内存方案):
档位 | 代表硬件 | 能跑什么 | 定位 |
|---|---|---|---|
6-8G | RTX 5050/5060、Arc A770 | 4B-8B,qwen3:8b 是甜点 | 尝鲜可以,别指望干活 |
12G | RTX 5070 | 14B 舒服,gpt-oss 20B 差一口气 | 差的就是那口显存 |
16G | 5070 Ti/5080、RX 9070 XT | gpt-oss:20b 进显存 | 真正的分水岭 |
24G | 二手3090 / 4090 | 27B-32B 全进,社区实测 27B Q4 约 35-50 tok/s | 本地模型"不像玩具"的起点 |
32G | 5090 | 32B 带长上下文余量 | 余量买的是从容 |
128GB 统一内存 | 锐龙 AI Max+ 395 类迷你主机 | 装得下 70B(约 4.4 tok/s)、GPT-OSS 120B 这类 MoE(约 44 tok/s) | 用容量换速度,不是 5090 平替 |
一句话:16G 以下别碰 14B+,24G 是认真用 27B-32B 的地板。至于"本地跑 428B"这种事——MiniMax M3 开放权重时给过最低配置:138GB 内存,社区那句"这叫本地运行?"的吐槽,至今还是这条赛道的边界共识。今日头条
第二笔账:成本账——回本点不在显卡,在你每月的账单
折腾党转本地的动力根本不是情怀,是账单。今年的时间线相当密集:4 月,"AI 免费时代结束了?大模型集体涨价,有人周报账单从几毛涨到几十"的讨论刷屏。5 月有普通用户晒单,只是写文案、查资料、跑跑代码,本月消费已经飙到了 97.12 元。微信今日头条
6 月,Copilot 改成 token 计费,有开发者账单一夜从 29 美元跳到 750 美元。8 月,DeepSeek V4 正式调价,高峰期输出 27 块一百万 token。9 月,天猫上线 AI 充值中心,买 Token 像充话费。微信抖音今日头条
有个矛盾的说法你要看懂:三年多来 token 单价一路下探,甚至被算出便宜了 99.7%,但 Agent 开始替你动手干活,用量指数级涨,账单越用越贵——单价降价救不了你的月支出。今日头条
再看硬件这一头,同样魔幻。二手 3090 的价格曲线像过山车:2020 年 9 月发布时官方定价 1499 美元,约合人民币 11999 元,2021 年矿潮高峰期喊价一度逼近 2 万元,2022 年矿难跌到 600-800 美元,2026 年 6 月被"AI 圈最被低估的资产"热帖重新定价,8 月底又上了"暴跌"标题,9 月初重新出现在"二手高端卡硬通货"名单里。目前国内成交大致在 3800-5000 元区间。而新机市场是什么光景:RTX 50 系列显卡在欧洲市场六周内涨幅最高达 21%,其中 RTX 5060 Ti 16GB 单月飙升 21%,成都渠道 RTX 5090 报价 14839 元起,更早流传的那张"官方建议价 vs 你实际要付的"对比图里,5090 的溢价标到了 135%。一张二手 4090 的回收价则至今坚挺在 1 万到 1.2 万——AI 数据中心抢货,把整条消费级供应链都点了。今日头条今日头条微信

整机成本模型(按 8 月自媒体给过的配置单口径):R5 9600X 散片约 1100 元 + 二手 3090(3800-5000)+ 64GB 内存(涨价行情下 DDR5 32G 单条已近千元)+ 1000W 以上电源 + 2TB 固态,整机 9500-10000 元。注意两个被教程忽略的隐形成本:32GB 内存几乎必然触发 Swap 交换、速度暴跌,64GB 是生存线,不是推荐配置;3090 瞬时功率尖峰 450-550W,850W 电源会在长跑推理时触发保护重启。电费方面,350W 满载 7×24 挂一个月约 250 度电,轻载按社区帖子的说法"每月电费 10 美元以内"。今日头条
那回本点在哪?做个简单算术:整机 1 万元,两年回本要求每月省 420 元,一年回本要求每月省 850 元。海外那套流行算法是:每月 AI 工具开销在 200 到 440 美元之间,一张约 700 美元的 3090,理论上 3 个多月到 14 周就能回本。但这是建立在重度订阅消耗上的,直接套到国内月账单几十块的用户头上就是耍流氓。所以人群众分:微信
月账单四位数的 Agent/短剧/编程重度用户:回本逻辑成立,这是这波折腾潮真正的主力,本地跑执行、云端跑旗舰,是他们的标准架构;
月账单 400-1000 元的半重度:账能算平,但你是涨价周期里买二手卡,买在高位的风险自己扛——现在上车等于在"暴跌"和"硬通货"两个标题之间赌一个底;
月账单 200 元以内的轻度用户:任何计算器都会告诉你别折腾,你的"回本周期"以十年计;
数据敏感人群(合同、病历、客户资料不能出机器):不在账单逻辑里,三笔账变一笔账——该上就上,24G 起步。
128GB 统一内存迷你主机是第三条路:搭载 128GB 统一内存的迷你主机国行售价已经下探到一万三到两万元区间,安静、整机百瓦级功耗、7×24 挂机、装得下 70B。适合"要一台常开的本地知识库/后台 Agent"的人;但要知道,像"70B 的 Llama 模型 4.41 token/s"这样的漂亮数字出自带货向测评,和"替代显卡方案"的说法之间,还隔着 256GB/s 对 1TB/s 的带宽差。今日头条今日头条
第三笔账:质量账——上车之后你放弃什么
容量和成本都过关,还有最后一道硬门槛。同一个 9 月的实测冷水也很足:本地 7B 跑通用对话,回答质量跟旗舰云端差着十万八千里。更狠的一条是幻觉率:一位教育行业客户坚持私有化,结果模型幻觉率比云端高 30%,学生问个历史问题都能编出个假人物,最后只能换回 API;多模态在本地更是显存翻倍、效果不如云端。知乎
热帖那边呢?“700 美元 3090 跑 Qwen 3.6 27B,视觉任务 84.1 分、Claude 4.5 Opus 同项 77.0”——注意,数字出自社区帖子,没有第三方复测,当段子听可以,当采购依据不行。靠谱一点的是另一组:Qwen 3.6 27B 在 SWE-bench Verified 拿到 77.2%,Q4_K_M 量化文件约 16.8GB,配上 KV 缓存刚好塞进 3090 的 24GB 显存。微信微信
所以两个月吵下来,社区的共识其实收敛成了分工模式,而不是谁替代谁:写代码时由线上大模型来主导思考,本地大模型来主导执行。批量改文件名、整理笔记、私有文档摘要、长驻 Agent、断网可用、不该出内网的活,全搬本地;追最新模型能力的活,留在 API。那位月账单 97 块晒单的用户和月消耗几亿的 AI 短剧工作室,答案根本不是一套。抖音

Unsloth 这次降门槛,降的也不是"训练一个自己的 ChatGPT",而是风格迁移和行业话术这类微调——QLoRA 4bit 下 7B 只要 5GB、8B 只要 6GB、14B 只要 8.5GB,24G 的卡甚至能碰 27B(约 22GB)。但同一批实测也提醒:真要上来就要微调的人里,90% 的业务其实用 RAG 就能解决。今日头条知乎
真要上生产并发,从 Ollama 迁 vLLM 的环境门槛(Docker、CUDA、PagedAttention)还在那摆着——同样硬件,有人把并发从 2 路提到 8 路、延迟还降了 40%,但这份收益是给会折腾的人准备的。知乎
上车判断、避坑清单和继续盯的信号
想上车的,三个问题全"是"再动钱包:月账单够不够 400+、或者数据必须不出机器?手上有没有 16G 以上、最好 24G 的显存(或者愿意为它花这个钱)?接不接受"质量降一档、速度达标、二手水深"的现实?
反过来,8G 旧卡想跑 32B 的、指望本地替代旗舰追新的、想用省订阅的钱硬凑 5090 的,这轮热潮跟你没关系。真要上手的建议是那句老话:云端能用就别折腾本地,数据隐私、离线环境、Token 成本,三条占了一条再谈下单。微信
真要收 3090,按行情稿里"内行验卡三件事"来:一看出厂日期,2021 到 2022 年出厂的卡矿潮存量大、价格低于行情一大截的必问来路;二跑 15 分钟烤机,核心温度超过 85 度、风扇异响或黑屏的都有暗伤;三测显存,出现报错单元的再便宜也别碰——修显存的钱够买半张卡。再补两条折腾党实测里反复出现的关键词:魔改 BIOS 和个人送保,比型号本身更值得问。今日头条

最后四个继续观察的信号,够你决定下一班车要不要上:
Unsloth 们的多模态 GGUF 和稀疏注意力适配进度——决定"装得下"之后"好不好用";
二手高端卡这波"硬通货"行情能撑多久,会不会复制 3080 从 1.5 万跌到两千多的剧本——想收卡的,你的成本端在剧烈波动。今日头条
中国开源模型的节奏:总参数做大、激活参数做小,MoE 每前进一步,"本地"的边界就往外挪一寸;
订阅平台的计费动作:Copilot 之后会不会有更多家改按 token 计费——每多一家,你的回本点就往左移一格。
评论区报个数:你每月 AI 账单多少、本地折腾到哪一步了?3090 到底上车还是站岗,咱们拿真账单说话。