8G 显存跑本地大模型,到底行不行?
上一篇聊了为啥在这波涨价潮里转身收台二手 ROG。涨价潮里,我转身收了台二手 ROG:一个财务视角的算账这篇讲买回来之后的事。

这台 RTX 2070 8G 显存的机器,跑本地大模型到底什么水平。 下面全是跑了几个月的真实数据,不编。这两年 AI 话题火得不行,身边人都在问你用没用上。我也用,不过跟大多数人不太一样,我的 AI 跑在一台两千七收来的二手游戏本上,数据一个字节都没出过家门。
不是赶时髦。这十年做投资、管财务,攒下的东西全在 Obsidian 里:行业研究框架、项目尽调笔记、读书摘录、调仓思路、对人对事的判断。日积月累一千多条笔记,三四十万字。量一大就出事,想找个东西明明记得写过,翻半天就是翻不到。
Obsidian 自带的搜索是关键词匹配。你搜「量子计算」,它只给你笔记里带这四个字的页面。可我很多笔记聊的是量子赛道,全文一个「量子计算」都没写。比如写 IonQ 的财报分析,讲它的离子阱路线为什么不适合通用计算,整篇都在讲这事,关键词搜索在这种地方基本是瞎的。
后来翻社区插件,撞见一个叫 Copilot 的,把我这块的用法彻底改了。
说实话,模型反而不是重点,Copilot 才是。用大白话说,它把你的所有笔记做成向量索引存到本地,然后你打一句人话问它,它从几千条笔记里把最相关的几段揪出来,喂给本地的大模型,模型帮你总结回答。全程数据不出硬盘。
为什么 Copilot 才是核心
把笔记丢给 ChatGPT 让它总结,跟用 Copilot 管整个库,完全两码事。
前者是单篇处理。我需要的是跨所有笔记的语义检索,比如「我过去三年对量子计算行业的判断变过几次,每次为什么变」。这种问题不是翻某一篇能回答的,它得搜遍整个知识库,找到前后相关的几十条记录,交叉比对出结论。
Copilot 干的就是这个。装好之后它对整个 vault 做一次全量索引,把每篇笔记切成段落,每段生成一个向量,也就是一串代表这段语义特征的数字,存进本地向量数据库。以后你问任何问题,它先把你的问题也转成向量,在数据库里找语义最相近的段落,拉出来当上下文喂给模型。
整条链路都在本地:文本向量化走本地嵌入模型,不用显卡,CPU 就够;向量检索走本地数据库;最后的大模型推理走你本机的 LM Studio。从头到尾没一个字节离开这台机器。
Copilot 怎么装、怎么配

安装零门槛。打开 Obsidian,设置,第三方插件,社区插件市场,搜 Copilot,装了启用,一分钟。
关键是配置。Copilot 支持两种后端,一种直连 OpenAI 云端,一种接你本机的 OpenAI 兼容服务。我选后者,也就是本机跑的 LM Studio。
进 Copilot 设置,填三个东西。
第一,聊天模型。API 地址填 http://127.0.0.1:1234/v1,这是 LM Studio 在本机开的本地服务地址,模型名填 gemma-4-e4b-it。API key 随便填个非空字符串,LM Studio 不校验这个。
第二,嵌入模型。Copilot 做向量检索要用一个小型嵌入模型把文本转成向量,跟聊天模型分开。推荐 nomic-embed-text 或者 bge-small-zh-v1.5,都是开源、轻量、本地跑、不用显卡,CPU 处理几千条笔记也就建索引时慢点。同样填 LM Studio 的地址,API key 随意。
第三,向量数据库。Copilot 默认用本地文件存储向量,不用额外装数据库,索引文件就在你的 vault 里,全在硬盘上。

配好点 Refresh Index,它扫描 vault 里所有 Markdown 文件建索引。一千条笔记、三四十万字,CPU 建索引大概十到二十分钟。跑完就行,之后日常新增或修改笔记,Copilot 自动增量更新。
实际用起来什么体感
Copilot 有两种模式,定位不同。
Vault QA 模式,这是主力。你输一句大白话问题,它检索全部笔记,拉出最相关的三五段当参考,交给本地大模型,几秒出一段回答。回答下面还会列出它引用了哪几篇笔记,点一下就能跳过去看原文。
举个例子,「我过去对 AI 芯片的判断经历了哪些变化」。这个问题关键词搜不出来,你笔记里可能写的是 H100、寒武纪、昇腾、CUDA 护城河,没一句直接带「AI 芯片判断」。但 Copilot 的语义搜索能找到这些散在各处的片段,模型读完帮你串成一条线:2022 年你主要关注算力缺口,2023 年开始质疑国产替代路径,2024 年下半年转向软件栈生态。它列出来的每句结论后面都挂着原始笔记的引用,你可以点进去核实自己当时是不是真这么写的。
再比如「2024 年一季度在管资金回撤最大的三个标的,我当时怎么分析的」。这个问题要同时搜到调仓记录、投后复盘、市场分析几类笔记,再做跨时间线比对。Copilot 把相关段落全捞出来,模型读完后告诉你哪三个标的、当时回撤多少、你的应对策略。没有语义检索,这类需求根本没法用关键词搜出来。
Chat 模式就是常规对话,类似 ChatGPT。区别是你可以手动把某篇笔记喂给它当上下文,让它基于那篇内容回答、改写、总结。我用这个模式比 Vault QA 少,但做单篇深入加工的时候顺手。
两种模式都走本地的 LM Studio 后端,没有任何请求发到外网。Obsidian 里写笔记,随手切到 Copilot 问一句,点结果跳回原文核实,整个工作流不打断、不出软件,跟用云端一样顺,但数据全在本地。
这套方案真正有用的地方在这:不是「能跑本地模型」本身,而是本地模型能反过来管你自己的知识库。GPT 再聪明也没见过你的笔记。Copilot 加本地模型,单论智力确实差一档,但对「你自己」的理解,GPT 永远给不了。
Copilot 搭好了,嵌入模型跑通了,向量索引建好了。万事俱备,只差一个能接住 Copilot 问答的大模型。接下来就是一台一台试,试到最后只剩一个。
前阵子两千七收了台二手 ROG 枪神3,i7-9750H、RTX 2070 8G、32G 内存。这台机器上一篇文章聊过选机和验机,我这种爱折腾的垃圾佬,两千七的机器照样想玩出花。这篇讲买回来之后的事,怎么从四个模型里筛出唯一一个留下来。

第一轮:Qwen3.5-9B,能跑,但卡

第一个试的是阿里的 Qwen3.5-9B,九亿参数。Q4_K_M 量化后约 5.5G,中文底子公认好,社区口碑也不错。我想法简单,9B 不大不小,量化后 5.5G,8G 显存应该绰绰有余。
但我算漏了一样东西,上下文窗口。
Copilot 做 Vault QA,要先把捞出来的相关笔记段落塞进模型当上下文,再提问。我笔记三四十万字,一次检索捞出来的相关段落动辄几千字,有时上万字。模型必须吞下这么多文字,还得留出空间回答问题。实测下来 64K 上下文是硬门槛,小了的话 Copilot 塞完检索结果就满了,回答直接被截断。
64K 上下文的 KV 缓存大概吃掉 1G 显存。5.5G 模型加 1G 缓存,再加系统保留和计算缓冲,8G 见底。刚好塞下,一点余量没有。
更麻烦的是显存。为了让 64K 能跑起来,我在 LM Studio 里把 GPU 卸载层数调到 18(总共 36 层),剩下 18 层走内存。预填,也就是喂一大段文本进去,能跑到每秒 360 token,不算慢。但逐字生成的时候,每吐一个字都要在 GPU 和内存之间来回倒数据,被内存带宽卡死,每秒只有 3-4 个 token。
3-4 个 token 什么概念。一个中文字大概占 1.5 到 2 个 token,也就是每秒吐两三个汉字。你问 Copilot 一个问题,它检索完、喂完上下文,然后开始一个字一个字往外蹦。等它打完三五行回答,够你起身倒杯水、喝完回来、顺手瞟一眼手机。
能用。丢给它做那种不盯着屏幕等的大批量活,比如让模型通读几百条笔记、慢慢给你理出主题脉络,跑一晚上也无所谓。但 Copilot 是交互式的,你问一句想马上看到答案,然后追问、再追问。等十几秒才蹦出一行字,体感太差了。
第一轮下来,Qwen9B 算是能跑,但我心里清楚它只是个过渡。
第二轮:GLM-4.7-Flash,参数大了一圈,速度只快一点点

智谱的 GLM-4.7-Flash 是 MoE 架构,三千亿总参数,每次推理实际只激活约四十七亿。MoE 的好处是总容量大、能力上限高,实际计算量却只相当于一个 5B 左右的模型,听起来很理想。
但 RTX 2070 8G 上 LM Studio 默认走 CUDA,那会儿 CUDA 后端对 MoE 支持还不完整,只能切 Vulkan 后端。Vulkan 下显存管理更吃紧,试过把 12 个 MoE 专家层留 GPU,直接爆显存。最后只能把所有 46 个专家层全卸到内存,只留基础推理层在显卡上。
结果每秒约 8 个 token,比 Qwen9B 的 3-4 翻了一倍,但依然不流畅。而且 Vulkan 后端下最多开到 64K 上下文,128K 就 OOM,等于上限被锁死。
速度体感上,等个七八秒出一行。你说慢吧,比 Qwen9B 强不少;你说快吧,离即问即答还差得远。加上 Vulkan 偶尔崩、MoE 加载慢,要三四十秒,日常开着它跟 Copilot 对话,总觉得隔了一层。
GLM 也留着了,可还是没到我要的感觉。
第三轮:Qwen3.5-35B,能加载,但只是能加载

到了这一步,我已经试了两台,心里大概有数:8G 的瓶颈不是模型智力,是速度。于是干脆任性一把,把三十五亿参数的 Qwen3.5-35B-A3B 塞进去。
这个模型架构特别,40 层里只有 10 层是全注意力,另外 30 层是线性注意力(DeltaNet),还有 256 个 MoE 专家。线性注意力几乎不占 KV 缓存,所以 128K 上下文只需要约 0.75G,听起来很美。
但模型本身 Q4 量化后约 20G,两倍半于显存。我在 LM Studio 里把 32 个 MoE 专家层卸到内存,只留 8 层在 GPU。显存压到 7G 出头,留一截缓冲。128K 上下文,加载成功,HTTP 返回 200。
然后开始打字。一个字。一个字。地。蹦。
慢到你看它打出完整一行话的时间够你泡一杯茶。不是体感慢,是你根本不想用它。
这一轮的价值不是能用,是验证了一个结论:在 8G 上,所有超过 10B 的模型都会被内存带宽杀死。显存卸载只是理论可行,实践上超过一定参数量的模型就不是给人交互用的。
三轮跑完,三个模型都还躺在 LM Studio 的模型列表里,可没一个能当日常主力。Qwen9B 慢得看不下去,GLM 快了点但不够,35B 干脆没法交互。我要的,是能整台塞进 GPU、不折腾卸载、还能接住 Copilot 问答的模型。
第四轮:Gemma4 E4B,全在显卡里跑,终于不卡了

Google 的 Gemma4 E4B,四亿参数。一开始我根本没把它当候选,参数太小了,四亿能干啥。但仔细看了下配置,Q4_K_M 量化后不到 3G 显存,加上 64K 上下文的 KV 缓存 fp16 约 2-3G,全在 8G 里跑,一层都不用卸。
启动配置只有一条跟别人不一样,必须关掉 Flash Attention(LM Studio 高级设置里那个开关)。Gemma4 在 LM Studio 上开了 Flash Attention 就会崩,算是它唯一的怪癖。另外把思考模式关掉,让它直接给答案,别先来一段内心独白,Copilot 要的是干净回答。
测出来的速度,生成(逐字输出)每秒约 44 个 token,预填(吃进上下文)约 11-12 个 token。换算一下,生成时每秒大概二三十个汉字。跟云端大模型比差距不小,但在本地、8G 显存、全 GPU 跑这个前提下,已经碾压前面三台了。

关键是体感。你在 Copilot 里问一句,两三秒开始出字,五六秒出完一整段。不快,但跟 GPT 的体验差距已经缩小到能忍。追问也不卡,生成速度够你读完上一行、目光移到下一行它正好打完。对话不中断,思维不被打断。
试了下 Copilot 的 Vault QA,搜了三万字的量子计算相关笔记,喂了约八千字上下文给 Gemma4,让它总结我的判断框架演变。十几秒出结果,逐条列结论,每条后面挂着原文引用。跟 GPT-4 的差距当然有,它的分析深度和逻辑链不如大模型,三四条结论之后就开始重复。但作为一个能搜遍你全部笔记、告诉你过去三年在这个话题上写过什么的工具,够用了。

第一台 Qwen9B,第二轮 GLM,第三轮 35B,全都在 LM Studio 里留着,但日常已经不再调用。现在本机就开着 LM Studio,里面跑着 Gemma4,端口 1234,挂在 Copilot 后面。一千多条笔记、三四十万字的 Obsidian 知识库,一个四亿参数的小模型加 Copilot 的向量检索,覆盖了我 90% 的知识库使用场景。剩下那 10% 确实需要更强推理,但说实话,那已经不是知识库检索该干的事了。

四轮淘汰下来,结论比最开始预想的简单:8G 显存的物理边界摆在那,别跟它较劲。参数越大越慢,能全塞进显卡的小模型反而最舒服。
最后一算:这笔账值不值
回到老本行。我是个做财务的,一切归结到算账。
投入,二手枪神3,两千七。全部模型开源,零软件成本。电费一个月多二三十,可忽略。
对比云端 API,这笔账得拆开算,因为各家价格差出一个数量级。
我按自己的真实用法估,每天大概十次知识库检索问答,每次往上下文里塞几千字召回的笔记、输出一段总结,一个月下来输入约一千八百万 token、输出两百多万。知识库检索是长输入、短输出,成本大头在输入,这点跟聊天不一样。

最便宜的是国内模型。DeepSeek V4-Flash、豆包这类,输入命中缓存后单价极低,一个月十块出头;通义千问的 flash 档也就三四十。这个档位,纯算钱比本地方案还便宜。再往下还有一批永久免费的模型,但各有各的限速,列清楚免得踩坑:智谱的 GLM-4-Flash、GLM-4.7-Flash 不限量调用,但限 30 并发;硅基流动 9B 以下小模型,Qwen2.5-7B、GLM-4-9B 这些,永久免费,可基础账号只给 5 QPS、每分钟 10 万 token;百度 ERNIE-Speed 永久免费还给到 50 QPS,算最慷慨;腾讯混元 Lite 永久免费、还带 256K 超长上下文;讯飞星火 Spark Lite 也是永久免费,但只给 2 QPS,适合轻量跑;字节火山引擎的 Doubao-Lite 每天白送 200 万 token、2 QPS。额度看着大,真高并发照样被限流,零成本尝鲜足够,想当主力用得想清楚。
但对数据敏感的我,白嫖归白嫖,隐私账另算。这些免费模型一样把你的笔记传到了别人的服务器上。这也是我没走云端、转投本地的根。
要是追求更强的检索质量,多数人会上 Claude Sonnet、GPT-5 这个中端档。按 2026 年 8 月公开价,美元每百万 token 约合人民币,Sonnet 输入十四块、输出七十二块,GPT-5 也在一个量级,我这种用量一个月三百五到四百五。而且 Sonnet 9 月 1 号起还要涨到二十一、一百零八,直接奔六百去。再往上旗舰档,Opus、GPT-5.6 Sol,一个月上千。

不过这些国外档,我不推荐普通用户走。OpenAI、Claude、Gemini 的接口都走海外节点,国内直连基本连不上、得挂代理,高峰期动不动断连,调用稳定性没法保证;而且数据不仅出本机、还出了境。算下来既贵又折腾。除非你本来就在用、且能接受这些代价,否则不如要么选上面那些国内档,要么就跟我一样本地化。
算总账,机器两千七,软件零成本,电费忽略。一次性投入就这两千七,摊三年一个月七十五,用得越多越趋近于零边际成本。云端中端档每月三四百到六百,用得越狠越贵,这才是七到九个月回本成立的前提,前提是你在云端本来就会花这个钱。
更重要的是,数据不出本机。这个价值没法市场化,但对我这种把投资判断、行业推演都攒在 Obsidian 里的人是刚需。国内便宜档、甚至免费档虽然更省,但代价是数据出本机,这笔账每个人得自己称。
当然,这个账有个前提你得接受,愿意折腾。装引擎、试参数、调卸载、踩坑,每一步都有门槛,不是双击两下就能用的。
适合谁、不适合谁,我心里有数。你有数据隐私刚需、有稳定使用频率、愿意花一个周末搞定环境,8G 入门绰绰有余。你就想试试、偶尔玩玩、受不了装环境的折腾,直接买云端 API,省心省钱。
8G 的真正价值不是爽跑所有模型,那是 24G 才干的事。它的价值是让你用最低成本验证自己到底需不需要本地 AI。跑通了、确认是刚需,再考虑往上换。跑不通、发现其实不需要,两千七的学费也不算贵。
这台两千七的机器加一堆免费开源模型,换一条完全属于你自己的 AI 管线,不依赖任何云端服务,数据一个字节都没离开硬盘。
这笔实验费,我觉得值。8G 显存跑不了所有模型,但把我这套知识库跑通了,又不是不能用。往后真要升级,二手市场淘块 12G 或 16G 的卡,也不贵。但那是另一篇文章了。章了。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

值友9448553763
校验提示文案
值友9448553763
校验提示文案