RTX 3060 跑 35B 大模型,速度翻了 2 倍,只改了一行代码!
几个月前,我用 3000 块的老电脑(RTX 3060 12GB + R7 3700X + 32GB 内存)跑起了 35B 大模型,当时生成速度是 15 tok/s。
昨天,我重新跑了一轮测试。
同样的显卡、同样的 CPU、同样的 32GB 内存 —— 生成速度变成了 33 tok/s,翻了超过 2 倍。
更离谱的是:
量化从 Q2 升级到 Q4,智能水平肉眼可见地提升
上下文从 4K 拉到 64K,能一次性吃下整本技术文档
我没有换任何硬件
唯一改了一行代码。
这篇文章就来讲讲,这一行代码是什么,以及为什么 llama.cpp 的更新让老硬件直接"重生"。
一、先说结论:3000 块老电脑现在能跑多快
截屏2026-05-24 12.56.41.png指标 几个月前(旧版 llama.cpp) 现在(b9297 新版) 生成速度 ~15 tok/s ~36 tok/s 量化精度 Q2_K_M(有损严重) Q4_K_M(几乎无损) 上下文长度 4K 64K 显存占用 ~5GB ~7GB 模型体验 能用,但经常"胡言乱语" 流畅,质量接近 API
同样的 RTX 3060 12GB,速度翻了 2.2 倍,而且模型质量大幅提升。
二、硬件配置:3000 块的老电脑
RTX_3060_AI_Speed_Hack_page2.png这次测试的机器配置和几个月前完全一样:
项目 配置 CPU AMD Ryzen 7 3700X,8 核 16 线程 GPU NVIDIA RTX 3060 12GB 内存 32GB DDR4 系统 Windows 11 专业版 总花费 ~3000 元
这不是什么高端配置。R7 3700X 是 2019 年的 CPU,RTX 3060 12GB 是 2021 的显卡。
但正是这种"平民配置",最能说明 llama.cpp 优化的意义 —— 不是只有 4090 用户才能玩本地大模型。
三、那"一行代码"到底是什么?
RTX_3060_AI_Speed_Hack_page3.png答案是:--n-cpu-moe 32
就这一个参数。
什么是 MoE?
Qwen3.6-35B-A3B 采用的是 MoE(Mixture of Experts,混合专家)架构。
简单来说,模型内部有多个"专家模块",每个 token 只会激活其中一部分。35B 的总参数中,实际每次只用到约 3B-6B。
llama.cpp 新增的 --n-cpu-moe 参数,控制有多少 MoE 专家层放到 CPU 上计算。
为什么 32 是甜蜜点?
我做了完整的对比测试:
--n-cpu-moe 值 生成速度 说明 0 12.31 tok/s 全部放 GPU,反而最慢 16 19.29 tok/s 有提升,但不够 32 29.93 tok/s 最佳甜蜜点 64 27.37 tok/s 开始下降 128 26.16 tok/s 继续下降 999 24.92 tok/s 太保守,GPU 吃不饱
--n-cpu-moe 32 意味着:把 32 个 MoE 专家层留在 GPU 上做 CUDA 加速,其余的 offload 到 CPU。
这是一个微妙的平衡 —— GPU 负责它能高效处理的部分,CPU 负责剩下的。两者协同工作,比全部堆给 GPU 或全部丢给 CPU 都快得多。
如果你之前用的是旧版 llama.cpp,这个参数根本不存在。所以之前的速度瓶颈不是硬件不行,而是框架没做好调度。
四、完整的启动命令
RTX_3060_AI_Speed_Hack_page4.png@echo off
chcp 65001 >/dev/null
cd /d C:Users你的用户名llama-b9297-bin-win-cuda-13.1-x64
llama-server.exe ^
-m "D:Qwen3.6-35B-A3B-UD-Q4_K_M.gguf" ^
-ngl 99 ^
--n-cpu-moe 32 ^
--flash-attn on ^
--jinja ^
-c 65536 ^
-t 8 ^
-b 512 ^
-ub 128 ^
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
-np 1 ^
--cache-ram 0 ^
--host 127.0.0.1 ^
--port 8080
pause
几个关键参数解释:
-ngl 99:尽可能把可 offload 的层放到 GPU--n-cpu-moe 32:MoE 专家层调度,核心优化--flash-attn on:Flash Attention,降低长上下文压力-c 65536:64K 上下文--cache-type-k q4_0/--cache-type-v q4_0:KV cache 量化,64K 上下文能跑的关键-np 1:单并发,32GB 内存够用--cache-ram 0:关闭 prompt cache,省内存
五、不同显卡怎么选?
RTX_3060_AI_Speed_Hack_page5.png我知道很多人看到"35B"就觉得自己跑不了。其实不是这样。
你的硬件 能不能跑 35B MoE 建议 RTX 3060 12GB / 3080 10GB ✅ 完全可以 直接用上面的参数,--n-cpu-moe 32 RTX 3070 8GB / 4060 8GB ✅ 可以跑 需要加大 --n-cpu-moe 值(如 128 或 256),把更多 MoE 层放 CPU,速度会比 12GB 卡慢一些,但 Q4 模型完全可用 RTX 3050 6GB / 1650 4GB ✅ 勉强可以 --n-cpu-moe 设 256 或更高,大量依赖 CPU 计算,速度不会很快,但能体验 Q4 质量 Mac(M1/M2/M3) ✅ 可以跑 用 Metal 后端,统一内存架构对大模型更友好
核心思路是:MoE 模型 + --n-cpu-moe 参数 = 显存不够就用 CPU 补。
以前没有 MoE offload 机制,8GB 显存确实很难跑 35B。但现在框架支持了 CPU offload,8GB 显卡也能跑,只是需要调整参数让 CPU 多承担一些计算。
六、为什么速度能翻 2 倍?不只是因为一个参数
RTX_3060_AI_Speed_Hack_page6.png--n-cpu-moe 32 是最关键的一行,但 llama.cpp b9297 还带来了一系列优化:
1. Flash Attention 正式支持
旧版没有 Flash Attention,长上下文的注意力计算是 O(n²) 的。新版开启后,64K 上下文的内存占用和计算开销大幅下降。
2. KV Cache 量化
--cache-type-k q4_0 和 --cache-type-v q4_0 把 KV cache 从 fp16 压缩到 q4_0。64K 上下文下,光 KV cache 就能省好几 GB 显存。
3. CUDA kernel 优化
b9297 对 CUDA 后端做了大量底层优化,尤其是 MoE 路由和 GPU-CPU 数据同步。这不是调参数能解决的,是框架层面的进步。
4. 可以从 Q2 升级到 Q4
几个月前为了跑起来,我只能用 Q2 量化(压缩率极高,但智能损失明显)。现在同样的硬件可以跑 Q4 —— 量化精度提升了整整一个等级。
Q2 和 Q4 的差距不是"好一点",而是"能用"和"好用"的差距。Q2 经常会出现逻辑断裂、重复回答、事实错误等问题。Q4 则几乎和 FP16 原模型体验一致。
七、32GB 内存够不够?

够,但不宽裕。
实测数据:
llama 进程工作集:约 20.8GB
系统剩余内存:约 5-6GB
建议:
单人单任务:32GB 完全够用
想长时间开服务:建议上 64GB
多并发或多用户:64GB 起步
跑的时候别开重型后台软件、大量浏览器标签、网盘同步
八、怎么下载和安装?
RTX_3060_AI_Speed_Hack_page8.png1. 下载 llama.cpp
打开官方 release 页面:
https://github.com/ggml-org/llama.cpp/releases
找到 b9297(或更新版本),下载两个文件:
llama-b9297-bin-win-cuda-13.1-x64.zip
cudart-llama-bin-win-cuda-13.1-x64.zip
注意:两个 zip 要解压到同一个目录。
2. 下载模型
Qwen3.6-35B-A3B-UD-Q4_K_M.gguf 可以从 HuggingFace 或 ModelScope 下载。
3. 验证 CUDA 是否正常
llama-bench.exe --help
看到 loaded CUDA backend 就说明没问题。
九、常见问题
RTX_3060_AI_Speed_Hack_page9.pngQ:我的速度只有十几 tok/s?
检查 --n-cpu-moe 的值。如果设的是 0,改成 32 试试。Q4 模型在 RTX 3060 上,--n-cpu-moe 0 反而最慢。
Q:启动报 CUDA 后端找不到?
确认两个 zip 是否解压到同一个目录,里面应该有 ggml-cuda.dll、cublas64_13.dll 等文件。
Q:内存占用太高?
加 -np 1(单并发)和 --cache-ram 0(关 prompt cache)。
Q:64K 还能更大吗?
模型训练上下文是 262K,但 32GB 内存不建议上 128K。64K 是当前更稳的平衡点。
Q:中文乱码?
批处理开头加 chcp 65001 >nul。
十、别再被 4090 吓退了
RTX_3060_AI_Speed_Hack_page10.png几个月前,我也觉得本地跑 35B 得有 24GB 显存、得买 4090。
现在回头看,那完全是被"信息差"吓住了。
RTX 3060 12GB:33 tok/s,Q4 质量,64K 上下文
8GB 显卡:调大
--n-cpu-moe,也能跑Mac:统一内存架构天然适合大模型
真正的门槛不是硬件,而是你知道怎么调参数。
RTX_3060_AI_Speed_Hack_page11.pngllama.cpp 的更新让老硬件不断"重生"。b9297 不是终点,后续还会有更多优化。今天 33 tok/s,明天可能就到 40+。
3000 块的老电脑,完全值得再战一年。
RTX_3060_AI_Speed_Hack_page12.png如果你也在用老硬件跑本地大模型,欢迎在评论区分享你的配置和速度。让我们一起打破"必须 4090"的信息差。
关注「玩客笔记」,带你用最野的路子,玩最硬核的AI。
如果觉得这篇文章对你有帮助,欢迎收藏转发,让更多开发者用上 AI 编程工具。

lghi
校验提示文案
hdzyk
校验提示文案
hdzyk
校验提示文案
lghi
校验提示文案