16. 12G显存究竟能跑多大(35B)的模型?#4070ti #显卡 #大模型
手头的这款4070ti也算是一员老将了 三年前用来跑扩散模型画图的 12g显存稍微小了一点 但算力还是足够的,比5060还是强一点 现在用来专门接电视打游戏顺便跑跑大模型 那么今天实测了下,效果令人惊讶 得益于量化技术 12G显存也能跑35B大模型 更令人惊讶的是 12G 显存在comfyui下画图分辨率能开到2048 x 2048而不会报显存(见p4) 这在三年前想都不敢想 相同分辨率用时略快于3080
大模型测试思路:显存有限,要充分发挥12G 显存的最大威力 权重文件要选择11g, 11.5g已经是极限了 ,kv type开q4 进一步压缩kv缓存,极限情况下要开启 CPU 专家卸载 经过多次测试 表现最好的是qwen3.6 a3b 35b iq2m量化 模型权重文件11G 速度 卸载一个专家到 CPU 后 上下文能开到80K(不卸载,20K到40K也能随便开) 速度 100~140 tos/s (专家卸载后速度稍有影响 但不会太大 还能省显存) 已经初具生产力了 写代码等工作还没测是否能胜任 但是文字类工作不要求太准确的还是可以胜任的 调优后的参数完整命令参考
llama-server \
-m 模型路径 \
-np 1 \ 重要
--n-gpu-layers all \
--flash-attn enabled \
-b 128 \
-ub 64 \
--ctx-size 81920 \
--kv-offload \
--cache-type-k q4_0 \ # 重要
--cache-type-v q4_0 \ # 重要
--direct-io \
--fit off \
--threads 6 \
--threads-batch 6 \
--threads-http 2 \
--temperature 1 \
--top-p 0.95 \
--top-k 64 \
--port 8080 \
--host 0.0.0.0 \
--n-cpu-moe 1 \ 重要
其他的一些模型测试结果
0k上下文 kv类型 q8只能对话一轮 q4能对话多轮 token速度 110 q4才能用 必须卸载至少一个专家到CPU
-rwxrw-r-- 1 wx wx 11G May 1 13:53 /share/AI/LLM/mradermacher/gemma-4-26B-A4B-it-ultra-uncensored-heretic.i1-IQ3_XS.gguf
10k上下文 kv类型 q8只能对话一轮 q4能对话多轮 token速度 85 q4才能用 必须卸载至少二个专家到CPU 卸载到CPU严重拖慢速度
-rwxrw-r-- 1 wx wx 12G May 1 13:52 /share/AI/LLM/mradermacher/gemma-4-26B-A4B-it-ultra-uncensored-heretic.i1-IQ3_M.gguf
不卸载专家 kv类型q4 上下文能开到40K,速度 92~110 tos/s ,卸载一个专家上下文能开到80K,速度几乎没变化
-rwxrw-r-- 1 wx wx 11G May 1 13:50 /share/AI/LLM/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf
不卸载专家 kv类型q4 上下文能开到40K,速度 120~140 tos/s ,卸载一个专家上下文能开到80K,速度几乎没变化
-rwxrw-r-- 1 wx wx 11G May 1 14:23 /share/AI/LLM/unsloth/Qwen3.6-35B-A3B-UD-IQ2_M.gguf
上下文80K 至少卸载3个专家 速度 100~110 tos/s
-rwxrw-r-- 1 wx wx 12G May 1 14:22 /share/AI/LLM/unsloth/Qwen3.6-35B-A3B-UD-Q2_K_XL.gguf