8月17日 DeepSeek 新价格生效后,"本地跑代码模型"明显热了起来。但翻一圈教程会发现,大部分内容教的第一条命令,还是一个三年前的模型:CodeLlama。这篇把话说透——它现在还适合谁,谁应该绕道。
一、本周背景:为什么突然有人要本地跑模型
8月17日零点,DeepSeek 新价格正式生效:V4-Pro 高峰时段输出从每百万 token 6元涨到 27元,缓存命中输入从 0.025元涨到 0.3元,最高涨幅被算出超过 1100%。知乎知乎六天后改为周末全天按最低价计费,但焦虑已经扩散。知乎
有开发者拿真实账单逐小时测算:同样用法,新价格生效后成本约是原来的 4 倍。知乎本周知乎热度最高的两个相关问题,一个是"怎么看 DeepSeek 8月22日再调整定价"(940 赞),一个是"OpenCode 找了很多供应商,都找不到涨价前原厂的价格"(39万浏览)。知乎知乎这波人下一步的动作,就是搜"本地编程"“离线代码补全”——而他们撞见的第一批教程,大量在教同一条命令:`ollama pull codellama`。

二、先给判断:能跑,但不再是默认选项
CodeLlama 还能用,这是真的:Ollama 官方库里一条命令就能拉,34b-code 文件大约 19GB。知乎最低 6GB 显存,RTX 4090 上 34B 版本能跑约每秒 45 个 token。2026年7月的《30款 AI 编程工具深度对比》里,它仍被列为适配"数据保密级别要求严苛的涉密项目"的代表产品。知乎甚至 OSDI 2026 的论文实验里,CodeLlama-34B 还在作为实验模型出场。知乎
但"能跑"和"值得跑"是两回事,问题有三个:
1)模型已冻结两年半。CodeLlama 2023年8月发布,基于 Llama 2,首发 7B/13B/34B,2024年1月底补上 70B,此后 Meta 再没有基于 Llama 3/Llama 4 推出 CodeLlama 官方续作——这条产品线实际已经停更。
2)对标物暴露了年代。2023年8月社区对它的定位是"追平 GPT-3.5 的代码水平"。微博而 2026年2月发布的 Qwen3-Coder-Next,已经在讨论 SWE-Bench Verified 70.6%、聚焦智能体训练。哔哩哔哩两套能力坐标,差了不止一代。
3)16K 上下文,撑不起今天的编程助手场景。CodeLlama 开箱上下文是 16K;而 DeepSeek 涨价同一周开源的 Qwen3.8-27B,社区方案已经跑到 64K 上下文。知乎读多文件、接 agent,16K 太挤了。

三、那为什么教程还在教 CodeLlama?
不是它好,是它早、它有名、生态有惯性。它是最早出圈的开源代码模型,搜索前排大量是 2023-2024 年教程,后续教程互相转载;按"最新"过滤,2026年8月仍有内容把"代码任务用 CodeLlama"当成默认推荐。知乎它还在 Ollama 官方库里,一条命令就能拉,教程写起来成本最低。
有个细节很说明问题:那篇 4 月的《Ollama+CodeLlama 离线补全》教程,文中自己写了句"笔记本电脑用户优先选 Qwen2.5-Coder 7B,低配置也能流畅运行"。知乎写教程的人知道有更新的选项,但标题还是 CodeLlama——因为有搜索量。
四、CodeLlama 还适合谁,谁一定绕道
还适合的四种情况:1. 学术复现、论文基线对比;2. 学习 infilling 补全原理——7B/13B 是最早支持"中间插入"补全的开放模型之一;3. 涉密离线环境里要一个三年未变、条款稳定的权重——但生产使用前建议把新一代开源代码模型一起测了再定;4. 显存极小、只想先跑起来看看——7B 足够小。
一定绕道的四种人:1. 第一次想用本地模型替代 Copilot/Cursor 的;2. 需要 agent、工具调用、多文件重构的;3. 项目文件多、依赖长上下文的——16K 不够;4. 主要写中文需求、中文注释的——它训练语料以英文代码为主。
五、铁了心要本地:2026 年按硬件分层拉什么
下面这张表按显存档位整理,依据全部来自社区近期实测内容。其中 3080 20G 跑 Qwen3-Coder 30B Q4 来自B站用户的实机测试。哔哩哔哩80B FP8 一档对应另一条社区部署视频给出的推荐配置。哔哩哔哩
硬件档位 | 建议拉什么 | 依据 |
|---|---|---|
笔记本/无独显 | Qwen2.5-Coder 7B | CodeLlama 教程自己都点名低配首选 |
8GB 显存 | 7B-8B 代码模型 Q4(含 Qwen3-Coder 8B) | 2026 年本地助手教程主流配置 |
20GB 显存档(3080 20G) | Qwen3-Coder 30B Q4 | B站社区实测 |
24GB 显存(3090/4090) | Qwen3.8-27B 4bit(15-17GB,64K 上下文) | 知乎社区 3090 实测方案 |
96GB 内存 + 16GB 显存 | Qwen3-Coder-Next 80B FP8 | 社区部署方案 |
对照一下:跑舒服 CodeLlama-34B 同样要 24GB 显存档,拿到的是 2023 年的能力。

六、后续值得盯的三个信号
Ollama 模型库是否给 codellama 标弃用——v0.32 起,旧模型启动前已新增弃用警告。微博
DeepSeek 定价的后续动作——周末打折只是精细化运营的开始。
新一代开源代码模型的 SWE-Bench 成绩和最低硬件门槛。
最后一句:本地编程的价值是"多一个选项",不是"用旧教程替代云"。知乎硬盘空间不值钱,你的时间和对本地大模型的第一次印象值钱——别把它花在一个冻结两年半的模型上。