Copilot月底官方支持本地模型,12G显存能跑125B:AI编程“搬回家”之前,先认清显存悬崖和遥测暗坑

源自69位全网作者

11:54

这周AI编程圈发生了一件挺关键、但被Haiku 5.5降价和GPT-6开放盖住的事:微软在10月7日的旧金山发布会上宣布,GitHub Copilot将在本月底前支持本地AI模型推理——开发者可以在云端模型和设备端模型之间自由切换,或者干脆交给系统自动调度。同一场发布会还端出了Surface Laptop Ultra:首款搭载英伟达PC芯片RTX Spark的笔记本,Arm架构,Blackwell GPU最高6144个CUDA核心,统一内存最高128GB,官方口径本地推理吞吐量最高每秒63个词元、能跑1200亿参数大模型,10月16日上市,起价2600美元,直接对标16英寸MacBook Pro。微博小红书

Copilot月底官方支持本地模型,12G显存能跑125B:AI编程“搬回家”之前,先认清显存悬崖和遥测暗坑

翻译一下:「AI编程搬回家」这件事,从极客折腾变成了官方路线。

而在这之前的一周,社区已经把路趟平了。上周刚发布的开源项目Strata,把1250亿参数的Qwen3.8-Flash-Next塞进了普通游戏PC——官方README的原话是「在你自己的游戏PC上跑1250亿参数模型」,NVIDIA或AMD显卡12GB显存以上、Windows或Linux都行,GitHub星标已经冲到1.8万。知乎上有位博主用48G内存+RTX 5070 Ti实测,IQ3_XXS量化加128K上下文,输出速度106.4 token/s。什么概念?一年前你想在本地跑千亿参数模型,要么租几张4090,要么直接放弃。GitHub知乎

所以这篇不聊「AI会不会取代程序员」这种老话题,只回答三个具体问题:你手里的机器现在能干到什么程度?这笔账怎么算才不亏?哪几个坑是新手必踩的?

一、先搞清楚:为什么是现在

三件事在这几周凑齐了,缺一个都不成立。

第一,官方通道开了。 GitHub官方changelog在10月7日确认:Copilot CLI从1.0.94-0版本起,用/model命令就能发现正在运行的本地Ollama实例里的模型,和云端模型并排选择。细节做得挺克制:发现不等于自动添加,你要确认提供方和端点后手动选择;Ollama和模型得自己提前装好;模型必须支持工具调用和流式输出。微软还宣布了Copilot混合推理架构,云端与本地模型自动切换,本月底上线。更早几天,Perplexity Computer也推了混合推理。大厂集体转向「混合」,说明本地推理已经从玩具变成了产品形态。GitHub Blog

Copilot月底官方支持本地模型,12G显存能跑125B:AI编程“搬回家”之前,先认清显存悬崖和遥测暗坑

第二,模型到了「够用」线。 Qwen3.8-27B是目前本地编程实测的当红炸子鸡。B站有UP主直接让它从零开发一个完整的研究生管理系统——页面设计、数据库交互、附件上传、多轮修改,结论是「比预期好很多,连续工作几个小时也稳定」。甚至有5090用户放话:努力干活的27B,比不努力的Sonnet和Opus还靠谱。当然短板也明确:速度和长上下文等待,依然是本地跑的最大痛点。哔哩哔哩知乎

第三,推理框架捅破了显存墙。 Strata的思路是不让显卡一个人扛活:Qwen3.8-Flash-Next是个MoE模型,24576个专家网络、每个token只激活10个,Strata把最常用的几千个专家放显存,其余放内存,CPU处理冷门专家,SSD存查找表。再配上「小模型猜词、大模型批量验证」的投机解码(提速1.6-1.8倍)和长文本分块读取,12GB显存就跑起了原本需要服务器的模型。官方在两台普通游戏PC上的实测:RTX 5070(12GB)+64GB内存,Q2_0量化能到94 token/s,IQ3_XXS 62 token/s,Coder版55 token/s;AMD RX 9070 XT(16GB)Q2_0也有60 token/s;24GB的RTX 3090预期能到100-140 token/s。关键是Strata提供OpenAI兼容API和Anthropic兼容API——意味着你可以把它接到Cursor、Claude Code、Codex CLI上当本地推理后端,浏览器打开127.0.0.1:8080还有实时监控面板。GitHub

Copilot月底官方支持本地模型,12G显存能跑125B:AI编程“搬回家”之前,先认清显存悬崖和遥测暗坑

二、算账:本地推理到底省不省钱

先看动机端。微博上有开发者这周吐槽:公司把GPT调成从量计费,每月50美元额度,「昨天干一天活就用了五分之一」,内部平台高端模型全锁,Copilot还是残血版。之前微软砍人均AI额度、OpenAI砍200美元档的事我们也聊过——订阅制的「无限量时代」正在落幕,额度焦虑是真金白银的。

再看收益端。知乎用户OwenJiong晒了张看板:RTX 5090单卡跑Qwen3.8-27B,累计推理5亿token,按DeepSeek Pro的价格折算,已节省约201美元(1400元人民币左右)。他的调优路径很有代表性:vLLM榨干到66 token/s后撞墙,换ninfer引擎到182,再上DFlash2投机解码到230+,满上下文262K,前缀缓存命中90%以上时首字响应不到1秒。知乎

但账要算全。本地推理的「免费」只是没有token计费,硬件投入、电费、折腾时间都是成本:

方案

一次性投入

实测表现

适合谁

现有12-24G显卡 + Strata/Ollama

0元(电费忽略不计)

12G卡跑125B量化版55-94 tok/s;24G卡跑27B Q4流畅

已有游戏PC、想先试水的

RTX 5090 32G单卡

约1.5-2万元

27B跑到230+ tok/s,262K满上下文

重度用户,亿级token用量

Surface Laptop Ultra(RTX Spark)

2600美元起,国行21988元起

官方口径本地推理63 tok/s,可跑120B模型

想要笔记本形态+官方支持的

AMD Ryzen AI Halo

3999美元

实测「没有一项优势」,带宽仅256GB/s

不推荐,见下文避坑

一个粗糙的回本模型:如果你像OwenJiong那样月跑上亿token,5090方案几个月就能把卡钱省回来;如果你一个月就用几千万token,老卡试水的边际成本才是真低。买新硬件跑本地模型,只对重度用户成立。

三、硬件避坑:显存是悬崖,不是斜坡

这部分是全文最值钱的,都是社区实测砸出来的经验。

坑一:以为显存不够只是「慢一点」。 小红书博主「AI指北」给的实测数据很扎心:模型装进显存,带宽是456-1792 GB/s;装不下被拆到内存走PCIe,带宽约64 GB/s,速度直接掉到不到5 token/s——不是慢一点,是没法用。他的结论简单粗暴:日常编程(补全/问答/小重构)24G显存够用;要跑多步Coding Agent,48G起。小红书

坑二:被「A3B」这种名字骗了。 Qwen3-Coder-Next是80B的MoE,每个token只激活约3B,名字看着很轻——但Q4量化后的权重仍要约49GB,单张32G卡(5090)都装不下,得2×24G或2×32G。激活参数说的是算力开销,不是体积。小红书

Copilot月底官方支持本地模型,12G显存能跑125B:AI编程“搬回家”之前,先认清显存悬崖和遥测暗坑

坑三:只看显存容量,不看带宽。 同样24GB,Intel B60带宽456 GB/s,RTX 3090是936 GB/s,差一倍。带宽决定出字快慢。更典型的反面教材是DGX Spark:128GB统一内存看着豪横,跑Qwen3.8-27B FP8生成速度只有8.3 token/s,知乎实测结论就四个字——内存带宽是硬伤。Mac统一内存同理:装得多,但出字慢,同一个30B模型独显151 tok/s、统一内存55 tok/s。它的价值在容量,不在速度。知乎

坑四:下载体积当运行显存。 B站「翻车老头」那期量化选择视频讲得很细:24GB卡跑Qwen3.8-27B,Q6_K文件23.86GB「装得下」,但上下文才是显存大户,一段稍长对话就会把模型挤到系统内存——那不是跑得慢一点,是换了一种跑法。结论:先下Q4_K_M(17.44GB),留足6.56GB余量给上下文。他还提醒了一个更隐蔽的点:量化模型卡上那个漂亮的KLD分数,测的是维基百科文本分布,不是你的代码库,「更不等于它能不能把一个Bug改对」——两个量化档都还没做过对等的编码/工具调用测试。哔哩哔哩

坑五:为「AI PC」新形态交智商税。 AMD Ryzen AI Halo售价3999美元,知乎实测标题就是《没有一项优势》:GPU架构老、带宽256GB/s比DGX Spark还低,而且开发生态是CUDA的天下,ROCm还很不成熟。新一代495卖到6799美元,GPU完全没升级——这钱不如加在显卡上。知乎

四、三盆冷水:本地不是保险箱

最后泼冷水,这三条决定你要不要现在就跳。

冷水一:本地≠离线≠不出数据。 GitHub官方changelog原话写得明明白白:「选择本地模型不会开启离线模式,也不会关闭GitHub遥测。」仓库内容会不会发出去,还取决于提供方配置、联网工具和其他服务。你要是冲着「敏感代码不出本机」去的,装完本地模型还得检查整个工具的联网配置,不然等于装了防盗门开着窗。GitHub Blog

冷水二:本地不防提示词注入。 就在10月7日,CSO Online报道了安全公司Adversa AI对GitHub Copilot CLI演示的「加密上下文注入」攻击:网页里藏一段加密内容,Agent抓取网页时中招,全程28秒把本机密钥文件发了出去,没有任何确认弹窗,对话记录里甚至看不出数据去了哪个主机。这个攻击和模型跑在哪没关系——自动模式的Agent,被骗时手里有什么就能偷什么。权限收缩、隔离敏感文件,该做的还得做。知乎

冷水三:本地模型的能力上限真实存在。 27B能独立完成管理系统开发,但复杂故障排查、跨模块大改,社区实测的共识还是切回云端强模型。混合推理的正确姿势不是「全搬回家」,而是任务分层:补全、解释函数、改测试这类高频小活交给本地(零边际成本、低延迟、不出机器),复杂任务再上云端。这也正是微软自动路由功能要解决的问题——虽然它现在还「需要等待上线」。

五、结论:三类人,三种动作

手里有12G以上显存显卡的用户:现在就可以试。 Strata装起来比想象中简单(Windows双击START-HERE.bat,国内加–source modelscope走魔搭镜像,实测速度11到14MB/s),接上你现有的Claude Code或Cursor当本地后端,先把补全和小重构的活挪过去。注意三件事:首次启动加载35-55GB数据会卡顿1-3分钟属于正常;报「engine stopped unexpectedly」八成是内存不够,关掉浏览器或换小量化档;要跑中文对话别选Coder特化版(中文弱),选保留全部专家的Q2_0或IQ2_XS。知乎

只有8G显存或纯Mac用户:等等月底。 Copilot的混合推理和自动路由上线后,「小活本地、大活云端」才是开箱即用的。现在硬上,要么量化到损失能力,要么忍受统一内存的慢速输出。可以先用Ollama+小模型练手找感觉,别急着花钱。

正琢磨买「AI PC」的:把预算花在显存和带宽上,别花在营销概念上。 Surface Laptop Ultra的63 tok/s是官方口径,国行21988元的起售价对多数人不划算。10月16日上市后先看第三方实测再动手;AMD Halo这类新形态盒子已有实测劝退。同样的钱,一张大显存N卡+够用的系统内存,才是当前本地AI编程的最优解。显存决定装不装得下,带宽决定出字快不快,型号最后一步再挑。微博

Copilot月底官方支持本地模型,12G显存能跑125B:AI编程“搬回家”之前,先认清显存悬崖和遥测暗坑

值得继续盯的信号有三个:Copilot本地/云端自动路由的实际上线表现(月底)、RTX Spark设备的第三方实测(官方口径和真实体验通常有差距)、以及Qwen3.8-Flash-Next的Coder特化版更新——如果代码能力追平云端旗舰,「订阅制AI编程」的定价逻辑会被真正动摇。

到时候再算一次账,可能就不是「省201美元」的量级了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章