给家里跑着模型的人,这72小时的信息密度有点高。北京时间10月8日凌晨,微软在旧金山的Windows与Surface发布会上宣布:GitHub Copilot将在本月底前支持本地AI模型推理,开发者可以在云端模型与设备端模型之间自选。 它的标题很直白——“不再纯云端”。据知乎@冰码达10月9日的实测梳理,截至10月8日,Copilot CLI已经能从正在运行的Ollama里发现支持的本地模型,检查提供方和地址后就能加入切换,不用等月底。 但同一时间,“最佳性能建议超120GB内存”、“每秒63词元”、"160万token账单为0"这些数字一起冒出来,“现在可用”、“实验预览”、"计划推出"三种状态混在一张新闻稿里。这篇只服务一类人:已经在跑Ollama或本地模型、日常拿AI写代码的中间层玩家——现在要不要把本地模型接进Copilot,哪些活能派给它,门槛到底卡在哪。IT之家知乎
先把时间线拆开:今天能用的、10月中能用的、还只是计划的
已经可用(截至10月8日):Copilot CLI从运行中的Ollama发现本地模型,手动加入、手动切换。从CLI 1.0.94-0起,就能用/model把符合要求的Ollama模型加入当前会话、无需重启;前提是模型支持工具调用(Tool Calling)与流式输出。小红书
10月15日:搬运视频称微软混合智能新功能由HydraFusion驱动、将于10月15日登陆GitHub Copilot——这条目前是单一信源,先记账不当真。哔哩哔哩
10月底前:微软宣布引入端云混合推理架构,由后台协调器在云端模型与设备端本地模型之间自动或手动切换,覆盖Copilot CLI、Copilot应用和Visual Studio Code。 配套的工具执行权限沙箱同周宣布正式可用,但真让Copilot改代码、跑命令之前,先确认沙箱是不是真开了。集微网小红书
10月16日:与本地推理配套的Surface Laptop Ultra开售,最高128GB统一内存。21世纪经济报道
微博账号"全球科技财金"的点评适合贴在每一篇自媒体稿头上:这是推出计划,不能写成所有用户已可用。 自动路由还没上线之前,本地和云端之间,是你自己在切。微博

第一笔账:门槛账,"120GB"是性能甜点,不是门票
撑起这次端侧落地的主力,是微软自研编程模型MAI Code 1.1 Flash:总参数1370亿,通过稀疏激活架构在消费级设备上运行,本地模型调用不收推理费。 而"建议超120GB RAM"是转述微软官方博客的说法,且原帖专门注明了后半句——这是性能建议,官方没有把它写成最低门槛。 别被这个数字吓退:同一场发布会上,微软演示的是另一组数字——2840亿参数的开源权重模型DeepSeek V4 Flash量化到1.6比特后,可在Windows PC本地运行,内存占用约60GB。 1370亿是总参数,稀疏激活不等于1370亿个参数同时在岗。微博开放平台小红书微博

对存量Ollama用户,真正的门票从来不是内存数,是两条硬条件:模型支持工具调用、支持流式输出。跑不跑得起,要看第二笔账。
第二笔账:速度账,峰值与平均、解码与预填充,是两回事
官方宣传口径:Surface Laptop Ultra本地推理吞吐量最高每秒63词元。 但实测参考系别只看峰值:有用户早在4月就用M5跑Gemma4 26B A4B接本地API,纯生成30-35token/s,频繁agent任务速度其实一般——上下文越长,预填充越贵。 知乎10月8日还有人在问:MacBook跑qwen3.8 27B平时40+token/s,上下文一过32k直接暴跌到10+。 这周社区对本地模型能力的判断其实已经收敛:聊天及格,agent偏科。IT之家微博知乎
对派活的影响很具体:补全、解释函数、改一段测试这类短输出任务,瓶颈在解码,本地模型够格;跨模块重构、复杂排障这类长输入+工具调用密集的任务,瓶颈在预填充和智商,先留给云端。知乎实测里那句大实话值得抄下来:一个看起来很简单的修改,也可能牵涉隐藏的业务约束,工具得允许开发者纠正选择——协调器上线前,这个"允许纠正"就是你手动切换的那一下。
第三笔账:成本与安全账,"账单为0"和"数据不出门"是两本账
省的部分是真的:海外博主已经实测用Copilot本地模型跑160万token、账单为0、断网也能写代码。 但两个陷阱要拆。哔哩哔哩
其一,为零成本买单的还是硬件。Surface Laptop Ultra 128G+1T档,微博晒出的到手价48388元。 内存短缺行情下,64GB版DGX Spark定价4999美元、128GB旧版现价已逼近6950美元。 家里已经有能跑Ollama的机器的,接Copilot是边际成本为零的事;专门为接线买卡的,那是另一篇账,最近社区已经翻来覆去算过好几轮。微博哔哩哔哩
其二,选了本地模型,不等于整个会话离线。GitHub的说明写得很清楚:选择本地模型不会自动开启离线模式,也不会自动关闭遥测,仓库内容在哪些步骤发送出去,取决于提供方配置、联网工具和其他服务。 企业用户倒是多了一个可控部署选项:受合同限制的仓库留在指定设备或内网,员工继续用熟悉的工具,管理者围绕模型提供方、访问范围和日志定规则,不必更换整套开发环境。模型运行地点、网络访问、文件权限是三个不同问题,后两个要单独配置,代码也仍需审查测试。知乎微博

按档位行动清单
已跑Ollama、模型支持工具调用+流式输出:今天就可以接CLI,先派补全、解释、小修测试三类活各10次,记录每次的实际等待和质量,再决定扩大还是回退。
16-32GB内存:接小一档的模型只做补全和解释,别碰"120GB"话术,你不需要它。
64-128GB统一内存或Copilot+ PC:可以下载MAI Code 1.1 Flash本地版试agent任务,但长上下文先控制在32k以内,等月底协调器决定要不要让它自动分。
继续盯四个信号:10月15日HydraFusion是否真登陆;月底预览的设备与订阅适用范围公告;"120GB建议"是否有官方原文补最低配置档;国内账号是否在服务范围。
Copilot给本地模型开正门,不是"token自由"的续集——它只是承认了一件事:你家机器上那些模型,已经够格接走一部分真实的活。接不接,按上面三笔账对完再动手。