10月8日凌晨1点(北京时间),微软在旧金山发布会扔出一条对本地党分量很重的消息:GitHub Copilot 将在本月底前支持本地 AI 模型推理,开发者可以在云端模型和设备端模型之间自动或手动切换。 纳德拉同日凌晨在 X 上配的话是"把不限量的智能带到每张桌子、每个家庭"。 同一场发布会上,英伟达还端出了 DGX Station for Windows——桌面形态、最高748GB统一内存、官方称可跑约1万亿参数模型,四季度上市。今日头条小红书今日头条

云端编程工具的头号入口正式给本地模型开门,这件事值得每个跑过 Ollama、装过 Strata 的人认真对一遍数字。但先说结论:这不是一篇"本地党赢了"的爽文,而是一篇"月底开闸前你该先问哪三个问题"的核对清单。
一、先把官方给的数字摆全
目前能核实到的信息(IT之家、微博科技账号对发布会的直接报道):
入口:Copilot CLI、Copilot 应用、Visual Studio Code 三处均可设置偏好;
两种模式:自动编排(协调器决定这轮走云还是走本地)或强制使用设备端模型;
本地模型怎么选:走 Windows ML 可直接选微软自研的 MAI Code 1.1 Flash;也可以连接任意 OpenAI 兼容的本地端点,用端点暴露的模型;
MAI Code 1.1 Flash 的形态:混合专家模型,总参数 1370 亿、激活参数只有 68 亿,官方写明用了量化与推测解码来压内存和提响应速度。今日头条
官方吞吐数字:在 Surface Laptop Ultra 上实测解码吞吐,提示长度从 2K 到 256K Token,落在每秒 40–63 个词元区间。微博

注意最后这条的口径:40–63 是微软自家旗舰笔电测出来的,这一代 Surface Laptop Ultra 搭载的是 NVIDIA RTX Spark 平台。 它不是"你的机器"。它真正的用途,是给"本地编程模型该有多快"画了一条官方基准线:达不到这条线的本地组合,接进 Copilot 也会被嫌慢。哔哩哔哩
二、最该被本地党注意的变化:微软换作业了
去年到今年,微软给本地 AI 立的规矩是 NPU——Copilot+PC 认证要求 NPU 算力不低于 40 TOPS、内存 16GB 起。结果 9 月 30 日,微软 Surface 业务副总裁在骁龙峰会期间亲口承认:新 Surface 不再叫 Copilot+PC,这个搞了两年半的标识体系弃用。 知乎那篇梳理写得很直白:NPU 卖不出溢价,真正决定端侧体验的是内存。招牌功能 Recall 又死在隐私争议上。知乎

再看这次 Copilot 本地推理用的方案:量化 + 推测解码 + 总参数堆量、激活参数砍到 6.8B + 吞吐随提示长度给区间值。这套词,任何一个在 12G 卡上跑过 125B 的人都会觉得眼熟——这就是社区这两年用 Strata、llama.cpp、MLX 一单一单磨出来的作业。137B 总参数/6.8B 激活的 MoE,恰好是"权重靠量化和分层压进内存、干活时只叫醒一小撮参数"的丐帮标准解法。微软绕了两年半 NPU,最后把社区路线搬进了官方入口。
三、把 40–63 摆进社区账本里看
口径 | 模型形态 | 硬件 | 速度/说法 | 来源时间 |
|---|---|---|---|---|
官方基准线 | MAI Code 1.1 Flash(137B/激活6.8B) | Surface Laptop Ultra(RTX Spark) | 40–63 tok/s(提示2K→256K) | 10月8日发布会 |
社区爆款 | Qwen3.8-Flash-Next 125B + Strata | 12G 消费级显卡 | 视频标称 93 t/s | 10月2日B站 |
社区极限 | DeepSeek-V4.1-Flash 约200GB | 单张 3090 + 系统内存分层 | 称"跑满血" | 10月6日知乎 |
翻车提醒 | 社区 MLX 打包版 | Mac | 官方宣传的 MTP 加速权重在包里缺失 | 10月7日知乎 |
三件事一眼能看出来:第一,12G 显卡党的实测天花板高于微软旗舰笔电的官方下限,你的 Strata 125B 接进 Copilot 端点未必比 MAI 慢。 第二,"标称 93"和"同样显卡同样模型跑别人一半速"的视频也是同一批人发的,本地速度分布极宽,抄作业前先对配置。 第三,官方数字和社区包之间有缝隙——MLX 那次 MTP 权重缺失就是前车之鉴,这次 1.1 Flash 装进 Windows ML 后给不给完整加速权重,值得盯。哔哩哔哩哔哩哔哩知乎
四、官方还没公布的三条线,别脑补
发布会只开了个头,以下三条目前没有任何公开数字,月底真机上线前都是悬念:
内存/显存地板:137B 量化后到底要占多少 GB、Windows ML 最低硬件要求,官方没写。8G 显卡用户现在无法判断能不能吃到 MAI;
平台范围:本次表述围绕 Windows ML 和 Surface,macOS、Linux 的 Copilot 本地推理是否同步开放,没有说法;
和计费的关系:Copilot 今年 6 月改成 AI Credits 按量计费,重度 Agent 用户"烧超预算"是社区高频抱怨。 强制设备端模式跑出来的 token 还计不计 Credits、自动编排会不会把本该本地的请求悄悄扔回云端——这条直接决定这功能是"省钱开关"还是"营销开关"。知乎
另外提醒一句边界:选"自动编排"意味着接受协调器可能把这段上下文送去云端。对拿 Copilot 喂内部代码的人来说,要不要锁死"强制设备端",是启用当天第一件要设的事。

五、按机器分三类人
12G–16G 显卡 + Windows 用户:最该第一时间试的一批。月底更新后把本地端点(Strata/Ollama/LM Studio 暴露的 OpenAI 兼容口)接进 Copilot,跑你手里现成的 125B/27B,和 MAI Code 1.1 Flash 双开对测。你的硬件大概率能摸到 40–63 这条官方线;
8G 显存党、老笔记本:建议观望两周。MAI 的内存门槛没公布前,别为了"官方支持本地"去买卡或折腾量化版本——上个月这波显卡涨价已经教会大家一件事:参数表没落地前,钱先捂热;
Mac 用户:这次发布的主角不是你们。DGX Spark 那本账另算,Mac 上的 Copilot 本地推理等微软把平台说清楚再动。
一句话收尾:微软这次不是发功能,是官方承认了本地党这两年的玩法——内存决定能装多大,量化和推测解码决定跑多快。月底开闸后,先设强制设备端、再测端点延迟、最后看账单,三件事做完,才知道这条"本地之门"是不是给你开的。