8 月,Copilot 聊天面板里的模型下拉列表,突然热闹起来了。
一个月塞进来三个新模型:8 月 6 日,Kimi K3 上架,覆盖 Pro、Pro+、Max、Business 和 Enterprise 付费套餐,并逐步推送到 VS Code、CLI、Copilot app、GitHub.com 等入口。小红书 8 月第二周,MAI-Code-1.1-Flash 同步上线,具备原生图像理解,编码质量、指令跟随、工具调用都有改进。小红书

月中,xAI 的 Grok 4.6 也进了 Copilot。知乎 再算上原本就在架的 GPT、Claude、Gemini 系列,这个下拉列表已经有百货公司柜台的味道了。
GitHub 为什么急着上货?看看门外面在发生什么。有社区统计显示,Copilot 的市占半年里从 42% 掉到 37%,Claude Code 冲到了 28%。知乎 对面,OpenAI Codex 负责人 Tibo 8 月 21 日在 X 上确认,Codex 本周已经突破 2000 万活跃用户。微博
「Copilot 掉队」的讨论持续了大半年,GitHub 的应对思路其实很直白:不跟任何一个模型拼命,把自己做成「模型超市」——IDE 集成、Agent 流程、企业管理才是柜台,模型只是货架上的商品。但要提醒一句:切到 token 计费之后,模型列表就不只是功能清单,而是价目表。这波扩容和过去「多一个免费选项」完全不是一回事。
Kimi K3:值得庆祝,但先泼盆冷水
K3 的规格确实抓眼球:2.8T 参数的 Sparse MoE、原生多模态、1M 上下文,目前仍是全球参数规模最大的开源权重模型。小红书 但冷水必须先泼:官方自己也明确承认,K3 的整体表现仍落后于最强的闭源模型。知乎 所以不必期待什么「国产模型翻身」的戏码,这件事真正的意义在渠道层面。
在此之前,想自己跑起来这台 2.8T 的机器,公开方案起步就是 GB300、H200 级别的多卡集群。有人按 SGLang 的 2×8 H200 方案、套用 CoreWeave 的公开按需价算过,连续跑 30 天大约要 7.26 万美元。知乎 对普通开发者来说,基本不用碰自部署这回事。
GitHub 目前把 Kimi K3 托管在 Fireworks AI 上,相当于把这 2.8T 基础设施的固定成本,压成了按 token 计费的可变成本。知乎 Moonshot 这边也把接入 K3 的多家第三方 API 的真实成绩全部公开,是 Moonshot 官方 + Fireworks、Baseten、Together、Inferact 等一起跑出来的结果,验证工具 KVV 本身也直接开源。小红书

顺带说个相关事实:想在 Copilot 里用 GLM,目前还没有官方内置,只能靠 BYOK(自备密钥)接入;好在 GitHub 已于 2026 年陆续为 Copilot CLI 和 Copilot App 正式开放了 BYOK 能力,任意 OpenAI 兼容端点都能接。知乎
MAI-Code-1.1-Flash:微软的亲儿子终于上桌
微软 8 月 11 日发布的这个自研模型,即日起在 Copilot 全平台可用。它的定位从官方基准图里能看得很清楚:直接和 Haiku 4.5、GPT-5.4 mini 摆在一起,比的是 SWE-Bench Verified 和 Terminal Bench 2.1——Flash 系列的典型使命,不追能力天花板,追的是速度和性价比。

性价比给到什么程度?价格直接砍到底:输入每百万 Token 从 0.75 美元降到 0.20 美元,输出从 4.50 美元降到 1.20 美元,整体降幅约 73%。小红书
为什么这么拼?看竞争环境就懂了:MAI-Code-1 今年 6 月在 Build 亮相后,很快被智谱 GLM-5.2、Kimi K3 等中国模型和 OpenAI 自家 GPT-5.6 Luna 抢了风头。小红书 这一手本质是给「模型超市」的底层货架放一件微软自家商品——价格和供给最可控,也顺便制衡货架上的外部模型。
把账算清楚:K3 比 K2.7 贵 3.33 倍
先说前提,别把「上架」理解成免费。Copilot 按 token 折算 AI credits,1 credit = 0.01 美元,超出套餐额度按这个口径结算。小红书
GitHub 目前的公开目录价:Kimi K3 输入 3 美元/百万 Token,缓存输入 0.30 美元,输出 15 美元。知乎 同门更早上架的 Kimi K2.7 Code 便宜得多:0.95/4 美元。
固定算一笔:一项任务用 10 万输入 + 1 万输出 token、没命中缓存,K3 约 0.45 美元(45 credits),K2.7 Code 约 0.135 美元(13.5 credits)。同 token 量下,K3 约为 K2.7 的 3.33 倍。小红书 还没完,社区里有观察提到,Copilot 改用量计费后,重度用户月费从 $10 涨到了 $50-150。知乎 个体体感肯定有差异,但方向是确定的:token 计费下,随手切到贵的模型就是烧 credits。也要说清楚,这只是统一 token 量的价格估算,不是能力排名——更准的模型可能少返工,实际总成本未必更高。
按任务选模型,别按价格标签选
在 VS Code 里,Copilot 聊天面板底部的工具栏就有模型下拉框,同一个任务随时可以换模型跑。

社区里已经有人把试错经验总结得很一致:简单补全、改名、小范围修改先用 K2.7 或默认轻量模型;复杂跨文件任务固定一条小样和验收项,再分别试一次,比较质量、返工和 credits。小红书 翻译成人话就是三条:
补全、改名这类轻活:交给 K2.7 Code 或默认轻量模型,别拿 K3 浪费
复杂跨文件任务、疑难 bug:K3 和头部闭源模型各跑一次,用自己的返工率和 credits 消耗说话
带截图、带设计稿的场景:优先试有原生图像理解的 MAI-Code-1.1-Flash
三个坑,提前避开
「上架」不等于「马上能用」。各套餐是逐步推送的,K3 刚开放时,有用户试了一整天,每次花言巧语进入下一步,最终还是逃不 too many people。小红书 选择器里没看到 K3 的,别慌,再等等。
Business/Enterprise 的 K3 默认关闭,管理员启用前还要复核安全、合规和数据治理要求。小红书 公司如果有「代码不出内网」的要求,先确认数据处理方式再决定开不开。
别只看价格选模型。便宜不代表能干这个活,贵也不代表是最强。先定任务类型,再看价目表。
接下来值得盯的三个信号
K3 的实际 credits 消耗会不会降下来:缓存输入只要 0.30 美元/百万 Token,缓存用得好不好,对账单影响极大
GLM 会不会官方内置:目前唯一可用方式仍是 BYOK 接入,官方内置暂无明确上线时间表。知乎 国产模型阵营如果继续扩,Copilot 对国内开发者的吸引力会是另一回事
微软自研推理成本的动向:MAI 这次 73% 的降幅只是个开始,自研芯片加自研模型的成本下限,会决定底层货架未来的定价
一句话收尾:GitHub 这波扩容,押的不是某一个模型,而是「模型超市管理者」这个位置。对用户来说选择确实变多了——前提是,切模型之前先把每个模型背后的价目表算明白。