9月10日,#OpenAI暂停GPTPro订阅#上了热搜:200美元的Pro 20X档暂停新用户注册和升级,理由是GPT-6 Astra的需求"前所未有",算力压力顶不住了,存量用户和API不受影响;评论区有句话很传神——堪比春运抢票。微博
把时间往回拨一周:9月3日Astra发布,发布会收尾扔下"欢迎来到AGI时代",号称AGI终极考卷的ARC-AGI-3从上一代Sol的7.8%刷到99.9%。 紧接着API标价出来,标准输入10美元/百万token、输出50美元/百万token,相比上一代GPT-5.6直接上涨了2.5倍。 云端这边,价格抬了2.5倍,门口还立了个"暂停上新"的牌子。知乎知乎
于是很多人开始琢磨那句老话:进不去、用不起,那我本地跑一个呢?
有意思的事情就发生了——从9月10日晚上开始,各种"GPT-6本地部署"的帖子开始成片出现。先把结论钉死,再展开讲:
GPT-6 Astra到今天没有放出任何权重,它不存在"本地部署"。 所有声称能让你在本地"跑起来/私有化部署/拿到源码"GPT-6的内容,跑出来的都不是GPT-6。
我数了数,这一夜刷屏的至少四类帖子
第一类:主板蹭机型。 9月10日那篇《AI PC时代到来:华硕Z890/B860主板助力GPT-6本地部署》,通篇读完,一个字没讲Astra怎么装、跑在哪个进程里,讲的全是16相供电、DDR5 9066、NPU Boost和吹雪姬灯效。 一个在十万卡级集群上训出来的闭源模型,不会因为你主板上的NPU就能跑起来。本地装机升级当然是真需求——但那是为了你实际要跑的开源模型(27B量化、70B分块)升级,不是为了"GPT-6"三个字掏钱。知乎
第二类:"源码"引流型。 9月11日22点发的《最新AI软件源码:gpt-6-astra/claude-fable-5.1大模型……SparkAi独立一站式AI系统部署》,把GPT-6、Claude、Midjourney V8的"源码"打包成一站式系统,还附了演示站点——登录账号admin,密码123456。 闭源模型的"源码",能装进壳子的只有API聚合中转。知乎
第三类:教程夹带型。 《gpt-6多少钱?105万上下文、50美元输出价》这篇,前半段拆价格上涨原因拆得挺认真,后半段话锋一转,开始让你下载"OpenClaw部署助手",点开"内置AI"里"预置的最新版模型"一键跑——至于这些模型是谁的权重、什么版本、有没有被改过,全文一个字没提。同一晚的小红书更夸张:四篇几乎同文的"GPT-6自动粗剪口播视频"帖子,挤在同一分钟内发出,内容清一色是"GPT-6 Astra重磅升级,能直接操作剪映",模板化量产的痕迹都懒得擦。 B站还有两条发布时间只差一天、连封面像素都完全相同的《9月最新AI工具!本地部署才是AI顶流!》矩阵号视频。小红书哔哩哔哩
第四类:中转折扣型,也是最容易让人"觉得不亏"的一类。 WorkBuddy的接入教程教你在配置页把"模型名称、接口地址和APIKey"一项项填好,还有人开出"国内3步接入、API价格省93%"的渠道。 这类渠道的本质,一篇讲"GPT-6连不上Claude Code,不是bug"的帖子顺手写明白了:你的请求先落到一台来路不明的服务器上,把OpenAI格式翻译成Anthropic格式(或反过来),再转发出去——“平台收到,把请求翻译成 Anthropic 格式,转发给 Claude,拿到回答再翻译回 OpenAI 格式还给你”。 自己架开源网关(cc-switch这种13万星的切换器、new-api这种统一入口)是一回事,那是数据过自己的机器;把key和上下文交给陌生中转,是另一回事——你的代码、文档、聊天记录,从此都过别人一台机器。知乎公众号
云端的门变窄,本地党该看的三笔真账
先说云端那笔账,它比"要不要转本地"更急。Codex圈一个被收藏380多次的回答把Astra的额度账拆得很狠:按这位用户的推测,20x Pro周额度约1300美元,Plus周额度只有65美元,五小时窗口约10刀——而Astra起一个项目、读一遍AGENTS.md和skill.md就是几十万输入token,一次百万级输入就能把Plus的五小时额度打满,恢复窗口又刚好撞上缓存过期,越等越亏。知乎
这就是那句被连说三遍的"如果你是plus用户,不要用Astra"的出处。 但好消息是同系列的小尺寸本来就是给中档位准备的:该回答推测"大概在月底,就会有6 Sol、6 Terra、6 Luna了",门窄了不等于你被关在外面。知乎
再看本地这一周真实跑起来的东西,三档:
16GB级: Qwen3.8-27B的新一批量化(NVFP4)已经是生产可用状态,社区甚至排出了"16GB显卡可用的几款新秀量化"清单。 四卡5060Ti的实测横评给出的结论很反直觉:NVFP4的27B单流能跑到110 token/s以上、预填充约3K,但决定真实体验的不是跑分峰值,是KV池大小——“它直接限制了满上下文下的真实并发”。哔哩哔哩哔哩哔哩
旗舰单卡级: 5090 32G跑Qwen3.8-27B、开256K上下文,prefill约1600 t/s、decode约120 t/s,账面很猛。但同一个高赞回答紧接着泼冷水:这类27B"完全没有长程任务的能力",24小时挂着让它自主干活,是给自己找麻烦。 而"长周期自主执行"恰恰是Astra这代闭源旗舰卖的东西。知乎
全血MoE级: DeepSeek-V4.1-Flash上周开源(MIT许可、552B主干+196B Engram),直接冲上HuggingFace热榜第一。 第一批多卡方案已经有人跑通:8台华硕GX10拼出1024GB分布式统一内存。 这组实测的decode中位数按任务类型在37.5-108 token/s之间;DGX Station级别单请求则是149 t/s。 “统一内存是不是大型MoE本地部署的版本答案”,是上周本地圈吵得最凶的新话题。哔哩哔哩哔哩哔哩哔哩哔哩
三档看完,落到那句44赞双3090用户的总结上:本地部署不是省钱方案,是"可控性方案"。 冲着省钱去的,八成要失望。 断网可用、数据不出门、不看订阅脸色——这些是GPT-6和中转站都给不了你的。反过来,Astra的长程自主执行,今天的本地阵营就是接不住,软文里"本地平替GPT-6"那句话,谁认真谁输。顺带说一句,"GPT-6很强还是营销强"本身在社区里也没吵完——"不废话地说,感觉不到和5.6sol的差异"的实测帖,点赞收藏同样不少。 云端也没吹的那么神,本地没垫底的那么差,两边都别拿软文当决策依据。知乎知乎
今晚能做的三个动作,和继续盯的四个信号
动作一(点过"下载"的): 查一下你机器里装了什么。"一键/源码/内置模型"三个词里中两个的,先备份环境再卸载;已经把key填进陌生中转的,今晚就把它换掉。
动作二(被"GPT-6"劝装机的): 回答一个问题——升级后你到底跑哪个模型、哪个量化版?说不出具体型号和版本的,这笔预算就是在给软文冲销量。
动作三(想认真转本地的): 先把16GB档的Flash级任务跑通一个真实场景(知识库、翻译、代码辅助),再考虑要不要碰统一内存那级门票。
继续盯: Pro重新开放的时间表和100美元档会不会跟着限——官方这次的口径是"临时暂停",存量用户和API不受影响。 6 Sol系列月底发布后,Astra档云端价格是不是会被重新锚定;V4.1-Flash的GGUF生态什么时候塞进24G卡;以及这轮价格抬到50美元/百万输出之后,开源阵营的更新节奏——OpenAI这次涨价,等于替本地党立了一根新的标尺,值钱的不是"本地跑GPT-6"这个伪命题,而是"你可以不用它"这个真选项越来越便宜了。微博知乎