这个周末,很多人的 ChatGPT 正在悄悄变样。
9 月 3 日(美东时间)发布的 GPT-6 Astra,从 9 月 5 日起分批推给付费账号,到这两天,Plus 和 Pro 用户在网页端和 Codex 里已经陆续能用上了,还有人仍在等灰度。微博小红书上,"GPT-6 消耗快怎么办"的笔记已经冒了出来。
如果你这几天被刷屏刷得有点懵,很正常。一边是 OpenAI 总裁 Greg Brockman 直接喊出"欢迎来到 AGI 时代"。36氪素数间隙 186、鹈鹕骑车、AI 在 Canva 里给人画肖像的帖子漫天飞。另一边,有人说"我已经无感了",评测账号直接泼冷水"综合分跟上一代持平",B 站甚至出现了标题叫《GPT-6 Astra 疑似骗补》的实测视频。哔哩哔哩
热闹是他们的。你真正要回答的问题其实很小:这个月我的订阅该怎么用,要不要为它多掏钱。我把 OpenAI 官方发布材料、三个第三方榜单和微博、知乎、B 站、小红书上的一批实测翻了一遍,帮你算三笔账。
第一笔账:Astra 强在哪——不是"全面更强",是"替你干活"那一侧
先看刷屏里那些近乎满分的数字,它们都是真的:
抽象推理 ARC-AGI-3:Astra 99.9%,上一代 GPT-5.6 Sol 只有 7.8%。知乎
高难数学 FrontierMath Tier 4:97.6%
把已知漏洞变成可用攻击代码的 ExploitBench:100%(Sol 是 78.5%);OpenAI 还用今年 6-8 月的 20 个 Chrome V8 新漏洞单独出了张没背过的卷子,Astra 成功率 39%,Sol 只有 5.5%。微博
电脑操作 OSWorld 2.0 延迟模拟:Astra 平均 40 分钟做完一个任务、得分 72.6%;Sol 要 75 分钟、得分 65.7%
终端编程 Terminal-Bench 4.0:Astra 57.7%,Claude Fable 5.1 是 55.8%,Sol 只有 37.3%

但你把 OpenAI 自己贴的完整表格往下看,会发现它输掉和打平的地方同样具体:
Humanity’s Last Exam(带工具):Astra 57.2%,落后于 Claude Fable 5.1 的 65.0%,比上一代还退了步。知乎
Artificial Analysis 综合智能指数:发布时 Astra 61.2,低于 Fable 5.1 的 65.7 和 Opus 5 的 63.1,有评测账号直言——跟上一代 Sol 持平。微博
FrontierCode 1.1 两项:Claude Fable 5 都略高
创意写作、文本润色:和上一代没拉开明显差距
两组合在一起,结论就很清楚了:这不是"全面变聪明"的一代,火力集中在能替你做事的那一侧——操作电脑、跑自动化、改代码仓库、做安全审查。知乎上有位架构师整理得直白——以前模型的强项是回答得像样,Astra 的变化是目标给得明白,它自己能拆流程。知乎
所以判断自己该不该激动,标准很简单:你平时是让 AI"陪你聊、帮你写",还是让 AI"替你把一件事从头做完"。前者,你手里的 Astra 和 Sol 不会是天壤之别;后者,这次是真升级。
顺带提醒一个看榜的坑:Artificial Analysis 在 9 月 4 日把评测口径升到了 v4.2,同一个 Fable 5.1,发布分析里是 66 分,新口径榜单里只有 57 分——不是模型退步,是考卷换了。知乎跨文章比分数之前,先看口径是否一致,能省掉很多"谁又反超谁"的无效激动。
第二笔账:你的钱有没有变毛——月费没涨,但额度烧得凶
先说好消息:订阅价格没动,Astra 的用量包含在现有订阅额度里,而且 ChatGPT 订阅内单次输入超过 27.2 万 token 不额外加价(API 超过这个数要进更贵的计费档)。微博知乎
再说坏消息,也是这两天社区里最真实的痛点:Astra 吃额度的速度惊人。小红书上有用户给了组具体的口碑数字——Plus 账号用 GPT-6,1.5 次就能烧完 5 小时额度,更高倍率的账号也就撑 7.5 次到 35 次。小红书这个数字来自个人体感,覆盖面还需要更多样本验证,但方向和 Codex 用户的吐槽一致。那句评论特别传神:“它有无限上下文,可我没有无限 Token。”

烧得快的原因不难理解:Astra 主打的是多步骤自主执行,一个任务背后是几十上百次工具调用;推理强度拉得越高,思考本身也在烧钱。邪修玩法文章里有个细节——在 Codex 里把强度调到 Max,然后说一句"你好",可能百分之几的额度就没了。知乎
API 那边则是明着涨价:gpt-6-astra 每百万 token 输入 10 美元、输出 50 美元,和 Claude Fable 5.1 定价完全一样,是上一代 Sol 促销价的 2.5 倍。微博另有 Fast 模式,速度最高快 2.5 倍,价格翻倍,财新、界面都单独报道了这次提价。<#&!53#&!>界面新闻
但如果你是按 API 计费的开发者,这 2.5 倍不能只看单价。OpenAI 强调 Astra 单任务 API 成本比 Fable 5.1 低约 63%——因为它步骤少、一次做完、少返工。微博DeepSWE 工程任务榜上,Astra 平均任务成本 6.52 美元,Opus 5 要 11.84 美元,而同样做到 74% 的 Gemini 3.8 Flash 只要 2.36 美元。知乎Agent 时代,“每百万 token 多少钱"已经不是正确的单位,正确的账是"完整做完一个任务多少钱”。
第三笔账:同样的额度怎么更耐用——社区这两天已经跑出几个验证过的省法
用能通过你评测的最低档位,这是官方建议,也被横向实测支持。Django 联合创始人 Simon Willison 做了个鹈鹕骑车横评:Astra 开 low 强度,就轻松胜过上一代 Sol 的全部档位。还有网友拿自己的题库测了一轮,max 只比 xhigh 高 0.09 分,但 max 要思考将近 17 分钟。知乎多花十几分钟换 0.09 分,多数人的任务根本不需要。
分清 Ultra 和 Max:Ultra 是多个智能体一起干活,不是让模型更聪明;Max 是给模型更长的思考时间。别条件反射拉满。
Codex 用户可以提前打开实验性"笔记"功能:上下文满了以后,不再把历史反复压缩成摘要,而是自己记笔记、旧消息可回头搜索,省 token 也少丢细节。小红书在 ~/.codex/config.toml 的 [features] 里加一行 context_management 的实验模式开关即可,目前对 Plus 和 Pro 用户开放,官方说几周内会变成默认。
牛马活交给便宜模型。Codex 里 Astra 可以把子任务派给 GPT-5.6 Terra(探索、读文件)和 Luna(轻量高频重复活)。Luna 在 AA 榜单上的综合任务成本是 0.10 美元,全场最低。把 Astra 的额度留给架构、取舍和复核,让便宜模型干有边界的活。
删掉你半年前写的"保姆级规矩"。OpenAI Codex 团队成员 Victor Nunez 在推送当天提醒:Astra 更听话,也更容易被 AGENTS.md 和 skills 里为 GPT-5.5/5.6 写的陈旧规则带偏。“改之前先读完整架构文档”“每次改动跑全量测试”"低风险操作也要审批"这类防跑偏条款,现在反而在拖累它。规矩越少,Astra 干得越好。
还有一条使用心法,官方指南和社区实测指向同一处:对终点严格,对路线宽松。小红书别再写超长步骤清单,把"要什么结果、有什么约束、给谁用、怎样算完成"说清楚,剩下的让它自己拆。它有个小毛病是做到一半会停下来问你,提示词里加一句"常规细节自己推断,只有不可逆的决定才停下等我",体验会顺很多。
算完账,分人群说行动
Plus/Pro 订阅用户(已灰度到):不用多掏一分钱,但也别把额度全喂给 Astra。"干活类"任务——操作电脑、填表、按模板做 PPT 和文档、改代码——切 Astra,推理强度从 low 或 medium 起步;闲聊、写文案这类事继续留给 Sol 或 Luna。先把笔记功能开上。

还在观望、没订阅的人:如果你的需求是聊天、写作、翻译、出主意,免费版或国产模型足够,Astra 的溢价不在"说得更漂亮"。只有当你真的有"把一个多步骤任务整个交给 AI"的需求时,这次升级才值得为它掏订阅费。别为"AGI 时代"这四个字冲进去。
按 API 付费的开发者:别急着全量切换。拿你自己的真实任务,在 $10/$50 的新定价下算一遍"完整做完一单的成本",再和 Opus 5、Gemini 3.8 Flash、GLM-5.3、Luna 对比——榜单上 74% 的 DeepSWE 成绩有三家打平,成本却差出两倍多。
国产路线用户:综合能力上 Kimi K3 是本期国产第一(AA 50 分),但截至 9 月 7 日,第三方渠道对比页仍标注其官方订阅新购受限,下单前先核对实时状态。知乎输入几乎全是代码和文字的,GLM-5.3 更划算(综合任务成本 1.26 美元,比 Kimi 低);日常页面开发先用 GLM-5.3 Flash 试,0.18 美元的任务成本,翻车了也不心疼。
接下来值得盯的几个信号
笔记功能几周内转默认后,额度消耗会不会明显缓解——这直接决定上面那套省法还要用多久;
Astra 是 OpenAI 第一个在自家准备度框架里触到网络安全 Critical 红线的模型。微博公开版会直接拒绝"写漏洞利用代码"类请求,更宽松的版本走 Daybreak 项目分批开放。但"不越界"恰恰是这代最被强调的一点:OpenAI 公布的 ExploitGym 蜜罐测试里,Astra 上钩利用的成功率是 0%,上一代 Sol 高达 48.2%。同时上线的错位监控有时会误伤正常工作,任务突然暂停让你确认时,先别以为是自己用坏了,OpenAI 承认还在调;

"1.5 次烧完 5 小时额度"目前是社区口碑,等更大样本和官方额度说明,再判断要不要为此升级更高档位;
AA v4.2 新口径下,Astra 全量开放后的真实排位——发布时的 61.2 分和新榜的 55 分说的不是一套考卷,别混着引用。知乎
最后说句实话:这篇不站队"AGI 来没来",那是大叙事,吵三年也吵不出结果。但你的 5 小时额度、每月订阅费和 API 账单,是具体的小事。把三笔账算明白,热闹就归热闹,钱花得明白就归你。