这一周,只要你还在网上冲浪,大概率被同一件事刷了屏:GPT-6 来了,OpenAI 喊出"欢迎来到 AGI 时代",号称 AGI 终极考卷的 ARC-AGI-3 跑分从上一代的 7.8% 一路飙到接近满分,“剪辑师完蛋了”"程序员末日电"的帖子满天飞。
作为一个可能要为它掏钱的人,我建议你先把手从"升级"按钮上拿开。
我们把全网关于 GPT-6 Astra 的信息扒了一遍——OpenAI 官方文档、The Decoder 的报道、36氪那篇刷屏实测、知乎上一批深度体验帖、Reddit 和官方论坛的吐槽,还有国内一大片订阅踩坑记录。看完之后,结论和发布会 PPT 不太一样:这东西确实强,但"要不要为它升级、掏哪档、接不接进工作流",是另一笔需要单独算清楚的账。
下面这四笔账,建议升级前先对一遍。
第一笔:跑分账——那个 99.9%,含金量打了三重折扣
先把最唬人的数字摆出来。
ARC-AGI-3,上一代旗舰 GPT-5.6 Sol 只考了 7.8%,Astra 在 OpenAI 官方对比表里标的是 98.6%——右上角还挂着一个脚注;而发布会口径和这两天满天飞的报道,大多直接说成了 99.9%、“接近满分”。知乎黑客攻击测试 ExploitBench 拿了 100% 满分,OpenAI 自己承认这是第一个跨过"关键级"网络安全门槛的模型。微博奥特曼在 X 上只写了一句话:GPT-6 Astra 来了。
成绩单确实吓人。但把分数的"含金量"摊开看,至少要打三重折扣。
第一重,脚手架。 OpenAI 自己注明了,这个 99.9% 是挂着一套 Responses API 的脚手架跑出来的,给了模型人类受试者拿不到的工具和草稿空间。ARC Prize 官方说得更直白:各家实验室自定的测试架构允许模型用自定义工具,真正能跨厂商比较的,是那个低得多的 62.7%。
第二重,数据污染的猜测。 有实测者提到,发布不到 48 小时,就有独立评测在某些测试集上把那个接近满分的成绩打到 60% 左右,业界猜测是训练数据里不小心混进了考题答案——“不是真聪明,是记性好”。知乎这里要划重点:这只是猜测,目前没有定论。但它至少说明一件事,换个没见过的题,分数未必稳。
第三重,最该考的那门,缺考了。 GDPval 这个基准,测的恰恰是"AI 能不能完成真实世界的知识工作",覆盖美国九大行业、44 种职业、1320 项任务,最贴近"AI 替你上班"这句宣传。而 OpenAI 这次没交卷。官方解释是这个考试测"一次性交付",不适合 Astra 这种长任务模型。理由成立吗?成立。但为什么整套成绩单里偏偏隐了这一项,你可以自己琢磨。
把官方那张对比表整个拉下来看,你会发现 Astra 也不是门门接近满分。抽象推理 ARC-AGI-3、网络安全 ExploitBench 这种能刷到 98.6%、100% 的,恰恰是有脚手架、有明确协议的"考试";可一到更像真实工作的项目,分数就朴素了——真实软件工程 DeepSWE 只有 74.1%,自动化任务 AutomationBench 41.4%,基因、化学这类专业基准也就 39% 到 50% 区间。换句话说,它最强的地方,正是最像"考试"的地方;越贴近真实工作,分数越老实。

这套操作不是第一次。英伟达上个月给 Claude 套上记忆和恢复机制,公开集刷到 100%,底层模型基线其实只有 30% 上下。分数没造假,但发布会 PPT 不会告诉你分数的"成色"。
最有意思的是,Altman 自己在发布前两天就说过一句话——“AGI 是一个营销术语”。知乎一边喊 AGI 来了,一边说 AGI 是营销——他不是精分,他是太懂这个行业的游戏规则了。
这笔账怎么算: 别拿 99.9% 当你升级的理由。跑分是它的肌肉,不是你的需求。
第二笔:钱包账——“AI 替你干活”,目前是个会员等级游戏
这是最该冷静的一笔,也是很多人刷屏时最容易忽略的一笔。
先说订阅。GPT-6 Astra 美东时间 9 月 3 日起向所有 Plus(20 美元/月)和 Business 用户开放。但"开放"不等于"够用"。
36氪那篇实测的作者用的是 ChatGPT Pro 订阅,也就是 200 美元/月那一档,做了"剪一支旅游 vlog + 搭一个艺术展网页"两个项目,一周用量直接烧掉将近 40%。知乎他的原话是:换做 Plus 套餐,“很明显做不了太多任务”。
翻译一下:"AI 替你干活"这件事,目前是个会员等级游戏。 200 美元一档的门禁卡,进门先烧掉四成额度;20 美元的 Plus,想让它接管电脑干重活,额度撑不了多久。
再说 API,这里藏着一个最容易被忽略的坑——“计费悬崖”。
Astra 的 API 定价是输入每百万 token 10 美元、输出 50 美元,是前代 GPT-5.6 Sol 的 2.5 倍。把时间线拉长看更扎心:今年上半年 GPT-5.4 还是 2.5 美元 / 15 美元,到 Sol 涨成 5 美元 / 30 美元,Astra 再翻到 10 美元 / 50 美元——一年工夫,旗舰 API 的单价翻了四倍。微博它还有 105 万 token 的超长上下文,听起来很爽。但 OpenAI 官方文档里有一条:当输入超过 272K token,整次请求都会进入更高计费档,输入翻倍到 20 美元、输出到 75 美元。知乎注意,是整次请求翻倍,不是只有超出的部分涨价。

举个简化例子:25 万输入 + 1 万输出,大约 3 美元;把输入加到 30 万,只多了 20%,但越过了 272K 这条线,总费用直接跳到 6.75 美元。输入涨两成,账单翻倍还多。这就是"计费悬崖"。所以那篇 API 拆解文给的建议很实在:把警告线设在 25 万,别等到 272K 之后才处理,更别因为"支持 105 万上下文"就一次把整个代码仓库塞进去。
最后是国内用户绕不开的现实:光是把钱付出去,本身就是一笔成本。信用卡支付失败、要靠 App Store / Google Play 礼品卡、“便宜渠道越来越不稳”,是知乎上一大片订阅踩坑帖的常态。还有个前车之鉴——8 月 13 日 Codex 额度重置后被大幅下调,引发过一轮争议。订阅本质是"自助餐",额度是会动的,别把今天的额度当成永久承诺。
这笔账怎么算: 有个简单的公式值得抄——用产品的价格,能替代你多久的有效工作?这些时间按你的实际时薪折算,值多少钱?如果 Astra 每月帮你省下的时间乘以你的时薪,大于订阅费,就值;反之,先别冲。
第三笔:脾气账——它太"客气"了,逼得官方亲自下场打补丁
这是发布后第一周才浮出来的坑,很多跑分文根本不会提。
Astra 在训练时刻意加强了"审慎性",主动追问澄清问题的频率比 GPT-5.6 更高。官方初衷是好的:少因为擅自揣测意图而返工。但代价很直接——它经常在你期望它一口气干完的地方,停下来等你。
社区里已经炸出一堆吐槽。有开发者让它改两行配置文件,它自发拉起整套回归测试,几十秒的活拖成几十分钟,官方文档里管这叫"测试洁癖"。知乎OpenAI 官方论坛有用户发帖,说 GPT-6 在 Codex 里把他每条指令都标记成违规,完全没法用。很多团队放在项目根目录的 AGENTS.md 规则文件,一旦互相矛盾,Astra 直接停摆,这叫"规则洁癖"。
逼得 OpenAI 在 9 月 5 日(据 The Decoder 报道)上线了一份 Astra 专属提示词指南,干了两件前所未有的事。
一是官方承认新模型"太客气",给了一段"行动倾向"(bias towards action)的指令,核心意思是:把"你能帮我""帮我看看"这类话当成"立即行动"的触发器;在建分支、改合并冲突、只读检查、起草 PR 这些可逆范围内自己推进到底;只有拿出可供人类核验的成果时,才允许停下来请求批准。
二是挂出一张官方定义的"烂词黑名单"(slop words),把 delve into(深入探讨)、it’s worth noting、Conclusion / In short 这类机械收尾、先否定再抬高的对仗句,成体系地封杀。这是 OpenAI 第一次用官方文档承认:大家骂了三年的"AI 味",是真实存在、可以列举、可以屏蔽的。知乎
这笔账怎么算: “提示工程已死"这句话,在 Astra 这儿可以休矣。模型从单轮对话进化到多工具自主推进后,模糊指令的代价,从"回答平庸"变成了"算力空转和无效委派”——你越是不把任务边界写清楚,它越是在错误的方向上非常努力。想让它真干活,你得学会用官方那套"行动倾向"指令,把可逆的活授权给它、把验收标准写明白。
第四笔:真活账——它到底能干啥、干不了啥
抛开跑分和脾气,回到最实在的问题:它真动起手来,什么水平?
36氪那篇实测,把 GPT-6 当成一个来应聘的剪辑实习生,打开了 Computer Use 功能,把一台装了达芬奇的电脑直接交给它,让它剪一支"云南汤丹镇"的旅游 vlog。结果是这样的:第一版 54 秒,从拿到需求到交活 55 分钟,慢节奏、调色质感不差,及格;贪心让它再剪一版"更有冲击力的",第二版 42 秒塞了 69 个镜头,“乱,非常乱”,上一镜主体在左边,下一镜要看的跑去右边;来回三轮,第三版才勉强能看。三个版本加起来不到 6 小时。
6 小时是什么概念?一个人类剪辑师接这活,光素材归类就得干一上午。速度本身才是最吓人的地方。但"快"不等于"好"——切得快不难,难的是切得顺,这些说不清道不明的东西,AI 第一轮根本想不到。
第二个项目,让它配 Blender 做一个埃舍尔线上艺术展网页,需求里故意只写了句"世界顶级的效果"。46 分钟网页出来了,开场大卫头像能拆开能拼回,挺唬人。但细看露馅:那个精细的大卫雕塑其实是"贴图作弊",正面看挺好,绕到后脑勺就穿帮;后半页直接开始换图文,“逛展逛到一半,忽然开始翻课件”。
另一位试用一周的作者,给了个更接地气的正面案例:让它整理一堆散乱的发票 PDF,分类、提取金额、填进 Excel、归档到文件夹。以前的 AI 会告诉你"你可以用 Python 的 pdfplumber 库……",GPT-6 直接打开文件夹一张张干。这是从"AI 辅助"到"AI 执行"的质变。但他也抓到一个细节:GPT-6 操作电脑时,偶尔会把"取消"当成"确认"来点——因为它靠视觉识别屏幕元素,不是真理解了按钮的语义。视觉识别能打 99 分,语义理解可能只有 60 分。知乎

把这些拼起来,目前最清醒的判断是这句:被攻下的不是某个职业,是每个岗位里那段"标准化的、能被写进文档的"流程。 整理项目、统计数据、输出文档、传统前端、产品测试,这些有文档、有流程、有协议限定的活,AI 已经能接住了。知乎剪辑师不会失业,但"把素材按格式归类统一"这部分没了;程序员不会失业,但"照着设计稿写页面"这部分没了。

这笔账怎么算: 业内给"会用它"的方法起了个名字,叫 Spec Coding,把它当成第一天上班的实习生,别许愿,交代清楚,能验收的标准写明白。对应的老路叫 Vibe Coding,说难听点,许愿式编程。你的需求描述,才是拴住这头牲口的缰绳。
对号入座:到底该不该升级?
把四笔账合起来,给三类人三个打法。
第一类,已经在用 ChatGPT / Codex 干活的重度用户和开发者。 值得升级体验,但别盲目上 Pro。先用 Plus 把 Astra 接进你最高频、最"标准化、能写进文档"的那段流程,比如发票整理、数据汇总、传统前端、产品测试这类,用一周看它到底替你省下多少有效工时,再决定要不要为 Pro 的额度掏 200 美元。接 API 的,把上下文警告线设在 25 万,离 272K 那条"计费悬崖"留足余量。
第二类,被"AGI 刷屏"种草、还没付费的观望者。 先别冲 Pro。你的需求如果还停留在"帮我写个总结、聊聊天",Plus 甚至免费版就够,Astra 的长任务能力对你是浪费。真正该做的,是先练"把需求说清楚"这件事——门槛全在"会提需求"上,这个能力比订阅档位保值得多。
第三类,国内用户,尤其是支付和网络本身就费劲的。 把"订阅成本"算成"订阅费 + 支付折腾 + 额度可能下调"的总和。8 月 Codex 额度下调的前科提醒我们,别把今天的额度当永久承诺;先按月订、别一次性年付,给自己留退出的余地。
继续观察的三个信号: 一是 OpenAI 会不会补上 GDPval 成绩,或者干脆给出"脚手架版"和"裸模型版"两个分数;二是 Plus 档的 Astra / Computer Use 额度会不会进一步收紧;三是官方那份"行动倾向"提示词指南用一段时间后,“测试洁癖”"规则洁癖"的吐槽会不会降下来。这三条只要有一条变了,上面的结论就得重新算。
最后说一句。传说中的 AGI 没有在那个凌晨降临,让无数人"天塌了"的现况也没出现。但干活的样子,确实在变。跑分是它的肌肉,你的需求描述才是缰绳——掏钱之前,先想清楚你要它替你干的是哪段活,这段活,值不值这个价。