GPT-6 Astra 全量推送第一天:先删掉你攒的 AGENT.md,再算清额度、降价、换模型这三笔账

源自33位全网作者

04:35

9月5日凌晨,ChatGPT 的模型列表里多了个 GPT-6 Astra,当天 API 同步开放。比发布本身更热闹的,是社区集体算账:有人用 high 模式随便问了几个问题就把5小时限额烧穿,有人对着第三方"比官方便宜78%"的对比页心动,还有人突然发现——自己过去几个月攒的提示词和 AGENT.md,好像一夜之间过时了。

这两天我把界面新闻的快讯线、知乎卡兹克的整夜实测、微博和B站的讨论帖翻了一遍,把官方宣称、第三方实测、社区算账拆开摆给你。看完你会知道:今天最不该做的操作,是急着把旧提示词往新模型上原样搬。

一、先摆事实:72小时里挤进来的四件事

把时间线拆开,避免被"AGI来了"的情绪带着走:

  • 9月3日美东早间OpenAI、Anthropic、xAI 旗下模型集体服务中断,数万名用户通过 Downdetector 报障,谷歌 Gemini、微软 Copilot 同期大量宕机,疑似关键底层设施 Cloudflare 出问题。发新模型和全网宕机撞在同一天,这个细节很多人没注意。

  • 同日:OpenAI 正式发布 GPT-6 Astra,官方口径是"全球最智能、对齐程度最高的模型",在计算机操作、网页浏览、软件工程、网络安全、科研方面宣称当前最先进。官方基准:FrontierMath Tier 4 得分 97.6%;ARC-AGI-3 从 GPT-5.6 Sol 的 7.8% 跳到 99.9%,接近满分;相比 Sol,单任务成本降低 57%、单任务耗时减少 47%。界面新闻 总裁 Brockman 收尾一句"欢迎进入AGI时代"。

  • 前一天(9月2日):Anthropic 发布 Fable 5.1 和 Mythos 5.1,缓存读取价格下调 75%,典型工作负载成本降约 25%,智能体任务最高降 45%。两家在24小时内对着出牌。

  • 9月5日凌晨:Astra 向所有订阅用户推送,API 同日开放,多模态是这次的重点,视觉输入、图像理解在 API 里都能调用。微博

先立个规矩:FrontierMath 97.6%、ARC-AGI-3 99.9%,这些目前全部是官方口径,第三方榜单还没出来。发布会规律你懂的——数字最炸裂的时候,往往是还没人复测的时候。

二、实测侧:什么变了,哪条对你有影响

知乎数字生命卡兹克 9月5日发的全天实测,是目前中文圈细节最多的一份(单一作者体验,供参照,不是结论):

  1. 速度是真的快了一截。他给的时间账:GPT-5.6 Sol 做一个大型系统审查要20分钟起步,Astra 10分钟;操作电脑、操作浏览器"起码快了一倍的时间";此前 Sol 修一个 bug 要3个多小时,被社区吐槽"没法用"。知乎 但他自己也泼冷水:这可能是把算力全调给了新模型,“鬼知道一两周以后会不会又慢回去”。

  2. 多模态是这次最超预期的部分。他把一张家居照片丢给 Astra,让模型"识别其中的场景类型、空间布局、主要物体、材质、色彩和视觉风格",还原成可交互的3D场景——能旋转缩放、点开单个物体看详情、加灯光流水烟雾等动态效果,同样的提示词在 Sol 手里产出"很抽象、很草率"。知乎 这才是多数人口中"多模态终于有用"的意思:不再是看图说话,是看懂之后重建和干活。

  3. 额度规则对 Claude 用户是个刺激点:卡兹克的原话是 OpenAI 不搞"Fable 5 只能占总额度50%"那套,Astra 实打实按100%额度计。知乎 Codex 还上了跨窗口笔记机制,旧窗口里的消息和工具结果也能搜回来,但目前是实验性功能,要手动发提示词开启。另外一句值得记下的大实话:纯速度和交互丝滑度上,Astra 还是比 Grok、Gemini 慢。

三、三笔账:额度、降价、过期的对比页

第一笔:订阅额度账。 微博和知乎两边都有人吐槽 Astra 的额度消耗:开 high 模式随便问几个问题,5小时限额就用完了。知乎 这其实是个使用策略问题——聪明模型的单次输出质量上去了,但思考量也上去了,重度用户这两周该做的是把任务分级:能用默认档跑的不碰 high,重构、审查这类长任务留着额度集中干。卡兹克的原话是攒了三张重置卡"没打过这么富裕的仗"——重置卡该用在新模型蜜月期,别攒到过期。

第二笔:API 成本账。 官方说单任务成本降57%(vs Sol),但你的账单降没降57%,得拿自己的真实负载跑一遍才知道。更重要的是一个已经发生、很多人没反应过来的事实:8月21日 GPT-5.6 已全线降价,知乎一个34.8万浏览的核价帖发现,大量"比官方便宜78%"的第三方对比页,参照的旧价目已经过期——用新价目一算,有服务商比官方还贵10%。那位作者的总结值得裱起来:比价主张是有保质期的。知乎 你现在看到的任何"XX平台打折"话术,先确认它对比的是8月21日之后的价格。

第三笔:换阵营的账。 如果你主力是 Fable 5.1:别慌,Astra 的编程"追平"目前只有一个重度用户的体感,而且 Fable 5.1 在自家最硬核的科研基准上是真赢了——Terminal-Bench-Science 得分从上一代 24.7% 飙到 52.6%,把 GPT-5.6 Sol 的 22.4% 甩在身后。界面新闻 两边对线至少持续到第三方榜单出来那天,评测没出之前都别迁,迁移成本才是大头。

四、今天最该做的操作:删规则,不是搬 prompt

这次发布最反常识的一条:你过去写的提示词约束越多,新模型可能越蠢。OpenAI 的官方提示词指引明确说了这件事。知乎 卡兹克给了个很形象的比喻:你之前给 GPT-5.6 Sol 写了一万字行动手册,是因为它像个不靠谱的小学生,不限制就出错;现在招了个博士生,还拿小学生的手册管他,那就是太蠢了。他自己上线第一件事就是把全局规则文档做大幅简化,只留下偏好和实际情况。知乎

可操作的步骤:

  1. AGENT.md、系统提示词按三类过一遍:业务约束保留、格式偏好保留、行为补丁删——“不要幻觉”“请先思考”"不确定就说"这类当年防笨措施,在新模型上大概率是负资产。

  2. 删完跑一遍你最有把握的老任务对比质量,确认没有回退再全量切换。

  3. 跨窗口笔记是实验功能,"省额度"是作者体感,官方正式上线前别围绕它设计工作流。

五、人群怎么办:谁现在就换,谁等一周

  • ChatGPT 订阅重度用户(代码、Agent、图像/文档日常):直接切,头两周是算法红利期(新模型刚上、算力倾斜),记得用默认档省额度。

  • 轻度用户:感知不明显,不用为它做任何改变,原有习惯继续。

  • API/工作流开发者:先删规则再调参,同时把账单脚本里的价格基准更新到8月21日之后。

  • Fable 5.1 主力:等第三方编程评测再动,两边的官方基准各有各的赢面。

  • 观望国产/本地的:这轮价格战把国产模型的姿态放得很低——Qwen3.8-Flash 训练成本仅约为 Qwen3.7-Plus 的九分之一,GLM-5.3-Flash 的 API 定价只有 GLM-5.3 的十分之一(证券研报口径)。界面新闻 价格差在快速收窄,但 Astra 这次秀的"一张照片→可交互3D场景"这类多模态干活能力,体验层差距还是肉眼可见。预算敏感选国产、体验敏感尝鲜 OpenAI,这条判断短期没变。

六、接下来盯三个信号

  1. Astra 的速度能不能撑过两周——"算力全给新模型"是透支还是常态,两周后老用户自然见分晓;

  2. 第三方榜单对 97.6% / 99.9% 的复测——官方数字落地成什么样,等 ARC 独立跑分和各家评测;

  3. 跨窗口笔记转正——它决定 Codex 长任务的额度消耗曲线,实验功能变正式版的那天,才是工作流该重构的那天。

这次 GPT-6 给你最大的成本不是订阅费,是过期信息:过期的价目表、过期的提示词资产、过期的使用习惯。模型进入 AGI 叙事没关系,你先把自己那份 AGENT.md 删干净,再把账算对。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章