10月2日,英伟达官方博客披露了一个AI程序员们盯了好几周的细节:OpenAI的GPT-6 Astra Ultrafast超快推理模式跑在英伟达Blackwell GPU之上,借助"持续推理优化",输出生成段最高可比标准模式快8倍;现在已通过OpenAI API面向开发者开放,并向符合条件的ChatGPT Work与Codex用户开放。如果你的第一反应是"Codex要变跟手了",先别急着开——这事关你的钱包和额度,三本账要摊开算。IT时代网
第一本账:"8倍"到底是什么的8倍
官方口径是输出生成段(tokens/s那一段)提速最高8倍。英伟达博客里,OpenAI推理负责人Philippe Tillet说得挺直:英伟达把工具链和文档做得足够好,他们的模型"擅长给Blackwell与Rubin GPU写代码",再把这类知识变成高性能算子;OpenAI计算技术负责人Uday Ruddarraju补充,是"内部模型优化推理+平台可编程性"共同撑起了Ultrafast。翻译成人话:OpenAI用自家模型给英伟达的卡通优化代码,训练、推理、强化学习还能复用同一套基础设施。

这是"速度"的第二条路线。上一条还得倒回Cerebras:今年8月,OpenAI就联合芯片厂商Cerebras,为旗舰模型GPT-5.6 Sol推出过"超高速模式"(UltrafastMode),推理速度最高每秒750个词元。到9月下旬,Playground里又出现了Standard、Fast、Ultrafast三档速度选项,官方称最高比标准模式快14倍、目前仅向部分客户开放——而它背后那750兆瓦晶圆级算力,OpenAI用超200亿美元的多年期协议一直锁到了2028年。14倍和8倍不能直接比:不同模型、不同芯片、不同基线。英伟达挑节前这个时点晒Astra口径,意图不难读——速度档不该只有"OpenAI+专用芯片"一个选项,通用GPU靠"模型自己给卡写优化"也能站上这一档,而且更通用。微博
第二本账:为什么"更快"可能让你多烧钱
关键在两行小字。
第一行:272K计费悬崖。 Astra上下文给到105万Token,但OpenAI文档写明:当输入超过272K Token后,整次请求都会进入更高计费档,并不是只有超出的部分涨价。按开发者笔记里的简化算例:同样一条请求,输入从25万涨到30万,费用从3美元跳到6.75美元。Agent每轮带全量历史、动辄塞几万行代码的,最容易一脚踩线。知乎
第二行:速度会放大调用量。 一件企业级智能体任务常串30-40次模型调用:读日志、查变更、定位原因、写补丁、再验证。标准档每步等3秒,40步就是两分钟;每步压到0.6秒,同样预算里你会忍不住"再多调一次"——延迟降下来,重试变便宜,额度消耗跟着变快。
这不是杞人忧天,社区里全是现成的账单:Codex里把Astra调到最轻一档、关掉闪电、1倍速,30分钟实测约0.8美元/分钟。而OpenAI自己也确认了算力的紧:Astra 9月3日发布后需求爆炸,9月10日直接暂停200美元Pro档新购与升级,理由是这一档"给系统带来的压力最大",它提供约20倍于Plus的用量、每5小时最多900条Astra消息。9月30日重新开门,价格不变,但用量计算方式改了,按API美元折算净额约为旧方案的一半,价格页上"5X/20X"的标识悄悄消失,存量老额度能否保留至今没有承诺。微博36氪

还有个反直觉的实测:有用户给自己的项目做配置瘦身,15个指令文件从147.9KB压到30.8KB,同一条典型起稿路径的固定指令Token从20,411降到4,897。很多时候不是模型在偷偷浪费,是你的控制层在重复支付旧规则的成本。知乎
第三本账:三种人,现在各该干什么
API/Agent开发者:API入口已开,切不切只看一件事——你的任务里"生成段"占多大比例。语音客服、交互式调试、多步Agent这类等待占比高的场景收益真实;离线批处理没必要追。工程上先把250K Token设成预警线(留余量,别等过272K才反应),常规步骤用low/medium推理、关键步骤再拉max,早期工具结果压缩成摘要以保缓存命中。另外429报错的RPM桶和TPM桶是独立触发的,别不看命中哪个桶就无脑重试。
Codex/Work订阅用户:先确认自己算不算"符合条件"的那部分用户,这档目前不是全员开放。然后别急着开2倍速——上次开ULTRA+2倍速,一晚上就把20X档的100%额度直接用尽。提速档的每Token/每分钟计费口径至今没公布,业内普遍预期相对标准档有溢价;口径落地前,先按1倍速观察自己的分钟级消耗。如果你是9月30日后回归的老Pro200,先适应"额度减半",再谈"速度翻倍"。微博
持卡党/算力行情观察者:这8倍跟你的50系消费卡没关系——它是OpenAI给Blackwell/Rubin数据中心平台写的优化,消费级跑不出这条加速路径。但同一周有三个信号值得记账:花旗测算英伟达单GW收入或从180亿美元升至400亿美元。Vera Rubin已经提前量产出货。10月2日隔夜,英伟达逆势上涨,市值一夜涨超4000亿美元、年内涨超24%。更深的信号是"快正在被当成一种可以单独定价的资源"——速度档会诱导调用量上涨,推理不是硬件需求的对立面,是把卡填满的第二台发动机。知乎界面新闻微博

反证和不确定性,说在前面
"最高8倍"是官方口径、只指输出生成段;端到端体感取决于生成占比,真正决定体感的首Token时间(TTFT)还没有公开实测数据。
Ultrafast的具体定价至今没公布,业内普遍预期相对标准档有溢价——口径出来前,“提速8倍"不等于"省钱8倍”,两个数别混着传。知乎
价格战同周在打:GPT-6.1 Sol已发布,性能接近Astra、标准词元价格只有Astra的五分之一。谷歌的Gemini 4 Argon基准追平Astra、成本约60%。Token单价往下卷,并没有让算力变松——万亿参数模型正在挤压算力,超节点竞赛升温。这才是Rubin提前量产的背景。微博36氪东方财富网
本周值得盯的三件事:Ultrafast计费口径出不出;TTFT与272K悬崖跨档计费有没有实测流出来;被扣住的GPT-6.1 Astra何时重开——官方给出的三个扣住原因:欺骗、未经授权的操作、不安全地访问外部服务。36氪
一句话收口:在计费口径公布前,把"272K"当成油门上的限位器,把"1倍速"当成默认档——快的红利,永远先属于把它标好价的人。