Ultrafast 提速 14 倍:价格没公布,产能排到 2028 年
9 月 27 日,OpenAI 的 API 文档里多了一个没官宣的入口:Playground 的隐藏速度选项,Standard、Fast、Ultrafast 三档并排。后者官方口径是最高提速 14 倍。
而它背后的 750 兆瓦机房,早被写进合同,档期排到 2028 年。
这不是一次普通的功能预热。它把一件很少被摆到台面上的事挑明了:模型的快,正在被当成一种可以单独定价的资源。
Ultrafast 是 OpenAI 预览中的高速服务档位,跑的是 GPT-5.6 Sol,输出速度最高 750 tokens/s,官方称最高比标准模式快 14 倍。
先把最容易混的地方说清。这不是一个新模型,是同一个模型换了一条路给你。

藏在 Playground 里的三档速度
一句话讲清:Ultrafast 是同一个模型的速度档位,跟模型强不强没关系。
OpenAI 此前正式预览过搭载 GPT-5.6 Sol 的 Ultrafast 模式,输出速度最高 750 tokens/s,官方口径是最高比标准模式快 14 倍,目前仅向部分客户开放。IT之家 9 月 27 日的爆料说,Platform 和 API 文档里已经出现 Ultrafast 相关文档,Playground 里还藏着 Standard、Fast、Ultrafast 三档处理速度选项。
拆开看,这个三档和 OpenAI 已有的服务层级是两套逻辑。按需求弹性调层级的 flex 是便宜但慢,priority 是贵一点但排队靠前,它们管的是"你愿意为排队付多少钱"。Ultrafast 管的是另一件事:你愿意为每秒多出几百个 token 付多少钱。同样的提问,同样的回答质量,只是等待变短。
放到场景里。一个做语音客服的团队,一轮对话里模型要接在语音识别和语音合成中间,用户能忍的沉默大概只有几百毫秒。标准档下,模型说一句话要两三秒,电话那头的人已经以为掉线了。Ultrafast 缩短的正是这一段。
750 tokens/s 是怎么跑出来的
答案不在模型里,在芯片里。
主流 GPU 做推理有个绕不开的物理限制:一次前向计算要反复去卡外的显存(HBM)取数据,再在网络互连上跨服务器搬运。模型权重越大,搬运的次数越多,每一次都加一点延迟、耗一点电。这套结构的上限,是显存带宽和互连带宽,不是算力。
Cerebras 换了一条路,把整片硅晶圆当成一颗芯片用:46,225 平方毫米,是 H100 单芯片面积的 57 倍,4 万亿个晶体管,90 万个 AI 优化核心,44GB 片上 SRAM,片上带宽 21 PB/s。权重和中间结果尽量留在片上,不用来回搬。搬运这一环被省掉,token 才跑得起来。
对比一下量级。GPT-5.5 XHigh 大约每秒 70 到 100 个 token,多数生产环境的模型在每秒 150 个 token 上下。750 是这条基线的大约 5 倍,是上一代高配的 7 到 10 倍。
但这里得踩一脚刹车:token 生成快,不等于你感觉快。
真正决定体感的是两个不同的指标。首 token 时间(TTFT)是从发出请求到第一个字出现,卡在网络往返、排队、预填充计算上;token 间隔(ITL)才是后面每个字之间的间隙。有从业者的实测总结说得很直接:一个 provider 就算跑到每秒两千个 token,但如果首 token 要等 4 秒,用起来照样慢;反过来首 token 只要 200 毫秒但每秒只吐 30 个 token,开头很顺,长回答会卡。
Ultrafast 赢在持续输出那一段。
它能不能同时把首 token 时间压下来,官方并没有给公开数据,这一点得等真正开放的实测。
为什么 Agent 会把这个数字放大
单次聊天,快 5 倍只是少等几秒。但今天真正烧钱的用法,是让模型连续调几十次。
一个企业级智能体完成一件后台事务,中间可能串起 30 到 40 次模型调用:读日志、查代码变更、判断原因、写修补方案、再验证一遍。每一次调用的延迟都会叠加。标准档下每一步等 3 秒,40 步就是两分钟;每一步压到 0.6 秒,整条链变成二十几秒。用户对同一个产品的评价,"能用"和"卡"之间就差这一层。
OpenAI 自己列出的高价值场景也是这个方向:故障还没恢复时就在分析日志和代码变更、交易进行中判断可疑行为、多步客服问题不打断对话、购物车被放弃之前解决结账问题、把原来要跑一晚上的研究变成一次交互式工作会话。早期客户 Podium 做语音 AI 的产品负责人说,速度完全改变了复杂通话的体验;Rogo 的应用 AI 团队的说法更实在,速度快不只是让产品感觉好一点,它改变了人真正会拿它做什么。
这里有个容易被忽略的连带效应。速度变快,单次调用省下的不只是等待,还有被等待掩盖的 token 消耗。Agent 之所以反复重试、反复确认,一部分原因就是每一步太慢,工程师宁可让模型多思考几次来减少人工介入。延迟降下来之后,"多调一次"的代价变了,任务链的设计也会跟着变。
三个数字决定你到底快不快
聊推理速度,最容易被一个数字带偏。业内公认要看的其实是三个:
首 token 时间(TTFT)是从请求发出到第一个字回来的时间,受网络往返、排队、预填充计算影响;token 间隔(ITL,也叫 TPOT)是第一个字之后每个字之间的平均间隙,决定长回答读起来顺不顺;吞吐量是每秒能出多少 token,只有在前两个指标可接受之后才有意义。
放到场景里更直观。语音 Agent 一轮对话的预算大概 1 秒,其中语音识别端点检测约 150 毫秒,语音合成首字节约 150 毫秒,播放启动约 50 毫秒,留给模型的时间只有 600 毫秒左右。超过这个数,用户就会觉得对面那个 AI 反应慢,跟模型多聪明没关系。
这也是为什么"每秒两千个 token"的广告数字常常靠不住。一个 provider 吞吐再高,首 token 要等 4 秒,聊天体验依然是慢的;另一个首 token 只要 200 毫秒、每秒只吐 30 个 token,开头很顺,长回答照样会卡。
快芯片不一定更便宜
那为什么不干脆全换成这种专用芯片?因为每秒的 token 是买来的,不是白来的。
Cerebras 走的是定制晶圆路线,单位推理成本明显高于通用 GPU 集群。它的优势在短上下文、突发型负载和模型能装进片上的场景;一旦前缀特别长、缓存命中率又低,预填充那一段的账就要重新算。
通用 GPU 这边也没停着。把模型权重压到 NVFP4、FP8 这类低精度格式,显存带宽占用和预填充计算大致减半;把稳定的系统提示词缓存起来复用,预填充里最贵的那部分可以省掉六到九成;再加上小模型先猜、大模型并行校验的投机解码,草稿和答案越一致(代码、结构化输出、固定人设的对话)收益越高,实测常见 1.5 到 4 倍。
三条路叠在一起,通用 GPU 上的开源模型在真实负载里能追上不少差距。Cerebras 真正打不下来的,是"前沿闭源旗舰模型跑到这个速度档"这件事本身——这条路目前只有 OpenAI 加 Cerebras 组合能提供。
所以 Ultrafast 的定价逻辑不只是快,还有稀缺。
真正的门槛不是工程,是瓦特
如果只看技术,这条新闻没什么悬念:文档里出现了入口,DevDay 临近,扩大开放是顺理成章。
卡住进度的是另一件事。
Cerebras 和 OpenAI 的合作不是普通采购。2026 年 1 月 14 日双方公布的首笔推理协议价值超过 100 亿美元,OpenAI 部署 750 兆瓦的 CS-3 算力,支撑 ChatGPT 和 API 的推理负载;随后扩大为价值超过 200 亿美元的多年期主协议,同样的 750 兆瓦部署到 2028 年,并附带 2029 到 2030 年最多再加 1.25 吉瓦的选择权。协议里还有一笔 10 亿美元的营运资金安排,附带可认购最多 3340 万股 Cerebras 股票的认股权证,若全部行权,OpenAI 大约能拿到这家公司 11% 的股权。
750 兆瓦不是一个小数字。它是一个必须提前几年下单、逐机架交付的物理量。
这块芯片的部署又特别占地方。一颗 WSE-3 的物理尺寸远大于常规 GPU,一个模型副本要吃掉几十套晶圆级系统,这种配置扩起来只能一批一批来。OpenAI 的做法也印证了这一点:先用预览期摸清哪些负载真的受益,再决定产能往哪儿排。
所以"扩大开放范围"大概率不会表现为所有人第二天都能调到那一档。它更可能先变成更长的申请队列,和一份更细的分级价格表。
三个容易看错的判断
常见说法一:"14 倍快"意味着任务快 14 倍。 这话有一定道理,因为宣传口径比较的就是输出速度。但它解释不了首 token 时间和排队时间,而这两项在真实使用里往往占大头:一个 provider 每秒吐两千个 token,首 token 等 4 秒,用户的第一印象依然是"慢"。更准确的理解是,14 倍指的是生成阶段的吞吐,端到端能快多少,取决于你的任务里生成占多大比例。
常见说法二:更快就一定更划算。 这也有道理,延迟本身就值钱,客服少沉默两秒可能直接换来成交。但它解释不了计费方式。Cerebras 的推理单价明显高于通用 GPU,Ultrafast 的具体定价至今没公布,业内普遍预期相对标准档有溢价。更准确的理解是,速度是买来的,值不值要看你的场景能不能把省下来的秒数换成钱——语音交互、实时风控、交互式调试能换,离线批处理换不到。
常见说法三:文档里出现了,就是明天能用。 有道理,因为文档先行确实是 OpenAI 惯用的预热节奏,DevDay 就在 9 月 29 日。但它解释不了产能约束。更准确的理解是,文档和隐藏选项说明产品在准备,扩大开放的时间点仍取决于晶圆级算力的交付进度。
一份能直接用的判断清单
要不要把关键链路切到 Ultrafast,可以用四个问题筛一遍:
第一,你的用户是否在等这一次输出。有人在等,速度直接换成体验;没人在等,速度换不成钱。
第二,你的任务链有多长。单次问答的收益很小,几十次调用的链式任务收益会被放大数倍,这是 Ultrafast 真正的主场。
第三,你的输出 token 占比。输出越长,按 token 计费的档位溢价越贵;输出很短的场景,溢价影响反而有限。
第四,你的缓存命中率。OpenAI 同期改进了 GPT-6 的提示缓存,官方举例说,几个月来的缓存改进让 GitHub Copilot 数十亿次请求中需要重新处理的 prompt token 比例下降超过 50%。稳定前缀走缓存、需要即时反馈的那一段走 Ultrafast,通常是更省钱的组合。
适用于有实时交互要求、且调用链较长的团队。如果你的负载是离线批量生成、夜间跑批,标准档或者更便宜的层级仍然更合适,这类任务对延迟不敏感,把它挪到最快档只是白花钱。
速度开始有自己的价格
把这几条线连起来看,方向挺清楚。
9 月 22 日,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,把中阶和轻量模型的价格砍了一半,Sol 做到每百万 token 输入 2 美元、输出 10 美元,还开始用"每个任务花多少钱"来跟对手比。几天之后,同一家公司又把速度单独拎出来,做成一个需要另行付费的档位。
一边把每 token 的价格往下压,一边把每秒的速度往上标价。这不是矛盾,是定价维度从一个变成了两个:算力按量卖,等待时间按性质卖。
对开发者的实际影响是,选型表要改一列。过去比较的是"同价位谁更强",现在得补上两列:你的任务链有多长,你的用户愿意等多久。模型能力、单位任务成本、延迟预算,这三样得一起算。
对普通读者来说,这件事的体感会晚一点到达,但方向不会变:以后你用的 AI 产品,越来越可能被分成"快"和"便宜"两种模式摆在你面前。选快的那档,账单由产品方承担,你只感觉到顺。
DevDay 上会不会正式公布 Ultrafast 的价格表,9 月 29 日见分晓。但真正的问题不在发布会现场,而在你自己的账单和延迟监控里。
你的产品里,哪一步是用户真的在等的?那一步,才是速度值钱的地方。
如果觉得今天这篇有启发,点个在看,顺手转发给需要的朋友;想第一时间收到推送,可以星标我⭐。
关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。
作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
