当前位置:
AIGC文章详情

OpenAI 700瓦"辣椒芯片"首测碾压GB300:喊护城河击穿或做空英伟达之前,先看跑分表没写的三行字

源自27位全网作者

00:55

北京时间8月26日凌晨,Hot Chips 2026大会上,OpenAI交出了首颗自研推理芯片Jalapeño(墨西哥辣椒)的第一份独立基准成绩单。数字确实辣:在GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T三款模型上,每瓦峰值吞吐量是英伟达GB200/GB300的1.5到1.9倍,端到端延迟砍掉41%到72%。芯东西SemiAnalysis的评价更直接:“击败了我们测试过的每一款英伟达、AMD和谷歌芯片”。知乎

于是微博和知乎迅速分成两拨人:一拨喊"英伟达护城河被击穿",一拨泼冷水"屁的影响,台积电产能还在英伟达手里"。而今晚(美东8月26日盘后),英伟达就要发布FY27Q2财报。在你决定做空英伟达、或者开始等ChatGPT降价之前,先把跑分表看明白。

一、跑分是真的,但"104倍"不是你想的那个104倍

先说真实的部分。这次测试用的是SemiAnalysis的公开基准套件InferenceX,不是OpenAI自弹自唱:单用户峰值生成速度,GPT-OSS 120B跑到1459 token/s,DeepSeek R1 670B跑到700 token/s,分别是现有最优加速器的2.7倍和4.1倍;高交互负载下能效优势还能放大到2.1到4.1倍。未尽研究

OpenAI 700瓦

但营销号疯转的"104.3倍"有个前提:在"与现有最优加速器保持同等最高单用户解码速度"的条件下,每千瓦混合token吞吐是GB300的104.3倍。芯东西翻译成人话:想让GB300堆到同样高的单用户速度,它得付出巨大的功耗代价;在这个约束下比每千瓦效率,差距被放大到104倍。它量的是能效鸿沟,不是"综合性能104倍"。

OpenAI 700瓦

还有一个更实在的细节:Jalapeño额定功耗700瓦,这次测试负载下实际持续功耗没超过550瓦;对比的GB300是1400瓦。36氪对美国AI产业来说,这比"省钱"更兴奋——他们缺的不是钱是电,每瓦能承载更多请求,就意味着扩产更快、抢用户更快。

二、它为什么辣:不是为峰值参数设计,是为你的一次提问设计

传统GPU为某个阶段的峰值算力优化,Jalapeño为"一个请求从进来到出去"的完整生命周期优化。它把推理拆成预填充、草图(推测解码)、验证三种负载,但不拆成三颗芯片,而是在一颗芯片内部按阶段动态激活计算、内存、网络资源的组合,KV缓存留在本地——OpenAI在幻灯片上写的那句话是"Locality is king"。未尽研究

OpenAI 700瓦

更值得注意的是研发闭环:从底层设计到流片只用了9个月,靠的是"模型产生工作负载、工作负载塑造芯片、芯片运行模型、AI分析运行trace再反过来改软硬件"。未尽研究OpenAI用Codex搭配GPT-Astra,两个月就让三款本不在量产规划内的开源模型跑出了高性能。芯东西部分注意力与MoE算子,AI生成的代码性能是人类专家手写代码的1.5到1.8倍。

这颗芯片计划2026年底开始部署,第二代已深入开发、第三代开始成形。未尽研究换句话说,今天公布的是第一代的成绩,而这个闭环如果成立,后面每一代都会更辣。

三、跑分表没写的三行字

第一行:对比对象停在GB300。Vera Rubin已进入初期出货,Jalapeño的HBM容量和峰值算力都没压过GB300,更不用说Rubin。36氪它精准地停在了"上一代最强"的位置。

第二行:只干推理,不碰训练。CUDA在训练侧的护城河至今没有ASIC能撼动。而且就在公布跑分一周前的8月17日,OpenAI刚接受英伟达高达1050亿美元的数据中心融资担保。知乎OpenAI芯片负责人Richard Ho的原话是:“英伟达是很好的合作伙伴,我们依然需要大量英伟达芯片。”

第三行:真正的瓶颈是HBM4。Jalapeño每颗配6颗HBM4、共216GB,而三星、SK海力士、美光的HBM产能已预售至2027年,SK海力士CEO警告2027年供应最紧张。知乎讽刺的是,自研芯片的公司和英伟达抢的是同一批内存。

OpenAI 700瓦

四、和你有什么关系:三种人三本账

盯着英伟达财报的人:市场预期营收约920亿美元、同比+96%,数据中心约854亿美元;Jefferies更乐观看到950亿。知乎但过去四个季度英伟达次次超预期、财报后股价连跌四次,期权定价财报后双向波动约5.4%。摩根大通已经把"ASIC在推理赛道崛起"列为英伟达必须回应的核心问题——Jalapeño不是今晚股价的变量,是电话会上要听的那个答案。

等AI降价的人:推理占模型全生命周期成本的80%到90%,博通CEO说定制推理ASIC相比通用GPU能省约50%成本,Anthropic的推理基础设施毛利率只有38%、离IPO目标77%还差得远——成本曲线长期向下是确定的方向。知乎但Jalapeño 2026年底才开始部署,第一批目的是给OpenAI自己保产能,不是打价格战。订阅和API价格真正松动,现实一点要看2027年。观察信号就三个:年底部署进度、第二代流片、OpenAI自家前沿模型是否跑在Jalapeño上。

看算力链的人:这条新闻强化的不是"国产替代"叙事,而是HBM紧缺叙事——自研芯片的和买芯片的在抢同一批HBM4,"2027年最紧张"是全行业共同的供给约束。内存涨价的逻辑,比芯片跑分离你的账户更近。

OpenAI 700瓦

写在最后

辣椒是真的辣,但它烤的不是今晚的英伟达,而是未来两三年的推理成本曲线。跑分表上没写的那三行字——对比停在上一代、训练护城河没动、HBM4要抢——比跑分本身更值得读。三年后回头看,2026年8月25日可能正是AI算力从"一芯通吃"走向"训推分家"的拐点;但拐点不等于终点,米其林餐厅还是那条街上最好的餐厅,只是最好的客人,开始自己建食堂了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章