OpenAI首款推理芯片跑分实测:比英伟达快4倍,但三件更要紧的事没测

源自46位全网作者

03:11

过去这48小时,AI圈只有一个主题:推理

8月24日,英伟达宣布Vera Rubin机架级系统全面投产,同步投产推理加速器Groq 3 LPX;8月25日,OpenAI在HotChips大会上公布首款自研推理芯片Jalapeño的首份公开跑分;同一天,苹果还把全球首款量产2nm芯片M6塞进了Mac mini。再算上这一周的其他消息——小米一口气端出三颗玄戒芯片、国产推理芯片公司曦望再融20亿元估值四个月翻倍到200亿、国产GPU四小将在科创板聚首——可以毫不夸张地说:整个行业把主战场从训练挪到了推理。

很多人刷到过"OpenAI自研芯片跑赢英伟达"的标题就划走了。今天我们慢下来做两件事:第一,把Jalapeño的成绩单读一遍;第二,搞清楚这张成绩单里,哪些数字能信,哪些要先放一放。

一、为什么所有人都盯上了"推理"

先交代背景。AI消耗的算力分两块:训练和推理。前两年最贵的是训练,一个大模型"炼丹"就是烧掉几千万美元的奇观;今年开始,结构变了。

Agent批量进入生产环节,一次任务可能发生几十次模型调用,24小时不间断的推理和token生产,成了算力消耗增长的重点。36氪偏偏今年夏天,Kimi K3、MiniMax H3、DeepSeek-V4等开源模型又陆续发布,AI Coding、视频生成、办公需求同步提速,这类任务全是长上下文、多轮调用的吞金兽。推理,也就是真正产出token的环节,就此变成算力消耗的主力。

更直接的证据是,头部模型公司的算力清单已经开始"去英伟达化":Anthropic训练用谷歌TPU、推理用AWS Trainium,英伟达GPU退居"研究探索"的第三选项。微博当模型公司把大头的钱花在推理上,它们自然会开始算一笔账:为通用GPU付的溢价,到底值不值?

一旦认真算这笔账,推理专用芯片就成了必然选择。

二、Jalapeño的成绩单,三个数字读懂

跑分公布的舞台是HotChips大会,由OpenAI硬件负责人Richard Ho亲自揭晓,测试基准用的是SemiAnalysis的公开工具InferenceX,被测模型选了三个公开大模型:自家的GPT-OSS 120B,以及竞品DeepSeek R1(670B参数)和Kimi K2.5(1T参数)。知乎对照组,是英伟达当下最先进的推理平台GB300系统。三个数字值得记住:

① 每千瓦干的活:1.5到1.9倍。同样的电费,Jalapeño能多产出1.5到1.9倍的token;以GPT-OSS 120B为例,每千瓦每秒能处理约8.54万个token。36氪

OpenAI首款推理芯片跑分实测:比英伟达快4倍,但三件更要紧的事没测

② 单用户速度:约4倍。低延迟场景下跑DeepSeek R1,单用户生成速度最高约700 token/s,而GB300只有约169 token/s。36氪这意味着"AI思考中"的等待时间被压缩了约四分之三。

OpenAI首款推理芯片跑分实测:比英伟达快4倍,但三件更要紧的事没测

③ 同速并发:9倍以上。把服务质量固定在100 token/s/用户的主流水平,跑万亿参数的Kimi K2.5,Jalapeño的吞吐量是GB300的9倍以上——同样的服务质量,它能同时接待9倍的用户。36氪

而这份成绩单,出自一颗从初始设计到流片只用了9个月的芯片,同级高性能ASIC的常规周期是18到24个月起步。36氪

造芯提速的关键,是用AI造芯:在GPT-OSS的部分模块里,AI生成的kernel比人工专家手写的版本快1.5到1.8倍;借助Codex和GPT-Astra,OpenAI只用约两个月就完成了DeepSeek R1和Kimi K2.5向新芯片的移植优化。36氪

这颗芯片的设计哲学一句话就能说清:少搬数据。大模型推理的瓶颈不在算力,而在每生成一个token,都要把巨量的模型权重和KV缓存从内存搬进搬出,通用GPU的算力单元大半时间不是在计算,而是在等数据。36氪所以Jalapeño把计算核心和HBM4内存切成一一对应的"切片",每个核心对自己的那片内存有低延迟直达通道,单封装内存带宽做到15.4TB/s,额定功耗700W。36氪它也没有学英伟达Rubin把prefill和decode拆给两种芯片,理由很实在:真实流量构成天天在变,按固定比例配两种芯片,等于制造闲置。

三、但是:三件事没测

成绩单很亮眼,但我劝你保持一点清醒,因为有三个关键问题,它没回答。

第一,没测需求最爆的场景。所有公开跑分都来自约8k输入、1k输出的单轮推理,这是相对容易调优的负载。36氪

OpenAI首款推理芯片跑分实测:比英伟达快4倍,但三件更要紧的事没测

而长上下文、多轮交互的Agent任务——恰恰是当下增长最猛的推理需求,也最考验路由、前缀缓存这些系统真功夫——OpenAI一个公开数字都没给。36氪

第二,成绩单是自己出的。跑分数据主要由OpenAI提供,SemiAnalysis只是进实验室现场见证了运行,并未独立完成全部测试。36氪芯片价格、规模产能、部署良率、机柜与网络成本都没有公开,结果也没有独立复现。知乎也就是说,你只能看到"每瓦干多少活",看不到"每块钱干多少活",而后者才是推理生意真正的斩杀线。本周知乎上"最小化推理成本、最大化智能"的热问里,高赞答案甚至给出了相反的判断:大模型真正的斩杀线是算力,没有算力做啥都是白搭。知乎争议本身就说明:这事远没到下定论的时候。

第三,远没到量产。这颗芯片2026年底才会以"极小规模"部署,真正上量要等到2027年。36氪在此之前,所有数字都只能算"OpenAI自选条件下、OpenAI自报的成绩"。

所以我的判断是:方向性的领先是真的——专用架构做推理比通用架构高效,这条路已经跑通;但仅凭这张成绩单,还得不出"英伟达被打败了"的结论。每瓦效率更高会创造降本空间,但空间不等于已经落到账单上的降价。知乎

四、英伟达、苹果、小米、国产芯片,各答各的卷

英伟达显然也感受到了压力。Jalapeño跑分公布的前一天,英伟达宣布Rubin机架级系统全面投产,在ArtificialAnalysis基准下跑Gemma 4 31B,10万token长上下文场景做到每秒3400个输出token,比最接近的竞品快4倍;CoreWeave实测NVL72机架每兆瓦token吞吐量是上一代GB200的10倍。36氪去年200亿美元收购Groq之后,英伟达又把Groq 3 LPX推上Vera Rubin平台做推理加速器,按英伟达公布的AgentX基准数据,搭配DeepSeek V4 Pro的Rubin NVL72每兆瓦吞吐做到GB300 NVL72的30倍,对应每token推理成本降35倍。知乎注意,这也是厂商口径的数据,但态度很明确:英伟达要用系统级代际碾压,把单位token价格打下来。

苹果则走了完全不同的路:不参与云端每token的价格战。M6首发搭载于Mac mini,多线程性能较上代提升40%,双16核神经引擎带来翻倍的本地AI算力;同场的M5 Ultra把Mac的统一内存推到512GB,多台Mac Studio还能组集群跑分布式推理。36氪它赌的是:模型直接跑在你桌上的设备里,永远绕开按token计费。

小米押的是端侧推理。8月24日小米一口气发布了三款玄戒芯片,分别是AI旗舰SoC玄戒O3、AI加速芯片玄戒O100,以及智驾高算力AI芯片玄戒D100。36氪卢伟冰随后晒出O100原型机,由玄戒O3与玄戒O100双芯协同,内置MiMo大模型,推理速度可达每秒295 tokens。哔哩哔哩

OpenAI首款推理芯片跑分实测:比英伟达快4倍,但三件更要紧的事没测

国产推理芯片这边同样热闹。曦望近日再获新一轮20亿元融资,投后估值达到约200亿元,距离今年4月估值破百亿不到半年,接近翻倍。36氪资本用真金白银投的,就是"单位token成本"这条路线。

它今年1月发布的S3彻底转向推理专用架构:不追求训推一体,也不用昂贵的HBM,而是选择手机、笔记本常用的低功耗内存LPDDR,把显存"仓库"做大、把供应链握在手里——长鑫科技的LPDDR5X已在2025年量产。36氪

再往后看,赛道已经挤满选手:摩尔线程刚发布MTT S5000的Prefill-as-a-Service白皮书,直指长上下文时代"算力错配"这一推理成本核心瓶颈。知乎摩尔线程、沐曦股份、壁仞科技等已接连上市,拟上市队列中还有燧原科技、昆仑芯等选手。36氪

五、对你意味着什么:三个值得盯的信号

把所有信源对齐之后,我的判断分三层。

第一层,方向:推理成本长期下降,基本是确定的。专用ASIC(OpenAI)、系统级代际碾压(英伟达)、端侧本地化(苹果、小米)、低成本国产替代(曦望、摩尔线程),四条路方向不同,挖的却是同一个洞——把每个token的价格打下来。前NVIDIA工程师、Sail Research联合创始人Neil Movva在最近一次访谈里说,下一阶段真正重要的,未必是让聊天机器人再快一点,而是让智能体能够在后台连续工作数小时、数天,甚至数周。当推理系统从"答得快"转向"吞吐便宜",成本曲线还有很大的下行空间,他甚至预判AI推理成本可能再降1000倍。知乎

第二层,节奏:2026年还是"成绩单期",不是"交付期"。Jalapeño 2027年才上量,英伟达Rubin刚全面投产,曦望S3还处在"大规模交付能否站稳"的中点。今年所有的跑分大战,本质都是预选赛。如果你正基于本周的新闻规划企业的AI采购,或者盘算要不要为某个AI订阅升级付费,先别急——跑分不等于账单。

第三层,行动:三个值得存下来跟踪的信号。其一,Jalapeño 2027年是否如期上量、OpenAI会不会对外出售推理算力——它一旦开放外卖,推理价格战才算真正开打。其二,各家会不会补上Agent和长上下文的基准,并允许独立第三方复现——只有那种成绩单能定胜负。其三,更工程化的视角:单位token成本由模型架构、推理引擎与集群利用率三个变量共同决定。哔哩哔哩盯住这三个变量,比盯发布会PPT有用得多。

最后说句实在话:推理成本战对普通用户是绝对的好事——API更便宜、免费额度更多、本地设备的AI体验更强,都是这场战争的副产品。唯一要记住的是:赛场上烟雾很大,每张成绩单都是利益相关方发布的。把这篇存下来,下次有新的跑分公布,对着这三个数字核一遍,你就比90%的围观者看得明白。

内容由AI生成

精选参考来源

1. 曦望再融20亿元,四个月估值翻倍至200亿 | 独家

2. DeepSeek研推理芯片这个事情特别值得思考,Google的TPU;AWS的Trainium3;微软的Maia200;Meta的MTIA;OpenAI的Jalapeño;都在自己搞,现在问题来了,谁还在用老黄的英伟达呢。。。最值得玩味的是Anthropic:训练用谷歌TPU、推理用AWSTrainium、英伟达GPU退居为"研究探索"的第三选项(2026...全文

3. OpenAI 首款推理芯片,能把算力成本压到哪一步?

4. OpenAI 芯片实测跑分揭晓,「为模型造芯片」时代来了

5. AI 开始给自己造芯了,从零到生产 OpenAI 只用了九个月

6. 如何看待 MiniMax 闫俊杰提出「最小化推理成本,最大化智能」?这会改变大模型的「斩杀线」吗?

7. 推理成本降35倍,AI商业化的卡点从来不是算力

8. 小米低调发布三个芯片,不止瞄准AI手机|最前线

9. 卢伟冰晒出玄戒O100原型机,由玄戒O3与玄戒O100双芯协同,重构主板并搭载风冷散热,内置MiMo大模型,推理速度可达每秒295Tokens。

10. 摩尔线程发布《MTTS5000Prefill-as-a-Service技术白皮书》,破解长上下文推理成本瓶颈

11. 前 NVIDIA 工程师谈“Token 工厂”:AI 推理成本为什么可能再降 1000 倍

12. 2026.8.27【机构交流】大模型推理优化行业研究框架:模型架构、推理引擎与集群利用率共同决定单位Token成本

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章