两天前,你的信息流大概率被「OpenAI 吊打英伟达」这类标题刷过屏。关注 LLM 推理的人应该清楚:事是真事,但「吊打」「碾压」这种标题,基本不能作为判断依据。这篇把 OpenAI 自研推理芯片 Jalapeño 首测捋一遍——数字是什么意思、折扣在哪里、和你付的 token 有什么关系。
一、先对齐这份成绩单
美国时间 8 月 25 日,OpenAI 公布了首款自研推理芯片 Jalapeño(墨西哥辣椒)的首批测试结果。测试选了三个公开模型:GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5,按照公开信息,是与 SemiAnalysis 在 InferenceX 基准上共同完成的。微博 核心结果:
DeepSeek R1 的每瓦 AI 吞吐量约为 GB300 的 1.7 倍,端到端延迟只有对手的 28% 至 59%。微博
放到全部三组模型上,峰值每瓦混合 Token 吞吐高出对照系统约 1.5–1.9 倍,端到端延迟由 1.80–5.99 秒压至 1.03–1.65 秒。哔哩哔哩
媒体贴出的输出数据更直观:Jalapeño 一秒能吐 1459 个 Token,英伟达 GB200 只有 535 个,完成同一个任务「辣椒」只要 1.65 秒。微博

再看硬件。这颗芯片由 OpenAI 与博通合作开发、台积电 3nm 代工,从架构设计到流片只用了 9 个月,行业惯例是 18–24 个月。知乎 工艺为 N3P,配 HBM4。微博
功耗是对比的重点:Jalapeño 是 700W,对标跑赢的英伟达旗舰 GB300 功耗为 1400W。知乎 部署节奏上,OpenAI 计划 2026 年底小规模部署,目的写得很直白:降低推理成本。微博
二、为什么胜负标尺从 TFLOPS 换成了「每瓦 Token」
这是整件事里最值得消化的一点。训练是一次性成本,推理是持续流血。模型上线之后,每个 token 都要实时算出来,推理阶段的大头开销是折旧和电费。通用 GPU 拼的是 FLOPS,但 LLM 的 decode 阶段是内存带宽瓶颈——卡的是「权重搬得多快」,不是「算术算得多快」,训练时代好用的 FLOPS 数字,和推理体验的对应关系很弱。
而 Token/kW 直接对应「一度电能吐多少 token」,把效率和运行成本直接挂钩。这正是推理专用 ASIC 的逻辑:砍掉通用 GPU 为通用性背负的部分。社区对 Jalapeño 架构的拆解是:不做统一大缓存,计算核心与 HBM 一对一绑定,采用 CPU 式的乱序执行,KV Cache 尽量原地不动、避免数据搬运,暂时用不到的单元进入 dark silicon 省电。知乎 通用 GPU 贵在「什么都干」,推理 ASIC 赌的是「只干推理,但干到极致」。

三、但先别急着嗨,记住三个折扣
纸面数据确实诱人:在吞吐与端到端延迟的对比里,Jalapeño 的延迟只有对照系统的 28%–59%。微博

但兴奋之前,记住三个折扣。第一,口径是半个自报的。测试是 OpenAI 自己联合 SemiAnalysis 跑的,第三方独立复测还没跟上,package 功耗和数据中心总功耗之间也有口径问题。哔哩哔哩 社区的质疑也很具体:产能能出来吗?良率呢?整个系统层面的软优化呢?有用户直接点出,这些才是达子的隐性 moat。微博
第二,生态欠账是真实存在的。这次测试里有个细节:Jalapeño 要测 DeepSeek R1 的表现,需要 MLA 内核支持,但 OpenAI 自己不用 MLA,所以压根没给它写过对应内核。知乎 每一个开源模型乘每一颗 ASIC,都是一笔内核欠账。CUDA 生态是英伟达最深的护城河——芯片可以追平纸面数据,生态追平需要时间。
第三,这不是一场简单的替代戏。首测数据公布前后,英伟达刚同意为 OpenAI 高达 1050 亿美元的数据中心融资提供托底担保。微博 供应商、最大客户、股东是同一个主体,自研芯片里有多少是降本、有多少是谈判筹码,可以自己品。
四、你可能最关心的问题:token 会便宜吗
传导链是三段:芯片降本 → 部署降本 → API 降价,每一段都有漏损。第一段还在纸面;第二段要看产能和良率,2026 年底只是小规模部署,离扛起主力流量还远;第三段由厂商定价策略决定,降本不等于降价。
但也不必押注单一芯片。Anthropic 刚放弃了 70 亿美元收购 MatX 的计划,转向合作自研芯片。微博 谷歌 TPU、AWS Trainium、Meta 的自研芯片也都在推进——头部模型厂和云厂商同时在优化同一个成本项时,行业推理成本曲线的方向是确定的:向下;不确定的只是下降速度,以及谁先把红利让渡给用户。
两条可操作的建议:
付 API 钱的人:重推理、长上下文这类场景的性价比窗口会持续打开,别锁定长期固定价格,盯「自研芯片部署 + API 调价」的组合信号。
自建本地的人:推理 ASIC 的普及不会直接改变本地显卡的逻辑,但云端推理价格长期走低会压制租赁基准价,间接影响二手卡的价格预期,可以慢慢看。
值得继续盯的信号
第三方独立复测数据,尤其是与 OpenAI 无合作关系的机构;
2026 年底小规模部署的实际落地进度;
内核生态对 MLA 等新架构的适配进展;
模型厂 API 的价格调整——那是降本真正传导到位的唯一证明;
国产推理芯片何时拿出自己的每瓦 Token 数据。
这件事的信号意义,不是「某颗芯片赢了」,而是推理成本战争从传闻进入了实测数据阶段。你付的每一个 token,从此会有越来越多的人想办法把它压便宜。