昨日(8月26日),AI芯片圈被一条消息刷屏:OpenAI公布首款自研推理芯片 Jalapeño(墨西哥辣椒)的首批测试结果,在多项基准上跑赢了英伟达的 GB200 和 GB300 系统。大部分讨论都集中在"OpenAI终于自己造芯片了,英伟达还能睡安稳吗"。
但如果你关注 Cerebras 有一阵子了,应该会注意到这条新闻里藏着一个不太被提起的细节:这颗芯片的硬件层,是与 Cerebras 合作的。OpenAI 方面的 Tibo 公开表示,这一能力"得益于我们与 Cerebras 建立的深度合作,以及他们独特的硬件架构"。所以今天想聊一个讨论不多、但对关注 Cerebras 的人来说更要紧的问题:大客户自研芯片跑出成绩,对 Cerebras 来说,到底是赢还是输?
先把 Jalapeño 的成绩对齐一遍
外面传的数字已经开始失真了。值得认真看的数字是这几个:
在 GPT-OSS-120B、DeepSeek R1 670B、Kimi K2.5 1T 三个公开模型上,峰值每瓦吞吐是现有最佳系统的 1.5~1.9 倍;
高度交互式负载的性能优势为 2.1~4.1 倍;
端到端延迟降到对比系统的 1/1.7~1/3.6;
单芯片规格:216GB HBM4、15.4TB/s 带宽、13.4 PFLOPs MXFP4 算力,额定功耗 700W,测试负载下持续功耗不到 550W。

至于传得最吓人的"104倍",是有条件的:它把对方系统在最优 TBT(每 token 时延)下的用户速率固定住,再看每千瓦还能保留多少吞吐。知乎DeepSeek R1 这一项上,GB300 被压到 118 mixed TPS/kW,Jalapeño 还有 12,258,于是得出 104.3 倍。它不是假数字,但也不是通用数字——换一个工作点,倍数就回落到 1.5~1.9 倍的区间。做基准拆解的知乎作者说了一句很中肯的话:在第三方复测和年底生产数据出来之前,104.3 倍"适合当作一个端点能力证明"。

真正值得注意的是,这一轮推理芯片的竞争已经把考题改了:不再是"最高能跑多快",而是"用户不愿意等的时候,你还能服务多少请求"。
这跟 Cerebras 有什么关系
把最近半年的线头摆一排:
2月:OpenAI 与 Cerebras 推出 GPT-5.3-Codex-Spark,每秒千词实时编程;
5月:Cerebras 完成上市,同一笔交易里向 OpenAI 奉上 50 亿美元认股权证,媒体管这个叫"赎身契";
8月13日:Q2 财报公布,GAAP 营收 1.801 亿美元,同比增长 74%;
8月14日:ChatGPT 新模式 GPT-5.6 Sol 一夜提速 14 倍,每秒 750 个 token,跑在 Cerebras 硬件上;
与 OpenAI 的多年协议:最高 750 兆瓦、价值超 200 亿美元,分批交付到 2028 年;
8月18日:Cerebras 在 Supernova 发布会推出 CS-4 机架系统,宣称推理速度最高是 GPU 方案的 30 倍;
8月25日:Jalapeño 成绩公布,硬件合作方的名字是 Cerebras。
这条线串起来会发现:Cerebras 和 OpenAI 的关系,早就不只是"芯片卖家和客户",更像是 Cerebras 把自己嵌进了 OpenAI 的推理基础设施里——速度,就是它的入场券。

财报印证了身份切换
Q2 收入结构里:硬件收入 5410 万美元,同比下降 23%;云计算及其他服务收入 1.26 亿美元,同比大涨 281%,约占 GAAP 营收的七成。华尔街见闻今天的 Cerebras,主要已经不是卖芯片,而是卖"推理速度"本身——硬件是入场券,服务才是收钱的科目。
再算一笔 OpenAI 订单的账:200 多亿美元的多年期协议,大约相当于 Cerebras 全年核心营收指引(8.55~8.65 亿美元)的 23 倍。知乎这种订单既是护城河,也是缰绳——当一个客户的量级相当于你年收入的几十倍时,"客户"和"老板"的界限就模糊了。
奖杯的一面
第一,架构背书。看 Jalapeño 的设计语言:权重驻留、带宽优先、解码时延优先、模型状态尽量本地化——这套话术和 Cerebras 讲了几年的叙事高度一致。晶圆级芯片赌的就是一件事:推理慢,不是算不动,而是权重搬不动。WSE-3 Turbo 的片上 SRAM 带宽是 43,200 TB/s,单张 B200 的 HBM 带宽是 8 TB/s,差 5,400 倍。知乎现在 OpenAI 用自研芯片把这套哲学也验证了一遍,相当于全球最大的模型公司给这条技术路线联署。

第二,绑定加深。Gen2 已进入深度开发,Gen3 开始成形,Jalapeño 年底就会部署进 OpenAI 自己的基础设施。Cerebras 参与了一代目的硬件,意味着它有机会出现在后续的迭代链条里。对一家七成收入来自服务的公司,留在 OpenAI 的技术路线图上,比任何一笔硬件订单都重要。
第三,存量订单没被挤掉。OpenAI 明确说仍会大规模部署英伟达和其他伙伴的加速器,训练推理都覆盖——推理需求在爆炸,没人吃得完。Cerebras 自己也在做对冲:CS-4 三季度出货,已经和 AMD Helios、AWS Trainium 约好做异构的预填充/解码组合,不吊死在一棵树上。
倒计时的一面
最直接的信号就是财报本身:硬件收入 -23%。全球最大的客户正在学会自己造芯片,而且学得很快。从设计到流片只用了 9 个月。用 AI 写内核,Codex 生成的部分实现比人类手写还快 1.5~1.8 倍。Gen2、Gen3 排上日程之后,自研占比只会往上走。
还有一个值得咂摸的细节:Cerebras 的速度是拿容量换的。CS-4 三片合计 132GB 片上 SRAM,GPT-OSS-120B 按 8bit 就要占掉约 120GB,余量只有 9%;换 FP16 只能装下 66B 参数左右的模型。知乎这就是 4,400 tokens/s 的基准为什么选 GPT-OSS-120B——不是巧合,是容量约束下的最优解。而 Jalapeño 单芯片就有 216GB HBM4,更大的模型场景天然是 HBM 路线的菜。两条路线的潜在分工,已经埋在这里了。

接下来盯三个信号
CS-4 的出货节奏:官方承诺三季度出货,下一份财报里硬件订单是回升还是继续塌,直接决定"-23%"是需求波动还是结构性下滑;
Gen2/Gen3 里 Cerebras 的存在感:未来一年,如果 OpenAI 自研芯片的官宣里不再出现 Cerebras 合作,那是比任何跑分都重要的信号;
推理价格战的双向挤压:模型侧,DeepSeek 已经改峰谷计价、闲时半价,Gemini 3.7 Flash 一上线便宜一半。知乎硬件侧,人人都在卷出词速度。如果单位 token 收入持续下探,而电费和折旧是刚性的,服务模式的毛利弹性就要接受考验。
资本侧还有个小注脚:老虎环球在 Q2 的 13F 文件里披露新进买入 Cerebras。华尔街见闻机构资金还在为"推理故事"投票。
最后说一句给只用 AI 工具的朋友:ChatGPT 一夜提速 14 倍、GPT-5.6 Sol 每秒 750 个 token,你感觉到的"变快了",背后就是"Cerebras 硬件 + OpenAI 调度"这条链路。以后你手里的 AI 工具卡不卡,会越来越取决于背后跑的是哪种推理硬件。
留个讨论题:你觉得 OpenAI 最终会把 Cerebras 内部化,还是两家会越绑越深?评论区见。