这周,OpenAI正式公布了其首款定制推理芯片Jalapeño(墨西哥辣椒)的首批实测数据。36氪GPT-OSS120B、DeepSeekR1、KimiK2.5三个开源模型轮番上,对手是英伟达GB200/GB300,峰值每瓦吞吐普遍高出1.5到1.9倍,端到端延迟砍到原来的约三成到六成。

但比数据更值得咂摸的是达成方式:没有多token预测(MTP)、没有投机解码、没有prefill-decode分离,就这样赢过了软硬件优化的英伟达对手芯片。36氪这几样,恰恰是推理优化工程师们这两年吃饭的家伙。芯片端一发力,直接把软件侧一堆"进阶招式"给绕了过去。也就难怪,知乎上一个老问题这两天又被翻出来吵:大模型推理优化,是不是已经做到头了?
这个问题下有两条赞数靠前的回答,观点几乎是反着来的。一条说:已经没有尽头了,今年新发的大模型实在太多了,最近更是一周之类就有5-6个大公司发的新模型,再加上nv一堆不同架构的gpu,各种国产gpu,已经完全是一个组合爆炸问题了。知乎就算token无限,也做不完这么多不同架构模型的优化。另一条直接甩出长长的清单:多路并行、算子融合、FP4量化、调度器、PD分离、大规模EP、通信库和协议栈优化,最后总结:如果能把通信带宽、显存带宽、TC利用率做到70%就很刁了现在推理已经是系统工程,单一技能已经不太能cover了。知乎
我觉得两边都对,只是说的不是同一层。“做到头"的那部分,是低垂果实。PagedAttention、连续批处理、FlashAttention、量化部署,这些第一轮招式早就被开源框架做成了标配,社区学习营都已经把它们教成了打卡课程,逐条原理掰开讲,比如"PagedAttention 的思路是把 KV Cache 像分页内存一样管理”。知乎这些东西学得会、背得出,也就越来越不构成壁垒。
没做到头的,是组合爆炸底下的那些活。模型×GPU×互连的乘法还在继续,谁也没法穷举;就算在成熟硬件上,细枝末节里也有空间。比如一篇昇腾910B上的实战记录,跑一个30B级混合架构模型,只是把vLLM的图编译模式从PIECEWISE切换成FULL_DECODE_ONLY,TPOT从稳定的21ms降到稳定的14ms,优化显著。知乎改一个参数,推理时延降了三分之一。这种活,不是一个通用招式能吃遍的。
再看Jalapeño的成绩单,它几乎是在给"没做到头"派做注脚。单用户生成速度上,GPT-OSS120B最高每秒1459个token,对手只有535。36氪

DeepSeekR1上700对169,KimiK2.5上694对182,都在2.7到4.1倍的量级,而且是在没开投机解码和MTP的前提下拿到的。
不过看这份成绩单,得先搞清楚基线。峰值最佳运行点口径下,差距是1.5到1.9倍;换成"等速解码"口径——把单用户速度钉在对手的最佳水平上,再比每瓦吞吐——数字就夸张了:GB200此前最佳的单用户速度(约535tok/s)下,Jalapeño的每千瓦吞吐是前者的53.7倍。36氪

疯传的那个"104.3倍",就是这么算出来的。但冷水也泼得在理:这个104.3倍只是特定等速解码场景下的单一数据点,测试模型和对比基线都是OpenAI自己挑的。SemiAnalysis自己也承认,Jalapeño还没跑过多轮长上下文的AgentX测试,真正的对手应该是同样用HBM4的VeraRubin。
把热闹放一边,这颗芯片真正戳中的是推理生意最现实的一笔账:电费。它的标称功耗为700W,实际测试中持续功耗更是低于550W;作为对照,英伟达的GB200和GB300标称功耗分别为1200W和1400W。36氪

对规模化推理服务来说,一句话很直接:每瓦吞吐,最后都会变成成本和收入。36氪顶级投行已经开始给大模型算这笔账:推理利润率超50%!知乎这也就不难理解,为什么造芯突然成了集体动作:一颗高性能ASIC从架构定义、验证到流片,常规周期18到24个月起步,而Jalapeño从初始设计到完成流片只用了9个月。36氪过去二十年,行业的默认秩序是「为芯片适配模型」,英伟达发布什么,大家适配什么;而这一次,顺序倒了过来。
需求侧也在验证这不是一阵风。腾讯8月28日压轴开源混元Hy4Preview,号称模型自己优化自己、推理提速31.8%。哔哩哔哩阿里正式发布并开源Qwen3.8-Flash,最大卖点是便宜到不像话,而且能免费商用。知乎连终端侧都下场了:过去几个月,OpenAI购买了数万台Macmini和MacStudio。36氪苹果新Mac mini的宣传重点也转向端侧大模型推理,入门价两年里从4499元涨到6999元。
所以,普通开发者现在要不要进这个方向?我的判断,分人:
学生、入门者:PagedAttention、连续批处理这层八股已经卷透,拿来打基础、应付面试没问题,但别把差异化竞争力押在上面;
后端、基础架构工程师想转型的:那条高赞回答里的系统工程清单就是现成路线图——并行策略、量化、调度、PD分离、SLO,选一两个扎深。两边吵架里唯一的共识,就是"能出活的人"稀缺;
算法同学:模型和硬件协同优化值得看。Jalapeño的设计逻辑就是让芯片跟着流量形状走,AI甚至直接参与了芯片设计,算法侧对负载的理解正在变成硬件的输入;
纯围观的:记住三个观察信号——104.3倍会不会被第三方复现、VeraRubin的成绩单什么时候出、Jalapeño年底部署能不能摸到100MW的目标。SemiAnalysis已经把话挑明了:Jalapeño真正的对手应该是同样用HBM4的VeraRubin,而非Blackwell。36氪
最后说句实在的。"做到头"的,只是靠单一招式吃遍天的时代。推理优化的主战场,已经从某个算法技巧,换成了系统工程、芯片和软件栈的协同设计。对准备进场的人,这反而是好事:门槛高了,意味着学会的人更少、会的人更值钱。至于该不该上车,看完上面分人群的账,答案应该已经在你手里了。