英伟达买下了开源模型的路,OpenAI自己造了车:跑模型的人,这周到底变了什么
8月26日到31日这五天,自己搭机器跑开源模型的人,首页被轰炸了两次:先是外媒曝英伟达同意以129亿美元收购 Hugging Face,接着 OpenAI 首颗自研芯片 Jalapeño「首测干翻 GB300」刷屏。两条新闻看起来不相干——一个是买网站,一个是造芯片。但放在一起看,它们说的是同一件事:GPU 并行计算这套东西,正在从「谁的卡算力高」,被重新排列成「谁控制模型到你手里的最后一段路」。
这篇替你把这两轮轰炸拆开:哪些数字是能钉死的事实,哪些是叙事和单一数据点,以及对每天从 HF 拉模型、在自己卡上跑推理的你,真正要盯的信号是什么。
先把能钉住的数字摆出来
事件A:收购(8月26日 The Information 首爆,36氪、微博等跟进)
英伟达同意以 129 亿美元(约 867 亿元人民币)收购 Hugging Face;截至发稿,双方均未官宣,交易未交割。36氪
HF 最近一轮公开融资是 2023 年 8 月的 D 轮,估值 45 亿美元;不到三年,收购价翻了近三倍。据估算,HF 年化收入约 1.5 亿美元——相当于 80 多倍市销率。微博
英伟达本来就是 D 轮投资方之一;据报道,HF 此前还拒绝过英伟达一笔约 5 亿美元的参股要约,理由是「不想让单一巨头获得过大话语权」。知乎
平台上的资产:300 万以上的模型仓库、近百万个数据集、1300 万开发者。Llama、Qwen、DeepSeek,几乎每个叫得上名字的开源模型,第一站都在这。
事件B:芯片(8月26日 OpenAI 公布,SemiAnalysis 进实验室实测)
Jalapeño 跑 GPT-OSS-120B,单用户 1459 token/s;GB200 此前最佳单用户速度约 535 token/s。新智元
端到端任务耗时 1.65 秒,GB300 约 6 秒;峰值每瓦吞吐是对比系统的 1.5~1.9 倍。爱范儿
标称功耗 700W(GB300 为 1400W),实测持续功耗不到 550W;每芯片每小时总拥有成本 1.56 美元,和 H100 的 1.55 美元几乎持平,而 Vera Rubin 是 3.61 美元。
从设计到流片只用了 9 个月(行业常见 18-36 个月),辅助设计的模型把注意力、MoE 模块的内核做到了比人类顶尖专家快 1.5~1.8 倍。36氪
与博通的 10GW 定制加速器合作在手,量产 2027 年才逐步爬坡。

事件C:财报(8月27日):英伟达 FY27 Q2 营收 962 亿美元、同比 +106%,数据中心 +117%,净利润 597 亿美元。36氪 CFO 给出下一财年约 +70% 的增长指引,并首次量化了供需缺口。Jalapeño 消息出来当天,英伟达股价还涨了 2.19%。36氪 财报后单日市值暴增近 3 万亿人民币,是仅次于微软 4500 亿美元纪录的历史级单日涨幅。36氪
先把三层话术剥掉
「开源童话结束了」——这是叙事,不是事实。 可对照的先例摆在那:2018 年微软 75 亿美元收 GitHub,开发者恐慌出逃了一遍,结果平台保持独立运营、越活越旺;2019 年 IBM 340 亿美元收 Red Hat,也没有关门,产品迭代反而更快。知乎 英伟达花 80 倍市销率买的恰恰是「开放」本身——把 HF 关成自家商店,平台价值瞬间归零,钱白花。真正值得盯的不是「开源死没死」,而是每一个「默认」开始偏向谁。
「104.3 倍」——是一个单一数据点,不是全面碾压。 它的准确含义是:把 GB300 逼到它自己最快的解码速度(169 token/s)那一个点上,Jalapeño 的吞吐是它的 104.3 倍。按双方各自最好的工作点算,差距温和得多:三个模型上分别是 1.9 倍、1.7 倍、1.5 倍。新智元 开发者社区也泼了冷水:测试模型和对比基线都是 OpenAI 自己挑的,还没跑过多轮长上下文的 Agent 负载,真正该对标的是同样用 HBM4 的 Vera Rubin。爱范儿 即便如此,第一代自研芯片就站上帕累托前沿,在行业里确实没有先例——Meta、微软折腾多年难产的 ASIC 项目就是反证。

「CUDA 护城河死了」——是 SemiAnalysis 的原话,但同篇给了相反的证据。 Rubin 比 Jalapeño 早一个月完成 CoWoS 流片,硬件没问题,输在软件爬坡速度和「敢不敢公开测」。新智元 而 8 月 27 日的财报是更直接的 counterpoint:供需缺口可以量化、下一财年 +70% 指引、单日 3 万亿市值——护城河没塌,但它第一次被「ASIC 定制」和「AI 写内核」两头同时抽水。36氪
80 倍市销率买的不是收入,是「默认」
英伟达卖的是 GPU,GPU 吃的是模型。HF 不生产模型,但它是模型的默认分发商:你下载的每一个开源权重、每一份 model card、每一个推荐部署方式,都从这里出发。收购之后,「默认优化、默认一键部署、默认推理镜像」这些看不见的基础设施,都有理由优先适配英伟达的硬件和云服务。知乎
叠上它手里已有的牌——芯片(Blackwell/Rubin)、网络(当年 Mellanox 那笔收购养出的第二大营收支柱)、自研开源模型(Nemotron)、被曝花 60 亿美元拿下的推理团队 Poolside——这是全栈闭环:从硅片到「你点下载的那个按钮」,一根链条全攥住。微博知乎
对跑模型的人,这不代表明天模型就要收费。它代表的是另一件事:当你习惯了「下载模型→一键部署到英伟达 GPU」的顺滑,AMD 和国产卡的适配成本就被悄悄垫高了。分发权和硬件绑在一起时,生态的墙会自动长高。
被收购后的 HF 交出的第一份硬件作业,走的反而还是开放路线:8 月 27 日,旗下 Pollen Robotics 开放 399 美元双足机器鸭 Microduck 的预购,开源设计、四种配色、圣诞节前发货。极客公园 首批战报:已经卖疯了,24 小时销售额 260 万美元。微博 一家「可能被巨头收编」的平台,第一动作是用开源硬件把社区黏得更紧——这才是 80 倍市销率背后真正的资产。

对写内核的人,最危险的信号反而不是芯片
知乎上浏览量 46 万+ 的热门回答在回答一个问题:为什么 AI Infra 还在大量招 GPU Kernel 工程师?回答里有两个数字值得记住:线上业务很多还只把硬件利用率跑到 30%~40%,一个写得好的内核能把吞吐再抬 20%~50%——对几千张卡的集群,这是千万级的算力成本,一个优秀内核工程师一年省的钱远大于他的工资。知乎
另一边,OpenAI 让模型手写的 attention/MoE 内核,已经比人类顶尖专家快 1.5~1.8 倍。爱范儿
两个数字并排放,结论是反直觉的:「会写 CUDA」作为肌肉动作在贬值,「知道这台硬件 + 这个模型卡在哪、并把最后一公里抠出来」作为判断力在涨价。AI 能生成内核,但生成的代码经常性能虚高、数值不稳,离生产可用还差人来回改、验证、调优;而且每换一代架构(Hopper→Blackwell→Rubin),Tensor Core、共享内存、流水线的全部前提推倒重来,旧内核直接性能滑坡。值得投入的方向不是背 API,是 profiling、瓶颈定位和数值验证。
接下来盯三件事,现在做三件事
三个观察信号:
交易官宣的条款和 HF 产品动向。 看三点:有没有保持中立/多硬件支持的公开承诺;「一键部署」按钮有没有开始绑定英伟达云;模型与数据集的 license 口径有没有微调。没交割之前,一切以官宣为准。
Jalapeño 的 B0 步进与 Gen2 进度。 已知的 B0 每瓦性能比 A0 再高约 25%,但量产 2027 年爬坡——未来 12~18 个月,你的推理成本和选型不会真正被它影响,别把今年的技术栈押在标题上。
国内对冲路线的加速度。 社区已经在聊「魔搭 ModelScope 和 Hugging Face 怎么选」,结论写得很直白:做中文业务、国内部署优先魔搭,跟国际前沿、复现论文优先 Hugging Face。知乎 国产卡厂商也都在自建算子栈。分发权集中的另一面,就是「第二入口」的价值重估。
你现在能做的:
把手上核心模型清单的获取渠道做双备份:HF 主站 + 国内镜像/魔搭,跑业务别把依赖压在单一站点上。
想清你换不换得动卡:HF 默认优化偏向英伟达 ≠ 你的存量部署立刻受影响。消费级多卡和已部署的推理服务,成本曲线这轮不会因这两条新闻改变。
准备入坑底层优化的,别追「干翻英伟达」的新闻,从一次 profiling 开始:先把你自己的卡为什么只跑了 40% 利用率弄明白。
这一周,英伟达圈走了模型上路口的收费亭,OpenAI 造出了一辆不需要那条公路的车,而财报说:路上的车还是远远不够。开源的野生时代确实告一段落,但对亲手跑模型的人来说,天没塌——需要守住的,是你下载模型的那个入口,和验证「快了多少倍」的那把尺子。