当前位置:
AIGC文章详情

英伟达连夜开源双响:万亿参数那个还是传闻,30B 这个现在就能用 vLLM serve

源自10位全网作者

08-12 08:54

过去48小时,英伟达的牌桌上连着落下两张模型牌。一张是落地的:8月11日,黄仁勋亲自推出了Nemotron 3.5 Lightning。微博这是一个开源的30B MoE模型,只有3B活跃参数,官方口径是对同等规模模型可提供最高4倍的输出速度。微博另一张还停在“据报道”阶段:万亿参数的Nemotron 4。对跑vLLM的人来说,这两条消息要分开看:一个是“今天就能拉权重serve”,一个是“进观察清单等权重”。

英伟达连夜开源双响:万亿参数那个还是传闻,30B 这个现在就能用 vLLM serve

先把“已确认”和“传闻”分开

Nemotron 4先说清楚。目前公开信息只有The Information的爆料,国内媒体11日晚间跟进:英伟达正在开发新一代开源人工智能模型Nemotron 4,预计参数规模至少达到1万亿,目标是与全球领先的开源大模型竞争。微博知乎上“如何解读这一战略布局”的问题已经挂出来了。知乎但注意,它现在没有权重、没有技术报告、没有官方确认,任何一句“万亿开源冲击来了”,说的都是爆料里的时间线,不是事实。

顺便纠正一个被转烂的说法:不少账号把3.5 Lightning叫“英伟达首款开源AI模型”。准确说法是,Nemotron家族早就在社区里放开源权重了,英伟达此前已推出Nemotron系列开源模型,包括拥有3400亿参数的Nemotron-4 340B系列,主要用于大语言模型训练数据生成。微博十天前,Parse 2.0也是悄悄上架的,没有官宣、没有NIM封装、没有任何托管API,想用只能自己部署。知乎所以“首款”的准确读法是:这是英伟达第一次把面向推理主战场和agent场景的开源模型推到台前,不是它今天才开源。把这两款模型当成“英伟达刚开源”来写容量计划,起点就错了。

vLLM 用户为什么该关心

这次发布对vLLM用户值得圈出来,是因为英伟达把推理生态直接绑进了首发。知乎对应问题的标题就点了一整排名字:英伟达携手 vLLM、Ollama 等开源大模型推理项目。知乎翻译过来:3.5 Lightning的day-0部署路径里有vLLM,不用等社区逆向架构、补适配。实测玩家也已经把Nemotron家族的批处理路子趟出来了:批量化的正确姿势是 vLLM + 并发。知乎对习惯了“新模型发布→等两周有人补适配→再部署”节奏的人,这个变化本身值得记一笔。

英伟达连夜开源双响:万亿参数那个还是传闻,30B 这个现在就能用 vLLM serve

放大一层看,整个open-weight路线的气氛在7月就被推高了:7月24日,微软、英伟达、抱抱脸等美国多家科技企业和机构发表联合声明,支持开放权重人工智能模型。新华网中国模型这边的压力更具体:在Hugging Face上,中国已成为平台月下载量最大的模型来源国,中国研发的开源模型下载量已占全球总量的41%。新华网7月中旬上海的世界人工智能大会上,100多个国家的代表刚讨论完治理,十天之后联合声明就来了。“开源是立场、部署是战场”的节奏,比多数人想象的快。

分人群怎么动

本地单卡党:别被“3B活跃参数”骗去算显存。决定装不装得下的是30B总参数——4bit量化后显存需求大约在15—20GB,24GB卡能跑得舒服,12GB及以下别硬上;3B活跃参数给你的是每秒token快,不是体积小。正确姿势是先在聚合平台撸免费额度,确认真的会用,再拉权重用vLLM或Ollama起服务。

生产部署党:Nemotron 4等权重和技术报告落地再做容量规划,3.5 Lightning可以先上一个小实例跑canary。试新模型时请把0.25.1的教训带上:官方Issue给出的复现环境包括Qwen3.6-27B-NVFP4、4×H100、Tensor Parallel 4,服务能够正常启动,请求也可以成功返回,但预期的OK变成16个!。知乎新模型+新融合路径,正是这类“服务在线、输出已坏”问题的高发场景,留一个小型golden set做正确性门禁再放真实流量,这条规则对很多人生产里跑的DeepSeek等中国开源模型同样适用。

英伟达连夜开源双响:万亿参数那个还是传闻,30B 这个现在就能用 vLLM serve

观望党和谈资党:一句话看透这波操作——模型是引流款,芯片是收费站。英伟达自己也不藏:希望通过开放模型生态扩大AI应用范围,并进一步推动市场对其GPU算力的需求。微博财联社的同一条报道还点出了硬币的另一面:此举也意味着它或将与自身客户、合作伙伴形成竞争。微博把模型蛋糕做大、在算力上收税、同时开始和客户重合——这才是这次开源的完整上下文,比喊“万亿参数冲击”适合当谈资得多。

观察清单

最后留四个信号,决定什么时候动手:一,Nemotron 4的权重或技术报告真正落地Hugging Face的那天;二,vLLM或SGLang的版本日志里第一次出现Nemotron 4或3.5的适配条目;三,新模型试用期有没有出现0.25.1式的正确性争议;四,OpenRouter调用榜上中国模型的排位变化——英伟达开源对中国开源阵营的挤压,是未来半年值得追的一条线。至于现在?3.5 Lightning可以serve起来摸一摸,万亿参数那条,等权重落地再说。vLLM用户该刷的是版本日志,不是财经热搜。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章