联想把“千亿参数”装进笔记本,本地大模型党甩回13tokens/s的实测:10月N1X上市前的三笔账,谁该蹲谁该绕

源自40位全网作者

02:49

9月4日凌晨,联想在柏林的创新世界发布会上和英伟达一起扔出一个标题党级别的数字:把千亿参数大模型装进笔记本。搭载NVIDIA RTX Spark超级芯片的Lenovo Yoga Pro 9n,国内型号叫YOGA Pro 15 Spark——20核Grace CPU、6144个CUDA核心的Blackwell RTX GPU、最高128GB统一内存、1 PFLOPS的FP4算力。知乎发布会稿里那句"把AI在设备、边缘与云端之间整合起来",听起来像是AI PC憋了两年之后,终于要交一份真作业。知乎

但同一时间,DGX Spark和"跑本地大模型"这个圈子里流传的是另一套数字:这台芯片的内存带宽大约只有300GB/s出头(社区按平台规格推算,官方至今没公布频率和带宽),是RTX 5090的六分之一;有人据此估算,跑一个稠密27B模型大概13 tokens/s,“能跑起来"和"能干活"是两件事。知乎还有一个更扎心的背景:架构几乎同源的桌面版DGX Spark,海外首发价3999美元涨到了4699美元,国内成交价从3万出头一路奔着4万去。知乎入手一个多月涨了20%的机主自嘲买了个"理财产品”。知乎

两拨人说的似乎都是真的。"千亿参数"到底是突破还是话术?10月RTX Spark Windows整机正式开卖之前,这台机器值不值得你蹲?这篇内容就是给正在观望的折腾党和被发布会刷屏的联想用户算三笔账:容量账、速度账、价格账。

联想把“千亿参数”装进笔记本,本地大模型党甩回13tokens/s的实测:10月N1X上市前的三笔账,谁该蹲谁该绕

第一笔账:「千亿参数」四个字里,藏着两副完全不同的RTX Spark

先说一个绝大多数转发都没讲清楚的事实:RTX Spark不是一个型号,是两个。9月4日英伟达同步披露的细节里,这颗芯片正式定名N1X,首批分两种规格:高性能版是20核CPU+6144核GPU,统一内存24GB到128GB可选,笔记本和迷你主机都会上;另一个版本是18核CPU+5120核GPU,内存只有24GB到32GB,只进笔记本。知乎而频率、功耗这些关键参数官方都没公布,10月上市前都还是悬念。

再看各家首发产品的配置,落差立刻就出来了:联想Yoga Pro 9n给的是128GB统一内存,官方B站介绍里写明其中96GB分配给GPU,整机80W性能释放。哔哩哔哩微博宏碁发的是桌面迷你主机;华硕全球首发的RTX Spark笔记本ProArt P14,起步内存24GB——对,24GB,发布至今价格也没公布。知乎同一个"RTX Spark笔记本"的名头,顶配和入门配置的容量差了五倍还多。

这就是"千亿参数"宣传语真正需要拆开看的地方。一个100B参数的模型,按FP4量化粗算,光权重就要吃掉50GB上下,再算上KV缓存和系统占用,24GB、32GB的版本连"装"这个动作都不成立,真正对得上那句话的只有128GB满配,而即便是128GB,实际划给GPU的也只有96GB出头——社区里已经有人在DGX Spark上验证过,一个"刚刚超过了128G统一内存(实际显存可达100多G)"的NVFP4量化模型,就只能往offload那条路上想了。知乎

联想把“千亿参数”装进笔记本,本地大模型党甩回13tokens/s的实测:10月N1X上市前的三笔账,谁该蹲谁该绕

所以看10月的上市机型,别认"RTX Spark"四个字,就认两个字段:GPU核心数是6144还是5120,内存是24/32GB还是96/128GB。这两个字段决定了你买的是发布会里那台机器,还是名字里带Spark的另一台。

第二笔账:「装得下」和「跑得快」是两个指标,瓶颈根本不在算力

第二笔账要解释为什么"1 PFLOPS"和"13 tokens/s"能同时成立。

大模型推理(尤其是逐字往外蹦的decode阶段)是出了名的"内存带宽生意":每生成一个token,理论上要把模型权重从内存里过一遍。粗算一下:稠密27B、FP8量化,权重约27GB,除以300GB/s的带宽,理论上限就是每秒十几token,社区估的13 tok/s就是这么来的;换成100B的稠密模型FP4,50GB权重,速度直接掉到个位数——字一个个往外滴,等一屏回答得按分钟计。1 PFLOPS的算力再漂亮,数据喂不进来也白搭。

那为什么官方敢说千亿参数?因为这个时代的大模型,恰好都长成了MoE的形状。MoE模型总参数巨大但每次只激活一小部分专家:DGX Spark机主们的实测记录能看出这条规律——总参数大的MoE模型能跑到每秒几十token的可用速度,稠密模型反而慢;有人干脆用两台DGX Spark直连,把284B总参数的MoE模型跑出40 token/s以上,机主自己的结论是"双机子能跑到40以上的速度完全属于可用了"。知乎但同样有人把预期拉回地面:16台同架构小主机跑Kimi K3,速度也才38 TPS,一句"就是花活而已"在折腾群里刷屏。微博

翻译成人话就是:"千亿参数装进笔记本"成立的前提,是千亿规模的MoE+量化精度+你接受它为写稿、知识库问答、代码补全这类任务服务,而不是拿它跑满血稠密模型当生产力。 另外别忘了这是笔记本:桌面版DGX Spark可以安静地焊在桌上吃功耗,同样的芯片塞进15寸机身,散热墙只会让理论值再打折。至于AI绘图、视频生成这类吃算力也吃带宽的活,社区的原话很直接——“能跑得起来,想干活几乎不可能”。

对多数人来说,这其实不是坏消息:本地跑一个响应不快的MoE大参数模型,换的是文档、病历、客户资料这些不能上云的东西全部端侧处理,这个隐私价值是云端API给不了的。联想自己现在也整条故事都押在"数据所在之处用AI"上。知乎

联想把“千亿参数”装进笔记本,本地大模型党甩回13tokens/s的实测:10月N1X上市前的三笔账,谁该蹲谁该绕

第三笔账:等10月还是现在就买?三个钱包三种算法

第三笔账落到钱上。现在想上一台"本地AI",货架上其实有四条路线,各自的账不一样。

路线一:等10月的N1X整机。 英伟达已确认RTX Spark Windows整机10月开卖,联想、宏碁之后,华硕、戴尔、微星、惠普、微软都会跟进,微软甚至已经在Computex摆过旗舰级的Surface Laptop Ultra。知乎而联想和宏碁的IFA首发机型都还没公布售价,参考DGX Spark"3999美元起步、一路加到4699"的轨迹,再叠上这轮全行业内存涨价的传导,128GB满配的价格大概率不会低于桌面版。首发1-3个月还要额外付溢价和试错税——第一批用户永远在帮厂商清固件的雷。

路线二:现在就买DGX Spark桌面版。 3万到4万的成交价、已经涨价20%的现实,换来的是一台"本地模型验证机"的完整生态:机主们踩出来的坑都有保姆级教程可抄,双机、八机集群方案已经有人跑通。适合预算充足、等不了10月、明确知道要跑什么模型的开发者。但记住,它本质上还是"能力上限、速度下限"的机器——买之前先想清楚自己能不能接受MoE+量化的世界观。

路线三:传统显卡或AMD大一统内存路线。 一张5090的带宽是它的六倍,27B、35B级别的模型都能跑,速度完胜,只是装不下更大的模型。知乎AMD这边AI Max+395(Strix Halo)的小主机,有些机型已经到了26000左右的价位,就能本地跑235B级别的模型。知乎这轮内存涨价对所有路线都是逆风,但N1X路线因为绑定大容量LPDDR5X统一内存,成本传导只会更狠。

路线四:其实你已经有台够用的电脑。 这笔账最少有人算:联想这次同步宣布,Qira个人AI的支持门槛下探到了16GB内存的联想PC,官方口径已覆盖全球80多种受支持的PC配置;中国市场的对应动作是天禧AI升到4.3版,全双工语音和超能模式走免费升级。知乎至于AI Mini这类标配45TOPS本地算力的小主机,实测满载功耗不到30W,挂后台跑会议纪要、定时整理信息这类活绰绰有余,价格是N1X机器的零头。知乎对不上手本地推理的学生和上班族,"AI PC"今天给你的正确答案可能是一次免费系统升级,而不是一张新订单。

谁该蹲、谁该绕、谁现在就能动

把三笔账合成人群判断:

  • 本地大模型折腾党/开发者:蹲10月,重点盯三件事——N1X完整频率功耗公布、各家128GB机型的首发价、以及是否有支持双机互联的方案。如果实测速度对得起DGX Spark的社区数据,满配N1X笔记本是这台"桌面验证机"真正变成生产力工具的时刻;预算紧的,先看宏碁那类迷你主机形态,同芯片没有电池和散热的溢价。

  • 被发布会种草的普通用户:绕。24GB起步的N1X笔记本跟"千亿参数"没有一分钱关系,16GB内存的AI功能你现有的电脑免费就能开。

  • 需要端侧处理敏感资料的创作者/小微企业:这是唯一值得认真排预算的人群,但建议把等待窗口留到明年一季度——让首发用户把价格税和固件税都交完,内存涨价潮也大概能看清方向。

至于那句"千亿参数装进笔记本"本身——现在可以给它一个基于证据的判词:技术上不假,但每个字都有前提。 容量是128GB满配的容量,千亿是MoE量化的千亿,快慢取决于你信不信带宽,价格取决于你站不站首发。

你站在哪一笔账上?评论区报一下你的预算和要跑的模型,看看这个圈子里谁是同路人。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章