10月7日晚上,微软官方博客挂出一条不算起眼的信息:DeepSeek V4 Flash——2840亿参数的MoE、激活13B、百万上下文——将本地运行在RTX Spark电脑上;同一天,llama.cpp进入Windows ML,GGUF/ONNX双格式,带OpenAI兼容本地接口。 第二天,微软在旧金山把Surface Laptop Ultra摆上台:即日起开启预售、10月16日发货,起售价2599.99美元,中国地区售价人民币21988元起,黄仁勋穿着皮衣到场站台。哔哩哔哩网易科技36氪
对还在续费云端订阅的人来说,这只是又一条AIPC新闻。但对在Windows上折腾本地大模型的人来说,这是第一次"本地之门"由操作系统自己来开——以前你在Windows上跑GGUF,靠的是WSL里自己起的私服;从这代开始,本地推理接口进了系统层。热闹归热闹,圈子里真正要算的是三本账,我把官宣口径、国行定价、权重体积和社区实测摆成一张表,算完再决定10月16日要不要动手。
第一本账:标题里那台"能跑1200亿"的机器,是配置单里的哪一档?
档位 | CPU/GPU | 价格 | 本地大模型视角 | |
|---|---|---|---|---|
入门(Win11家庭版) | 18核/5120核 | 24GB | $2599.99(国行21988元起) | 家庭版锁死24GB,装不下V4 Flash任何公开精度权重 |
高配(Win11专业版) | 18~20核/最高6144核 | 32~128GB可选 | 顶配$5899.99(折合约3.96万元) | 只有128GB这档,才配得上"本地跑超1200亿参数"那句官宣 |
DevBox(Project Zenith) | 同RTX Spark | 未细分 | $5999起,11月发美国 | 预装VS Code/Git/GitHub CLI,开发者机,短期与国行用户无关 |
RTX Spark N1X本体:20核Grace CPU+6144核Blackwell GPU、和联发科联合研发的ARM架构、1 PetaFLOP算力、最高128GB统一内存——微软口径"可本地运行超过1200亿参数模型"。 官方同时给出了对比16英寸M5 Pro MacBook Pro的数字:首token时延效率"最快2.1倍"、AI生图4.3倍、AI视频6.2倍。注意两个限定词:一是"最快",二是这套对比是基于64GB配置测的——这个细节在转载里被多数人忽略了。36氪微博·壹小寒

RTX Spark的机器不止微软一家。发布会同一天,国行首发名单已经有人排好了:微软Surface Laptop Ultra、联想YOGA Pro 15、华硕ProArt创16/创14、戴尔XPS 16创作者版、微星尊爵N16 Flip——六款里目前只有微软真正挂出预售,其余都停在"接受预订、价格未公布"。 已经能看到的锚点:戴尔XPS 16创作者版首搭RTX Spark+128GB内存,起售价约合人民币27360元,暂未公布国行相关信息。 更值得注意的是8月底的报道:华硕、微星的首批RTX Spark机型已经被订完。 这不是"发个新品看看热闹"的窗口,而是首批货源本来就紧、10月16日才见真机实感的窗口。微博·孤城Hardware快科技集微网

评论区的声音很圈层:“现在内存确实是金子做的”——“完了,N卡又得涨价”。 微软自己也清楚价格痛点,美加商城直接挂了"与你的MacBook分手吧"的换购活动,MacBook Pro换购可获最高1000美元补贴,能与原有折抵叠加。 一句话:21988元那一档是"能下单"的门槛,不是"能跑大"的门槛,这两件事在配置单上差着三档内存。哔哩哔哩21世纪商业评论
第二本账:284B的权重,到底塞不塞得进128GB?
按社区转述微软Windows博客的口径,V4 Flash的FP8权重约160GB——比顶配128GB统一内存还大。也就是说,"官宣能本地跑"和"你能装进机器"之间,隔着一个量化:至少要到NVFP4级别。llama.cpp恰好在上周刚进入Windows ML并支持NVFP4——知乎10月5日的讨论里,已经有人在RTX 5090 Laptop+160GB内存的Win11上跑Strata NVFP4,prefill提升1.85~2.96倍、decode提升1.45~1.82倍。 链条是通的,但微软至今没公布三件事:量化精度、权重大小、下载档期——而且V4 Flash并非Win11预装。 门票在官方手里,价签还没贴。知乎哔哩哔哩
内存党还有一层判断可以直接参考:8月底就有博主说过,这批国产Flash模型"超大规模、超低激活,对内存容量的需求远大于对带宽的需求",最对口的是M系、Strix Halo、GB10这类Super UMA路线——N1X从架构上确实是这个阵营的。 但同一个博主也提醒过,个别模型即便NVFP4量化,内存占用仍会超128GB。更关键的是:截至发稿,RTX Spark的内存带宽没有任何公开实测数字,而这恰恰是决定decode速度的那条线。“一个toks/s背后能限定的条件真的太多了”——上下文长度、是否带图、并发、Temp、投机解码、量化配方、缓存配置,官宣倍数在独立复测之前都得先打折。微博·金猪升级包微博·村民F_

第三本账:Windows ML进llama.cpp,对已经装机的人意味着什么?
这其实是三本账里唯一不用等实测的一笔。OS级OpenAI兼容接口一旦落地,Jan(GitHub上42980星的本地LLM桌面应用,今天又被知乎拎出来讲了一遍)、Copilot的本地推理入口、Dify和RAG全家桶,都可以直接吃你本机的模型,不用再各自维护一套启动脚本。 同周微软MXC正式可用,Win11开始支持对Agent的文件与网络访问做策略管控——"本地部署≠数据不出去"这个老争论,第一次有了系统级的兜底选项。知乎微博·AI早报

反证同样摆上桌:B站评论区已经在刷"woa灾难性适配,这玩意真有受众吗",ARM版Windows的应用生态、N卡用户最在意的CUDA路径能不能平滑迁移,没人给出过答卷。 有人问Spark跑ComfyUI快不快,下面的回答"不快。显存太拉了。应该是共享内存"目前全是推测,没有任何实测支撑。生图党先别拿它当4090替代品。哔哩哔哩
10月16日之前,三类人分别该干嘛
手里有16~24GB卡、正在跑Strata/NVFP4的:不动。Spark不会改写你的账——你的量化工具链反而在给Windows ML探路,等16号之后的第三方tok/s再回头比价。
想退订API、换整机的大内存党:别为21988元档掏钱,24GB连权重的门都摸不到;也别在国行顶配定价公布前梭哈,首批华硕、微星的预订名额已经被订完一轮,等三样东西落地再说——量化权重体积、内存带宽实测、10月16日首批拆机。
被"Windows本地栈稀碎"劝退过的:这一波才是给你开的门。但"到手就能跑V4 Flash"不写进10月16日的预期,接口先通、权重另说。
继续观察这四个信号:①16日首批拆机的带宽与prefill/decode数字;②微软是否公布V4 Flash量化档及对应内存;③GGUF权重在Windows ML的下载档期;④ARM Windows兼容性首考,尤其是CUDA生态。云端这一周Anthropic刚发布的Claude Haiku5.5均价约降75%、GPT-6推到免费档,本地党肯为三四万掏钱的理由从来只有两个——数据不出门、用量不封顶。 这一次,微软把Windows侧的接口写进了系统层,但账,还是得自己算。微博·AI早报