5090+96G内存有戏吗?两款Flash同夜开源,拉权重前先对照自己的配置

源自18位全网作者

08-27 07:02

昨晚难得一见:智谱和阿里千问在几个小时内先后发布新模型,都叫Flash,都是原生多模态,都当夜开放了权重。

智谱这边是GLM-5.3-Flash:320B总参数、18B激活、1M上下文、MIT协议开源,它就是上周在OpenRouter匿名登顶、被中文社区叫作"牛来"(Ox Alpha)的那个神秘模型。微博阿里这边是Qwen3.8-Flash:125B主模型加51B N-gram Embedding的多模态MoE,每token只激活6B,API定价输入1元、输出3元每百万token,同时开源了Qwen3.8-Flash-Next的预览版权重。知乎

5090+96G内存有戏吗?两款Flash同夜开源,拉权重前先对照自己的配置

上面这张榜单截图,就是"牛来"匿名期的战绩:OpenRouter调用量23.2万亿token排第一,第二名DeepSeek V4 Flash是11.6万亿。知乎也正因为这波热度,揭晓之后社区里最响的声音不是争论跑分,而是一个更现实的问题。

评论区最热的不是跑分,是"我的机器能跑吗"

权重一开源,自部署党的第一反应是往自己机器上拉。预热其实早一天就开始了:发布前,B站就有标题写着"176B模型只激活6B,个人电脑就能跑"的视频,播放量三千多。哔哩哔哩发布之后,首批实测视频的评论区迅速被这类提问填满。

“5090,96G内存有希望吗?”“我主要想看看22-32G显存,跑125B-A6B什么效果。”"搞了一晚上,华硕GX10 128G,NVFP4跑不起来。"这是评论区里几条最有代表性的真实提问。哔哩哔哩

最大的误区:激活6B,不等于6B显存能跑

MoE模型的"激活参数少",省的是算力,不是内存。每次推理确实只有6B或18B参数参与计算,这是它推理快、API便宜的原因;但决定把任务派给哪6B专家之前,全部专家的权重都得先完整加载。从千问放出的架构图能看得很清楚:MoE专家模块密密麻麻叠在GDN加稀疏注意力的混合层里,一层都少不了。

5090+96G内存有戏吗?两款Flash同夜开源,拉权重前先对照自己的配置

所以两款模型真正要本地拉下来的权重,是下面这些数字:

Qwen3.8-Flash-Next:125B主权重加51B N-gram Embedding。官方文档说后者是确定性寻址,可以放进主机内存、不长期占用显存。知乎实测视频的评论区里,UP主也确认N-gram Embedding已经卸载到了内存。哔哩哔哩但125B主权重仍然要老老实实进显存,按NVFP4量化算,光权重就要60GB往上。下面这张官方参数表里,"总参数125B"和"激活参数6B"的差距一目了然。

5090+96G内存有戏吗?两款Flash同夜开源,拉权重前先对照自己的配置

GLM-5.3-Flash:总参数320B,还要再大一个量级,就算量化到4bit,权重也在160GB上下。

所以实测视频标题里的"内存斩杀线"不是标题党:第一份Qwen3.8-Flash-Next的NVFP4单卡部署实测,结论就是内存128G起,跑起来之后单流生成大约110 token/s。哔哩哔哩而且注意,128G只是"能跑起来"。那位5090加96G内存的哥们得到的回复是"暂时没有希望,除非权重能放SSD里读取,但速度估计不会快",他最后的自嘲反而成了评论区最实用的建议:“我这也是这个配置,27B玩玩吧,也不差。”

GLM-5.3-Flash的本地路子:有了,但还没走通

社区动作足够快:KTransformers当夜就宣布适配GLM-5.3-Flash。知乎这个框架主打CPU加GPU混合推理,给显存不够的机器留了条路;服务端推理框架SGLang也是Day 0支持。小红书但截至目前,消费级硬件上跑通的现成参数还没出现,GGUF这类主流量化版本也还没放出。

另外说句实话:智谱官方口径里,这次模型的全部公测流量都跑在国产加速芯片集群上,团队基于SGLang做了专用推理引擎,优化后端到端性能是初始基线的3倍。知乎这句话翻译过来就是,GLM-5.3-Flash现阶段是一朵为云端深度优化过的模型,本地跑,得等社区把路蹚出来。

对照一下自己的硬件,不想折腾就看价格

你的配置

Qwen3.8-Flash-Next(125B+51B)

GLM-5.3-Flash(320B)

更现实的选择

32G显存以内消费卡

跑不了

跑不了

Qwen3.8-27B 4bit,方案已成熟

128G统一内存小型机或Mac

NVFP4能启动,要调配置

跑不了

同上,或租云GPU

256G以上统一内存或多卡

可以跑

等量化版

适合1M长上下文场景

不想碰硬件

API输入1元/输出3元

限时0.4元/1.4元

免费体验渠道见下文

API这边是真的便宜。智谱官方定价页已经挂出GLM-5.3-Flash的限时价:输入0.4元、输出1.4元每百万token,缓存命中0.115元,原价0.8元和2.8元就标在上面。知乎

5090+96G内存有戏吗?两款Flash同夜开源,拉权重前先对照自己的配置

Qwen3.8-Flash是输入1元、输出3元,千问官方的说法是价格最低到DeepSeek-V4-Flash的三分之一。知乎B站有位UP主做了真金白银的同任务实测:Qwen3.8-Flash比GLM-5.3-Flash便宜约2.78倍、快约1.96倍。哔哩哔哩注意,这是社区实测,两家官方跑分用的评测集并不相同,没法直接对比,这组数字当参考就好。

另外两条免费路子。智谱的GLM Coding Plan每天限量发一万张体验卡。知乎Qwen3.8-Flash当晚首发上线了千问办公,可以先免费摸一摸多模态的实际手感。知乎

三个坑,一人一句

第一,别混淆两种"开源"。千问开源的是Qwen3.8-Flash-Next架构预览权重,官方说法是Qwen4系列的雏形;带1M上下文和内置工具的生产版Qwen3.8-Flash,只提供API。知乎智谱的GLM-5.3-Flash是全量权重MIT开源。今晚想拉权重,只有这两个可拉。

第二,跑分记得打折。一边说追平Opus 4.8,一边说超越Opus 4.6。微博知乎但两家挑的题不一样。社区已经有人在较真:评测集都不同,根本没法比,厂商挑对自己有利的题考,最后吃亏的是信了"高分低能"的用户。微博

第三,GLM-5.3-Flash的KV缓存比Kimi K3和DeepSeek-V4-Flash略高,智谱官方自己承认了这一点,说是下一步优化方向。知乎本地部署长上下文场景,内存预算要再多留一截。

值得盯的三个信号

一,GGUF等社区量化版。目前两款都没有,出来的那天,才是消费级硬件真正开始入场的时候。

二,KTransformers对GLM-5.3-Flash的适配参数。CPU加GPU混合推理能不能把320B拉进128G内存档,是"牛来"最可能的本地化路径。

三,GLM-5.3完整版。社区已经在讨论"743B谁部署得起",答案大概率不是消费级硬件,别抱什么希望。知乎

最后一句话给三种人:想现在就本地玩的,别等这两款,Qwen3.8-27B是眼下唯一现实的票;想试多模态能力的,今晚的API价格已经便宜到可以随便造,先把免费额度薅了;想等自部署成熟再上车的,盯紧量化版和混合推理框架,别提前买硬件。

今晚真正贵的不是模型,是"Flash"这个词给人的小模型错觉。

内容由AI生成

精选参考来源

1. 智谱正式推出GLM-5.3-Flash(OxAlpha)!不是旗舰缩水版,是新基座+MIT开源:🔹320B-A18BMoE,激活约18B🔹原生多模态,上下文100万tokens🔹API:$0.15输入/$0.50输出/$0.03缓存(每百万tokens)🔹CodeBench全面超过GLM-5.2,追平ClaudeOpus4.8🔹AutomationBe...全文

2. Qwen3.8-Flash:全新架构,更强更稳更划算

3. 突发!狂吞23.2万亿token匿名怪物谜底揭晓:GLM-5.3-Flash

4. 杀疯了!Qwen3.8-Flash-Next 即将发布 176B 模型只激活 6B,个人电脑就能跑 vs DeepSeek V4

5. 内存斩杀!单卡本地部署Qwen3.8-Flash-Next-NVFP4简测,单发110,3发270,prefill至高11000

6. 是他是他就是他: KTransformers 适配牛来大模型GLM-5.3-flash

7. SGLang Day0 支持 GLM-5.3-Flash!

8. 刚刚,GLM-5.3-FLASH来了

9. 前沿性能,普惠价格,Qwen3.8-Flash重划模型性价比“斩杀线”

10. [狼狼测试]Qwen3.8-Flash 比 GLM-5.3-Flash 便宜 2.78 倍、快 1.96 倍

11. 重磅!智谱一句话炸穿全场:GLM-5.3Flash推理全切国产卡,供应商华为海光摩尔线程?8月26日,智谱发布GLM-5.3Flash——320B总参/18B激活MoE,原生多模态,AA智能指数57分持平ClaudeOpus4.8,定价仅GLM-5.3的1/10!但最炸的不是模型本身,是官方那句:推理服务跑在超过10万张国产芯片集群上,供应...全文

12. “牛来”来了,但别急着喊王。它编程能力屠榜(DeepSWE准确率63%),上下文超百万token,多模态全支持——纸面实力确实顶。可关键问题是:它和KimiK3谁更强?没人敢比,因为评测集都不同!这正是行业病灶:厂商挑对自己有利的题考,用户怕“高分低能”。智谱聪明在哪?匿名上线,直接让用户用。不靠发...全文

13. GLM-5.3:干旗舰的活,定次旗舰的价

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章