8月21日到27日,一周之内三家把"甜点级多模态"拍了出来:DeepSeek的V4-Flash-Vision-Exp补上视觉,终于有了自己的首个多模态API模型。36氪 Qwen3.8-Flash发布,并把Flash-Next架构的权重直接开源:125B主模型参数、外加51B N-gram Embedding、每token只激活6B。知乎 智谱GLM-5.3-Flash则号称首个原生多模态、还用了国产卡。36氪
评论区的风向也跟着变了——小红书里已经有人晒出用24G显存单卡跑Qwen3.8-Flash-Next的部署实测,知乎那个"deepseek-v4-flash、glm-5.3-flash、qwen-3.8-flash怎么选择"的问题挂着16万播放。小红书知乎
先把结论放这儿,免得你划走:这一波真正降的不是显存门槛,而是"显存门槛"这个说法本身——瓶颈从显卡转移到了内存条;与此同时API价格卷到1000张图一块钱的量级,"跑本地模型省token费"这个传统理由,基本死了。本地部署的购买逻辑,从"省钱"变成了另外三个字:不心疼。
125B级模型是怎么挤进一张24G显卡的
看参数你会觉得这不科学:这模型量化后光权重文件就是几十GB量级,一张24G的卡怎么装?
答案藏在架构里。官方技术文说得很直白:那51B的N-gram Embedding是查表外挂,可以放到主机内存里,不长期占GPU显存。知乎 小红书那篇"主流大模型本地部署门槛汇总"算过账:这类外挂卸出去,实测每张卡能省掉23.5GB显存。小红书

于是出现了9月5日那条实测帖的部署形态:attention部分22GB放GPU,MoE和外挂嵌入表一共85GB放内存,24G显存+128G内存的机器跑Q4_XS量化,256K上下文,prefill 383 token/s、decode 30 token/s,博主的原话是这模型基本相当于GLM5.3 Flash水平、编程和本地agent完全够用。小红书 30 t/s什么概念?一个字一个字往外蹦但读得下去,能用,别嫌慢。

Mac这边同样成立:M5 Max实测帖里,87GB的IQ4_XS加载后占67.9GB内存,线程优化+KV量化+ngram投机解码三板斧之后,解码速度直接翻了2.8倍、跑到50 token/s。知乎
所以这波开源的实质是:本地跑"旗舰级附近"的多模态模型,从"多卡、48G起"的装机问题,变成了"一张旧24G卡+插满内存条"的补件问题。内存条比显卡便宜太多,这才是门槛真正塌掉的地方。
但API卷成这样,买卡回本成了伪命题
门槛塌了不等于你该跑。先按各家挂牌价算一笔账。Qwen3.8-Flash官方API定价:输入0.8元/百万tokens,输出2.7元/百万,缓存命中只要0.1元。知乎 DeepSeek这边更狠:一张图片最多占384个token,计费价格与V4-Flash完全一致。36氪
同一千张图的横评更直观:Claude Sonnet 4.6吃掉1334 token/张、一千张收4美元,GPT-5.4 Vision 765 token、1.9美元,Gemini 3.1 Pro 258 token、0.5美元。36氪
折成人民币,最贵那档接近29块;而DeepSeek输入价只要3块/百万token、低谷时段再打五折,一千张图的成本只有1.15元,谷时不到6毛。36氪
拿它估一笔重度个人用量:一个月喂3000万输入tokens、产出500万输出,按Qwen这个价再算上Agent场景常见的高缓存命中,月账单就是几十块的量级。你为"省钱"上一万块级别的显卡,靠token费回本要按年甚至按十年计——这还没算电费、折腾时间和量化折损。小红书那个"本地部署大模型到底有意义吗"的帖子吵出494条评论,一半人吵的就是这笔账。小红书
那本地还剩下什么?评论区高赞其实已经替我们总结好了:数据不出内网的合规刚需,对不少企业用户就是硬门槛。小红书 本地这边还有另一重自由——那位24G方案博主说得直白:本地部署的好处就是可以无限的使用,完全不用考虑token的费用。小红书 第二点容易被低估——新智元原文有句话值得抄下来:一千张图三十块和一千张图一块钱是两种产品设计,前者你得想清楚要不要看,后者你可以让Agent每跑一步都截个屏。36氪 而本地是第三种:一张都不用往外传。UI还原、截图巡检、私人相册问答这类"图多、敏感、单次价值低"的活,堵在隐私和心理成本上,不是堵在钱上。

判断给死:如果你的诉求是省钱,别买卡,这轮降价之后本地早就不省钱了;如果你的诉求是数据不出门+高频喂图不心疼,这轮开源才第一次让这条路对个人可行。
三个Flash的真实差距:成本、质量、延迟的三角
选型上别信发布会,看知乎那个136赞的回答,GLM输出慢、Qwen延迟高,他说得很不客气:GLM 5.3 Flash和Qwen 3.8 Flash这俩,目前都不配叫Flash模型。知乎
低谷时段的答案则短得多:DeepSeek V4 Flash Vision Exp,无脑选。知乎
但他也承认这几个模型差别没有这么大、都是干粗活的;只是如果手上就这几家,GLM 5.3 Flash水平最高、能当准旗舰用。知乎
这就是这轮竞争最真实的形状:没人全赢。API端DeepSeek用视觉免费+谷时五折抢成本位,GLM守质量位但被吐槽速度,Qwen在本地端反而最顺——本地党的结论是Qwen内存更小、吞吐性能更高。知乎

还有个必须交代清楚的坑:本地跑的是量化版。知乎上"Qwen3.8-Flash-Next Q4对比Qwen3.8-27b-FP8哪个更不会胡言乱语"的问题这两天一直在吵、没有结论。知乎 那位跑通24G方案的博主也留了前提:要保证质量没有下降,Q4量化比较合适——而他的适用场景本来就是编程和本地agent这种粗活。小红书 别拿24G本地跑出来的Q4模型去顶你原来用满血API干的评审级、汇报级任务,量化折损在这类活儿上会被放大。
想动手的,先把这五个坑过了
llama.cpp的release版直接报"unknown architecture"——Qwen3.8-Flash是qwen4exp新架构,只有最新dev分支源码才支持,必须手动编译。知乎
`–parallel`别乱开:设成4之后每个槽位上下文被砍到32K,测100K输入直接OOM,要用满256K只能parallel 1。知乎
长上下文的prefill是真慢:M5 Max上一次200K输入的prefill要20-35分钟。知乎 本地agent跑长文档不是不行,但"本地=快"的预期要提前扔掉。
内存占用按实测不按文件名:87GB的模型文件加载后实际占67.9GB,256K上下文的KV Cache还要再吃8-10GB(q8_0量化)或16-20GB(f16)。知乎 128G内存是舒适线,不是玄学建议。
名字里带Exp的都是实验品:DeepSeek那个视觉模型的调用参数就叫deepseek-v4-flash-vision-exp,官方明说实验性质。知乎 生产链路留个降级方案。
对号入座:谁现在该动手,谁继续观望
手里有24G显存N卡、内存能加到128G:直接跑Qwen3.8-Flash-Next的Q4_XS,干编程和本地agent的粗活,30 t/s是能用的下限、也是现在的常态。
Mac大内存党(64G以上):可玩,但先接受编译dev版和长文prefill的折磨。
没显卡、日常是截图理解/文档图/UI转码:老老实实调DeepSeek V4-Flash-Vision-Exp,384 token封顶+谷时五折,这个价没资格矫情。
低频纯文本问答:别跟这轮的风,任何API免费额度都够你用,本地部署对你是负资产。
建议观望的信号:DeepSeek视觉转正去掉Exp、GLM和Qwen把速度优化上来(那位高赞博主的原话是"看看之后会不会优化")、Qwen4正式吃下Next架构之后量化生态成熟——任何一个落地,现在的方案都要重算。知乎
这一波多模态开源真正干的事情,不是让谁的模型更强,而是把"要不要本地跑"从信仰问题变回了一道普通的消费决策题:硬件不再是门槛,你的用量和数据的去向才是。评论区聊聊你的账——你现在是本地党还是API党,月账单多少?