千问Qwen3.8-Flash发布,125B参数只激活6B,API定价低于DeepSeek三分之一

源自281位全网作者

20:06

内容由AI生成

精选参考来源

1. 刚刚,Qwen3.8-Flash震撼发布,我们看到了Qwen4的骨架

2. #阿里发布Qwen3.8Flash#据我这个半路出家的文科生了解到,该模型采用下一代 Qwen4 架构,总参数 125B,每 token 仅激活 6B,却实现了超越 Claude Opus4.6 的前沿性能,创下模型效率全球新基准。架构上,Qwen3.8-Flash 带来四大革新:引入 QSA 稀疏注意力机制,1M 长上下文场景提速超 8 倍;自研 Gated Residual 将信息通道拓展为 4 条并行分支;外挂 51B N-gram Embedding 高效扩展模型容量;配合全新优化器大幅提升训练吞吐。成本方面更是惊人——训练成本较上代骤降近 90%,推理定价每百万 Tokens 输入仅 1 元、输出 3 元,仅为 DeepSeek-V4-Flash 的 1/3。模型已同步在 Hugging Face 与魔搭社区开源,并首发上线“千问办公”,开发者可通过千问 AI 平台获取 API 服务。

3. #阿里发布Qwen3.8Flash#阿里最新带来Qwen3.8‑Flash多模态MoE模型,这次的重点放在了模型运行效率上面。主模型125B参数,搭配51B N‑gram Embedding,但每token仅激活6B参与计算,训练开销大约只有Qwen3.7‑Plus的九分之一。 没有单纯堆砌算力,在压缩训练、推理成本的前提下,编码和办公相关任务的能力还得到提升。现在大模型行业,单纯比拼总参数已经成为过去,如何平衡性能与成本,是很多团队需要解决的现实问题,这套新架构也提供了一种参考思路。

4. 阿里悄悄把Qwen3.8-27B开源了,270亿参数,262K上下文,外推能到100万,两天下载破百万,直接登顶Hugging Face全球趋势榜。我当天就装进了两年前买的4090台式机(24G显存+128G内存,全套3万块),跑Q4量化,每秒100 tokens,丝滑流畅,智商极高。本地接上Deepseek harness和Claude Code当主力工作智能体,完全OK,真的哇塞。这玩意儿基本就是个人电脑上能跑的Opus 4.6,从此不再靠梁文锋良心发现打折,每个人都能本地推理,彻底替代deepseek v4 flash,成为大模型时代真正的定价之锚。但本地跑它的核心卖点不是便宜,是三万块预算内,给你一个完全隐私的AI助理,还能省下大笔tokens费用。 全文见:网页链接

5. Qwen3.8-27B开源,我直接说了,这就是本地能跑的Opus 4.6,270亿参数,4090上100token/s,智商高得离谱。我拿它翻微信聊天,把意念回复全捞出来;答辩时当外挂,0.3秒出答案,真心爽。但别以为我吹本地部署是为了省钱——现在薅云端token羊毛比电费还便宜,100亿token才100块,老佛爷买单。Qwen27B真正的价值是成为大模型定价之锚:让每个人都能在本地跑顶级智能,数据不上云,隐私和响应速度完全可控。3万块主机跑三年,换一个完全属于自己的AI助理,隐私和效率的账算下来,比被云厂商割韭菜值多了。我断言,以后云模型定价都得看它脸色。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章