阿里Qwen3.8-Flash-Next开源,176B参数只激活6B,API价格砍到DeepSeek三分之一

源自271位全网作者

20:25

内容由AI生成

精选参考来源

1. 刚刚,Qwen3.8-Flash震撼发布,我们看到了Qwen4的骨架

2. #阿里发布Qwen3.8Flash#据我这个半路出家的文科生了解到,该模型采用下一代 Qwen4 架构,总参数 125B,每 token 仅激活 6B,却实现了超越 Claude Opus4.6 的前沿性能,创下模型效率全球新基准。架构上,Qwen3.8-Flash 带来四大革新:引入 QSA 稀疏注意力机制,1M 长上下文场景提速超 8 倍;自研 Gated Residual 将信息通道拓展为 4 条并行分支;外挂 51B N-gram Embedding 高效扩展模型容量;配合全新优化器大幅提升训练吞吐。成本方面更是惊人——训练成本较上代骤降近 90%,推理定价每百万 Tokens 输入仅 1 元、输出 3 元,仅为 DeepSeek-V4-Flash 的 1/3。模型已同步在 Hugging Face 与魔搭社区开源,并首发上线“千问办公”,开发者可通过千问 AI 平台获取 API 服务。

3. 终于搞懂了!llama.cpp启动参数逐行拆解,让1080Ti与P100满血运行Qwen3.8-27B本地部署全攻略,竟能流畅跑满Qwen3.8百K上下文

4. #阿里发布Qwen3.8Flash#阿里最新带来Qwen3.8‑Flash多模态MoE模型,这次的重点放在了模型运行效率上面。主模型125B参数,搭配51B N‑gram Embedding,但每token仅激活6B参与计算,训练开销大约只有Qwen3.7‑Plus的九分之一。 没有单纯堆砌算力,在压缩训练、推理成本的前提下,编码和办公相关任务的能力还得到提升。现在大模型行业,单纯比拼总参数已经成为过去,如何平衡性能与成本,是很多团队需要解决的现实问题,这套新架构也提供了一种参考思路。

5. Qwen3.8-27B开源,我直接说了,这就是本地能跑的Opus 4.6,270亿参数,4090上100token/s,智商高得离谱。我拿它翻微信聊天,把意念回复全捞出来;答辩时当外挂,0.3秒出答案,真心爽。但别以为我吹本地部署是为了省钱——现在薅云端token羊毛比电费还便宜,100亿token才100块,老佛爷买单。Qwen27B真正的价值是成为大模型定价之锚:让每个人都能在本地跑顶级智能,数据不上云,隐私和响应速度完全可控。3万块主机跑三年,换一个完全属于自己的AI助理,隐私和效率的账算下来,比被云厂商割韭菜值多了。我断言,以后云模型定价都得看它脸色。

6. Qwen 27B这波操作,不只是又发了个模型、定了个价。它真正牛逼的地方是:把高智商推理从数据中心“释放”到了个人电脑。从前只能集中供给,现在包产到户,你家4090、我家电脑都能跑。这还带出一个新玩法——闲置算力共享第一次变得可行了,像水电气一样能调度。你卡闲了借给别人跑矩阵,别人的卡闲了借给我,爽。 国产算力也终于有了明确靶子,不用再追着旗舰屁股跑,就盯着27B优化,做到又快又省,生态就能转起来。而模型本身,能干掉你90%的工作,还带视觉,看屏幕、识图、标边界框,全都能干。真的,非常完美。 阿里云和DeepSeek一样伟大。一个把推理价格打下来,一个把高智商多模态大模型从机房搬到个人电脑,重新定义了推理定价。作为程序员,我准备部署Qwen3.8-27B未审计版了,期待。 全文见:网页链接

7. 美元这些年靠什么随便印钞?背后得有硬核资产池撑着。以前是房地产,后来是科技叙事,AI 成了新锚。美国大模型定价多狠?OpenAI 敢收天价,Anthropic 输出敢要 25 美元,不是值这个价,是没便宜的对标品。 但 DeepSeek 一出,定价锚直接松了。Pro 输出 1.1 美元,Flash 只要 0.55 美元,性能差距不大,直接把大模型拉下神坛。后来阿里开源 Qwen3.8-27B,更狠——本地跑,一台 4090 主机三年总成本 36480 元,能产 9331 亿 token,折合每百万 token 才 3.9 元人民币。对比 Anthropic Opus 4.6 的 180 元,差了 47 倍。 这定价权还怎么维持?所以美国政府为什么死磕中国开源AI?因为这本该是美元下一个锚定物,结果被我们一铲子撅了。 全文见:网页链接

8. 成本与隐私的最优解,其实就靠qwen3.8 27B这个模型把两头接起来了。 一端是中转站,便宜是真便宜,但数据全程裸奔,灰产、投毒、卖数据都是常态,微信邮件账本这种敏感活绝不能交出去。另一端是纯本地,隐私满分,但硬件贵,小模型智能不够。 27B正好卡在中间:**所有涉及隐私的脏活累活——搜资料、扒数据、整理半成品——全在本地跑,数据不出门。** 中转站的贵价模型只干一件事:收口和决策,拿本地整理好的信息做最后判断、派活,它接触到的只有你允许漏出去的那一点点,泄了也不怕。 这么一分工,等于既白嫖了顶尖算力,又不怕数据被卖。便宜和隐私两头都占了一点,又都没完全牺牲。折衷的智慧,这就是最优解。 全文见:网页链接

9. 阿里悄悄把Qwen3.8-27B开源了,270亿参数,262K上下文,外推能到100万,两天下载破百万,直接登顶Hugging Face全球趋势榜。我当天就装进了两年前买的4090台式机(24G显存+128G内存,全套3万块),跑Q4量化,每秒100 tokens,丝滑流畅,智商极高。本地接上Deepseek harness和Claude Code当主力工作智能体,完全OK,真的哇塞。这玩意儿基本就是个人电脑上能跑的Opus 4.6,从此不再靠梁文锋良心发现打折,每个人都能本地推理,彻底替代deepseek v4 flash,成为大模型时代真正的定价之锚。但本地跑它的核心卖点不是便宜,是三万块预算内,给你一个完全隐私的AI助理,还能省下大笔tokens费用。 全文见:网页链接

10. 我让Qwen3.8翻了翻这两天的agent日志,12个会话,1400多次工具调用,九成九都是执行活——跑bash、写脚本、改文件、爬数据、同步平台。真正需要高智商大模型收口的,就两个任务:看子代理反馈,定下一步方向。剩下的,本地27B全干了。 一周一亿token的用量,大半烧在执行的粗活上。我把这些先下放到本地27B,搞不定的再用ds v4flash兜底,贵价模型只留收口那步。一个月成本压到300块不难,加上电费500以内,压力不大。上个月同事干出去一万块token费,上线本地27B后,这部分是实打实能省下来的。 算账不是重点。重点是27B本地模型能干很多活,这会改掉我们使用大模型的方式——别把所有token都喂给贵价模型,执行层完全可以用小模型跑,省下钱干更聪明的事。 全文见:网页链接

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章