阿里Qwen3.8-Max-0902夺编程总榜冠军,每百万Token仅5美元不到对手四分之一

源自246位全网作者

13:26

内容由AI生成

精选参考来源

1. #阿里发布Qwen3.8Flash# 看完Qwen3.8‑Flash的发布,最大感受是大模型的竞争逻辑真的变了。过去大家总拼堆参数冲极限性能,代价却是训练、推理成本一路走高,放到智能体多轮调用的真实场景,高额开销很难落地。这次千问没有单纯扩大模型规模,而是从底层架构动手,GDN+QSA混合注意力、残差、嵌入层多处系统性改造,总参数虽高,但每token仅激活6B,训练成本直接压到前代的1/9。同步开源的Qwen3.8‑Flash‑Next,更是Qwen4架构的提前预览,让社区可以提前参与验证新方案。实测层面性能已经超过Opus4.6,逼近Opus4.8。更重要的是它降的不只是调用价格,还有任务整体成本,更少出错重试,同一份算力可以承载更多实际业务。这预示着行业正在转向,不再一味追逐纸面最强模型,而是追求用最低成本交付够用的智能,把算力真正转化成能解决现实问题的能力。

2. 刚刚,Qwen3.8-Flash震撼发布,我们看到了Qwen4的骨架

3. 千问AI平台刚刚上线了一个新模型,叫 Qwen3.8-Flash,主打极致性价比。在编程、Agent 这类真实任务里,它的价格低到让人有点意外。输入每百万个 Token 只要 0.8 元,输出 2.7 元,缓存命中更是低到每百万 0.1 元。换算到国际站,输入 0.15 美元,输出 0.47 美元,缓存命中 0.016 美元。那它为什么能这么便宜?关键在模型本身。Qwen3.8-Flash 是一个多模态混合专家(MoE)模型,总参数上千亿,但实际只激活 60 亿,用极少的算力干活,效率直接刷新了业界基准。它的架构和此前所有千问模型都不一样:注意力上用了自研的 QSA 稀疏注意力,和 GDN 组合成混合注意力,大幅降低计算开销,在百万 Token 的高缓存命中长上下文场景里能快 8 倍以上,又准又快;内部通信上引入 Gated Residual 方法,把原来的一条信息主通道拆成四条,让模型按需动态读写,信息传得更高效,训练也更稳定;参数扩展上加了 51B 的 N-gram Embedding 参数,相当于给模型外挂了一本记忆指南手册,几乎不费资源就把参数规模撑大了;调参上结构和后期优化协同进行,收敛效率和训练吞吐都明显提升。这些技术换来的直接好处,就是训练和推理成本大幅下降。API 已经首发上线千问AI平台,开发者可以直接调用 API 或者买 Token Plan。特别适合 Agent 这类场景,因为智能体任务输入特别长,缓存命中价格越低,综合成本越省。千问办公的标准模式现在也内置了 Qwen3.8-Flash,日常办公任务大概能完成 95%。更值得关注的是,这套 Next 新架构是下一代千问大模型 Qwen4 的雏形,相关权重已经在 Hugging Face 和魔搭社区全面开源,交给大家检验。目前 Qwen3.8 系列里,2.4T 参数的 Qwen3.8-Max、27B 和 Flash 三个尺寸都已开源并上线千问AI平台对外提供 API。想体验的话,千问AI平台和 QwenCloud 都能直接打开,链接放在下面。千问AI平台:www.qianwenai.com/models/qwen3.8-flash QwenCloud:www.qwencloud.com/models/qwen3.8-flash#科技先锋官##How I AI##阿里发布Qwen3.8Flash#

4. #阿里发布Qwen3.8Flash#一款模型真正跑进Agent,成本不能只按一次回答来算。资料检索、内容生成、工具调用、修改排版,一项任务背后可能是几十次调用和数十万Tokens,模型既要能力够用,也要跑得快、跑得稳,价格还得扛得住长期使用。Qwen3.8-Flash只激活6B参数,多项评测超过Opus4.6、接近Opus4.8,训练成本相比Qwen3.7-Plus下降近90%。参数不大,却能承担编程、办公和长程任务,这种单位算力产出,才适合高频工作流。整个Qwen3.8系列,Max负责探索能力上限,27B方便本地部署和开发者二次适配,Flash进入日常办公与规模化业务,Flash-Next则提前把下一代架构交给开源社区验证。四个位置各有分工,也彼此衔接。模型榜单决定技术高度,真实任务决定它能走多远。Qwen3.8-Flash要解决的,就是让足够强的智能真正经得起反复调用。

5. #阿里发布Qwen3.8Flash# 阿里千问又扔了个炸弹——Qwen3.8-Flash正式发布,同时开源了Qwen3.8-Flash-Next。我看完第一反应是:大模型行业的竞争逻辑,真的变了。 先给大家翻译一下这玩意有多猛。Qwen3.8-Flash是个MoE模型,总参数125B,但每token只激活6B。什么概念?就是用一个小模型的算力消耗,干出了接近旗舰模型的活。 官方数据是:编程、智能体、专业工作、多模态这些评测,完爆Opus 4.6,逼近Opus 4.8。训练成本比上一代Qwen3.7-Plus直接降了90%,推理成本也大幅下降。 整个行业都在往这个方向走——过去大家比的是"谁的模型参数更大、谁的跑分更高",现在比的是"谁能用更低的成本,交付足够强的智能"。 阿里这波的生态布局。Qwen3.8系列不是单蹦一个模型,而是一套组合拳: - Qwen3.8-Max负责冲高,在复杂推理和编程上冲击SOTA,告诉业界"我们能做到多强";- Qwen3.8-27B负责铺生态,把高水平能力带到消费级硬件,让开发者能本地部署、二次开发;- Qwen3.8-Flash负责接最大规模的真实使用,办公、编程、Agent、高并发业务,全靠它扛量。 而且这次还开源了Flash-Next,这其实是Qwen4下一代架构的提前预演。把下一代技术路线开放给社区,让开发者提前做框架适配和部署优化,同时收集真实反馈反哺架构演进——这步棋走得很聪明。 还有个细节我很关注:千问办公已经上线了专属版的Qwen3.8-Flash,官方说能完成95%的日常办公任务。这就是"模A一体"的思路——模型团队和应用团队协同优化,不是模型做完扔给应用方就完事了,而是联合调,把Agentic能力拉满。 叠加Qwen全球超30亿下载、30万个衍生模型的底子,这波发布等于同时占住了模型能力、开源生态和商业落地三个位置。 最后说句我的判断:大模型行业正在从"军备竞赛"转向"实用主义"。

6. 千问办公上线Qwen3.8-Flash,专治Agent“Token焦虑”,量大管饱Agent圈现在最头疼的,不是模型不聪明,是Token烧不起。IDC预测,2026年我国企业级Token消耗量将同比增长约20倍。重度玩家一天干掉10亿Token,耗费数千美元。而且,同一个任务,Agent工作流的Token消耗是聊天机器人的5到30倍。用AI用出了理财的感觉,打开任务还要先算成本,大伤脑筋。昨晚阿里放出Qwen3.8-Flash,千问办公第一时间接入,同步上线标准模式,模型的Token生成速度提升100%,Token消耗减少75%。先说一下这模型:千亿总参数,仅激活60亿,官方口径性能超越Claude Opus4.6;每百万Tokens输入0.8元,输出2.7元,不到Claude Opus4.6的1/40,比DeepSeek-V4-Flash忙时价格的1/3还低。#景甜下沉市场口碑#

7. #阿里发布Qwen3.8Flash# 阿里昨晚扔了个炸弹,Qwen3.8-Flash,直接把大模型价格打到了地板价。但这不是单纯降价,是底层架构的革命。1250亿参数的MoE模型,每次只激活60亿,靠Qwen4的下一代架构硬生生把训练成本砍了90%。每百万token输入0.8块钱、输出2.7块钱,是Claude Opus4.6的不到3%,DeepSeek-V4-Flash的三分之一。性能呢?完爆Opus4.6,接近Opus4.8。编程评测领先9分,手机操作任务高出22分,视觉数学超25分。注意,这是用九分之一的钱训出来的。特别值得一提的是,在真实任务中,Agent工作需长输入(Input),缓存命中价格对综合成本影响大,Qwen3.8-Flash缓存命中价格低至每百万Tokens 0.1元、国际站0.016美元,特别适合大量、频繁的日常智能体任务,开发者可以极致性价比获取前沿性能。阿里走了一条新路,不卷参数规模了,卷单位算力能承载多少智能。以前是堆GPU堆数据硬刚,现在是从Attention到Embedding全部重做,让每一分算力都转化成有效智能。Qwen3.8-Flash-Next已经开源了,这是Qwen4架构的预览版,智能不一定要那么贵,效率才是下一站。

8. #阿里发布Qwen3.8Flash#据我这个半路出家的文科生了解到,该模型采用下一代 Qwen4 架构,总参数 125B,每 token 仅激活 6B,却实现了超越 Claude Opus4.6 的前沿性能,创下模型效率全球新基准。架构上,Qwen3.8-Flash 带来四大革新:引入 QSA 稀疏注意力机制,1M 长上下文场景提速超 8 倍;自研 Gated Residual 将信息通道拓展为 4 条并行分支;外挂 51B N-gram Embedding 高效扩展模型容量;配合全新优化器大幅提升训练吞吐。成本方面更是惊人——训练成本较上代骤降近 90%,推理定价每百万 Tokens 输入仅 1 元、输出 3 元,仅为 DeepSeek-V4-Flash 的 1/3。模型已同步在 Hugging Face 与魔搭社区开源,并首发上线“千问办公”,开发者可通过千问 AI 平台获取 API 服务。

9. AI时代,还是不能用以前的思维来看待行业发展。之前聊大模型,网友的固有印象都是,参数越大越牛,性能越强越贵,想用好模型就得花大价钱。结果阿里千问刚发的 Qwen3.8-Flash,把这个固有逻辑给干碎了。最夸张的是什么?它只激活6B参数,在编程、智能体、多模态这些实测项目里直接干翻了Opus4.6,性能逼近旗舰级的Opus4.8,结果训练成本比上一代直接降了近90%,推理价格也跟着大幅往下砍。这不是什么降价促销,是从底层架构、训练方法到推理全链路改了,重新算明白了一笔账:怎么用更少的算力,做出接近旗舰模型的能力。而且这次还同步开源了Next版本,相当于把下一代Qwen4的新架构提前放出来给全球开发者检验,不是关起门来自己吹跑分。其实这信号挺明显的,就是AI竞争的风向已经变了,从谁能做出最强的模型,慢慢转向谁能用最低的成本交付够用的智能了。#阿里发布Qwen3.8Flash#

10. #阿里发布Qwen3.8Flash# 大模型这行,过去比的是谁家参数大。千问这次换了个比法:参数可以小,算力不能白烧。Qwen3.8-Flash,激活 6B 参数。编程、智能体、专业工作、多模态几项评测,把 Opus4.6 打穿,贴着 Opus4.8 的脸。训练成本比 3.7-Plus 砍掉近九成。把 Token 的生产成本重做了一遍:Attention、Residual、Embedding、Optimization 四处架构,同一块 GPU 塞进更多请求,吐出更多 Token。开源版 Flash-Next 是 Qwen4 结构预演,先拿出来给社区验货,跟当年 GatedDeltaNet 给 Qwen3.5 试水一个路数。为啥总成本比单价重要?智能体时代,一次任务几十次调用、几十万 token、工具用了一轮又一轮,失败就得重跑。模型能不能铺开用,看的不是单次报价,是做完一件事要烧多少钱。在真实任务中,Agent工作需长输入(Input),缓存命中价格对综合成本影响大,Qwen3.8-Flash缓存命中价格低至每百万Tokens 0.1元、国际站0.016美元,千问这下真的让Agent量大管饱了。所以这波真正的变化是行业从比谁最强,转到了比谁最划算。找最强的模型,不如找最适合自己那个。千问把 Scaling 押在单位算力上,这大概率也是 Qwen4 的路!

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章