当前位置:
AIGC文章详情

通义千问开源Qwen3.8-Flash,125B参数激活仅6B,4090可直接部署

源自245位全网作者

08-26 23:59

内容由AI生成

精选参考来源

1. Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!

2. #智驾数码团# 8月21日成都车展,捷达M6甩掉传统套路,高管带队“边逛边聊”,联手萌兰、茶百道打造沉浸式展台,连脱口秀演员庞博都来当“首席体验官”替用户发问。这场“捷达来电,百道皆达”的亮相,藏着捷达35年德系底色的焕新野心。作为“超舒适AI纯电大家轿”,M6主打“德系精工+中国科技”:悦行AI座舱集成豆包、DeepSeek、通义千问三大模型,老人小孩都能轻松语音控车;91.3%得房率+2820mm轴距,配上云感零压座椅,实现B级尺寸、C级享受;更有中国中车九合一电驱加持,历经两冬两夏严苛测试,靠谱是刻在基因里的底线。即日起66元开启盲订,膨胀礼、置换礼、优先提车礼、权益叠加礼四重福利拉满。从燃油“国民神车”到纯电大家轿,捷达正用最务实的节奏证明:新能源时代,家用车最值得信赖的,依然是那份不追风口的可靠与温度!#成都车展潮这看##2026成都车展#

3. 智谱联合创始人唐杰老师关于 GLM 5.3 以及模型训练的一些分享:智谱 GLM-5.3 没有换基模底座,纯靠后训练让编码能力提升 50%。GLM-5.3 模型的底座是 GLM-5.2,约 743B 参数的混合专家(MoE)模型,每次推理只激活约 40B 参数。团队花了一个月,在长周期环境中做强化学习,编码能力比 GLM-5.2 提升了 50%。这里解释一下 MoE:传统模型每次推理要跑完所有参数,MoE 相当于把模型拆成一群“专家”,每次只调用其中几个,推理速度更快、成本更低。推文中特别区分了两个概念:1. 总参数量决定模型学习了多少知识2. 激活参数量和有效深度决定模型能想多深。比如说,让模型去找安全漏洞,主要是依赖的是推理能力,能把一条二十步的推理链完整走到底,相对来说各种安全数据库是次要的。至于为什么不换底座也能大幅提升呢?AI 模型的扩展(scaling)不止堆参数这一条途径。如果梳理下这些年模型训练的发展路线:- 2020 年 Kaplan 等人的研究建议参数增长要远快于数据,GPT-3、Gopher 都是这个思路的产物。- 2022 年 DeepMind 的 Chinchilla 论文则认为参数和数据应该同步增长,参数大的模型反而是最浪费算力的。- 再后来,大家发现模型上线后推理成本远超训练成本,最优解又变成了用更小的模型训更久,比如 Llama-2-7B 每个参数喂了约 290 个 token,Gemma-2-9B 更是喂了 889 个。模型能力由很多因素决定:底座大小、预训练数据量、每次前向传播的计算量、后训练。对于现阶段,模型后训练还有很大潜力可以挖掘。

4. 玄戒D100,国内首款 3nm 智驾高算力 AI 芯片。采用 3nm 先进工艺,20 核高性能 CPU 与 16 核高算力 NPU 强劲组合。最高可支持 160GB 统一内存,可本地部署 200B 参数量超大模型。玄戒D100 已经研发完成,明年正式商用。#小米玄戒#

5. #Easy同学正在独立开发#FreeToken 是一个让个人电脑本地跑前沿开源模型的推理服务系统。作者拿它和 Ollama 直接对比:解码速度快 3–4 倍,预填充(prefill)快 6–30 倍。配套技术报告(arXiv 2608.16157)讲清楚了它为什么能快。难点在于:MoE 模型每层有几百个专家,每个 token 只激活其中几个,但完整专家池远超显存。DeepSeek-V4-Flash 有 284B 参数,FP4 部署光专家权重就要搬约 140GB。现有引擎(llama.cpp、Ollama、KTransformers)加载时就把专家固定放在某处,路由随 token 变化后命中率很低;prefill 阶段几乎整个专家池都要过一遍 PCIe,笔记本上光等传输就要 10 秒以上;Agent 每轮工具调用还会改写上下文,引发大段重复重算。FreeToken 的核心是"带宽自适应执行"。prefill 用全层双缓冲:GPU 算第 l 层的同时,PCIe 已经在流式搬第 l+1 层的专家,把传输藏在计算后面。decode 阶段按机器实测的两条带宽——PCIe 专家传输带宽和 CPU 端专家处理带宽——算出一个最优比例,把没命中的专家一部分搬进显存、一部分直接在 CPU 上算,两边并行,输出精确合并。另一招是语义感知缓存:在思考段、工具调用、对话轮次的边界保存状态检查点,Agent 改写上下文后只重算新增后缀;decode 用共享 LRU 专家缓存跟随路由变化,大部分访问直接命中显存。显存被浏览器、游戏占走时,缓存还能在运行中重建,不用重启引擎。评测数字:- RTX 5090 上 Qwen3.6-35B 稳定跑 77–83 tok/s、DeepSeek-V4-Flash 跑 22–25 tok/s,比最强基线高 1.5–2.3 倍;- 8GB 显存的 RTX 4060 笔记本跑 35B 模型达到 39.3 tok/s,超过 Codex 生产环境的中位解码速度 33 tok/s;- 单张 RTX PRO 6000 跑 753B 的 GLM-5.2 达 14.9 tok/s,是 llama.cpp 的两倍。多轮 Agent 负载下解码速度只比单轮掉 12%,最差首 token 延迟全部低于 44 秒,而每个基线都在某个场景超过 150 秒。系统支持 20 多款 MoE 模型,代码在 github.com/FlashML-org/FreeToken,下载页 flashml.ai。论文作者包括 Song Han、Matei Zaharia、Ion Stoica。(由 流苏ªⁱ 撰写)#AI##大模型##本地部署# Easy的微博视频

6. 又来一颗,玄戒 D100 发布,国内首款 3nm 智驾高算力 AI 芯片,已经研发完成,明年正式商用。#小米玄戒# 采用 3nm 先进工艺,20 核高性能 CPU 与 16 核高算力 NPU 强劲组合。最高可支持 160GB 统一内存,可本地部署 200B 参数量超大模型。

7. 很久没提过捷达品牌了。捷达M6,是他们给出的新能源时代的第一份答卷。豆包、DeepSeek、通义千问三个AI大模型都上车;地平线征程6M芯片,支持城区智驾辅助,包括开门预警、防误踩、循迹倒车这些功能也都有。总之,就算是科技配置也都是很实在的东西,没有太多“遥遥领先”。价格你可以期待一波,我这么说你懂了哈!借助原来的渠道和品牌优势,新车接住原来捷达品牌的车主不是大问题。#捷达m6全新纯电轿跑正式来袭##2026成都车展##大V聊车#

8. #Easy同学正在独立开发#本地推理加速框架 DFlash 2 正式发布,@zhijianliu_ 在搭载 M5 Max 的 MacBook Pro 上用 Qwen3.8-27B 跑出 70 tok/s,官方称相较自回归解码最高提速 4.6 倍,且输出与原始结果完全一致。DFlash 是投机解码(speculative decoding)方向的加速方案,第一代诞生于 Z Lab,第二代由 Inco AI 接手迭代。原理是用草稿模型并行生成候选 token,再由目标模型验证、跳过已被接受的生成步骤——官方说法是"每次 pass 都免费多接受一个 token"。对本地跑模型的开发者来说,同样的硬件、同样的模型、逐字一致的输出,延迟却可以显著降低。发布后社区很快给出了独立复测。Aaron Edell 在 64GB M4 Pro 上用 Qwen3.8-27B 4-bit 量化复跑:纯 MLX 基线 14.62 tok/s,DFlash 2 达 28.41 tok/s,约 1.94 倍;OdinBench 评测 5/5 全部通过;峰值内存约 20GB;输出与基线逐字一致。他也划出了当前边界:一条 22.6K token、工具调用密集的 Agent 提示词依然会卡 5 分钟以上,完整 Agent 场景还跑不动;但他强调,对有界本地推理(bounded local inference)而言这是巨大的提升。视频为官方发布时的演示:同一任务下,左侧基线需要 2 倍速播放才能展示完,右侧 DFlash 2 实时输出,运行在 Apple M5 Max 上。来源:网页链接(由 流苏ªⁱ 撰写)#DFlash2##MLX##本地推理##投机解码# Easy的微博视频

9. 【以小博大的语音克隆:Audio8-TTS 0.6B 预览版发布】Audio8-AI 近期发布了 Audio8-TTS 预览版(Audio8-AI/Audio8_TTS),主打轻量级高性能。该模型参数量仅为 0.6B,甚至提供了更精简的 0.1B 版本,采用受 Fish Audio 启发的 DualAR 架构,支持中文、英文、粤语等 11 种语言。它最核心的能力是零样本语音克隆,仅需短促的参考音频即可复刻音色。在 Seed-TTS 等行业基准测试中,这个“小个子”在字错率 WER 和音色相似度上的表现,足以硬刚参数量大其数倍的 Fish S2 Pro 或 MOSS-TTS 等 SOTA 模型。这件事传递了一个明确信号:语音 AI 正在从盲目堆砌参数转向极致的推理效率。0.6B 的体积意味着它能在普通消费级显卡甚至 CPU 上流畅运行,RTF 实时率低至 0.116,为端侧私有化部署扫清了障碍。虽然预览版在语种覆盖和长文本稳定性上仍有局限,但它证明了通过架构优化,小模型也能在情感表达上表现出极高的完成度。对于追求实战效果而非参数叙事的开发者来说,这种高能效比的工具往往比庞然大物更有生命力。

10. 全球首发!阿里Qwen3.8-2.4T-A95B震撼开源,性能捅破天,推理成本降至冰点!

11. 阿里Qwen3.8-Max:2.4万亿参数对决

12. 今天学了一个知识点,跟我一样的小白可以收藏一下,你以后一定会用得到。 到底什么样的模型是稠密模型,什么样的模型是稀疏模型 你可能经常看到两个单词:Dense && MoE。他们就是稠密模型(Dense)和 稀疏模型(MoE)。 那这哥俩到底差别在哪里呢? 一句话就能判断:模型每处理一个 token,是不是把全部参数都用上了。 稠密模型就是全部都用上;而稀疏模型是只挑一小撮专家出来干活,其余的躺着不动。 看图中的 Qwen-3.8-27B和Qwen3.8-2.4T-A95B 27B = 270 亿参数,2.4T = 2.4 万亿参数 关键点就在于2.4T后面的 “A95B”:2.4T 总参数 / 95B(970亿)激活 稠密模型 Dense(Qwen-3.8-27B):每生成一个 token,网络的全部权重都要参与计算。27B 就是实打实的 27B 全跑一遍。 稀疏模型 MoE(Qwen3.8-2.4T-A95B):模型内部有 512 个「专家」小模块,每处理一个 token,只叫醒其中 10 个来干活,另外有 1 个专家是常驻的、每次都参与。所以虽然模型总共 2.4 万亿参数,实际每个 token 只用到约 950 亿——剩下的都在睡觉

13. 下载了千问3.8之后,我发现网上都吹错了重点

14. 下载千问3.8前,需避开哪些宣传误导与体验坑?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章