当前位置:
AIGC文章详情

千问开源Qwen3.8-Flash-Next实测:开发者如何快速接入部署?

源自120位全网作者

01:37

内容由AI生成

精选参考来源

1. 阿里通义Qwen3.8-Flash发布:125B参数MoE模型,每token仅激活6B

2. 阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9

3. 又炸场!阿里Qwen3.8-Flash-Next发布:125B参数、激活仅6B

4. Qwen3.8-Flash 开源:激活只有 6B,训练成本降到九分之一

5. 3090本地跑27B,Qwen3.8真行

6. 我部署了qwen 3.8 27B,在pg500-216上跑的(v100s pcie oem版)。速度不是很理想,输出大约30 tok/s。如果开mtp,可以达到40+。但也就这样了。 好像llama.cpp现在支持response api了,可以配置codex搭配它使用。 qwen 3.8 27b, 缺点就是慢。因为它是dense模型,每token都要把完整权重扫一遍,所以会遇到内存墙。速度3090/4090系列,速度都在20-40左右,高不到哪里去,使用体验比较差。 不过,qwen 3.8 27b,跑分还是可以的。live code bench v6,达到90+,跟opus老版本一个水平。live code bench题库是更新的,所以刷题可能性较小(但也未必不能刷,毕竟qwen3.8刚出来,live code bench v6出来有一段时间了)。但是,开源模型一般不会刷,因为别人可以等live code bench v7出来再测,如果分数暴跌,那就丢人了。 live code bench高分,说明不了太多问题,因为这个是小规模编程题,不能体现大规模架构能力。 现在llama.cpp已经支持response api了。我把它接入codex,居然真的能用。然后,加载了多模态,拖了一张图片,居然真的能识图,神奇。后来我又拖了个视频进去,结果codex要给我安装抽帧工具,想抽取关键帧看。

7. DFlash2实测:最高4.07×

8. Qwen3.8-27B-4bit(16GB)+ DFlash2 草稿模型(3.9GB) - 哔哩哔哩

9. 通义千问发布Qwen3.8-Flash多模态MoE模型

10. 拒绝API续费焦虑!Qwen3.8-27B本地部署保姆教程,接入Codex使用

11. 1Cat-vLLM 1.3.0 正式发布!🚀 本次版本重点重构 Tesla V100 / SM70 长上下文 Attention,进一步释放 Volta Tensor Core 性能,并新增 Qwen3.8-27B-FP8 完整适配验证!1.3.0版本提升巨大,欢迎大家多多测试尝鲜! ✨ 1.3.0 核心亮点 ✅ 全新 D=256 长上下文 Attention 内核,有效算力 17.92 → 46.63~47.1 TFLOP/s,约 2.6× 提升 ✅ 针对 V100 重构 Tensor Core 数据流与软件流水线,显著提升长 Prefill 效率 ✅ 优化 E5M2 FP8 KV Cache,进一步降低长上下文开销 ✅ 正式验证 Qwen3.8-27B-FP8 + TP4 + 256K Context ✅ 公开 1K~246K 连续长上下文性能曲线,246K 下 Prefill 仍约 2.02K tok/s,Decode 约 42~43 tok/s ✅ Flash-V100、TurboMind SM70、FlashQLA 等内核全部集成进 Wheel,部署更加简单 这次不只是参数调优,而是继续深入到 V100 Attention 内核和数据流本身。 欢迎大家更新测试、Star、Fork,一起把 V100 / SM70 的性能继续榨出来!🐱

12. 终于搞懂了!llama.cpp启动参数逐行拆解,让1080Ti与P100满血运行Qwen3.8-27B本地部署全攻略,竟能流畅跑满Qwen3.8百K上下文

13. Qwen3.8-27B就是新的模型斩杀线

14. 单张16G显卡塞下27B,Qwen3.8这份教程把本地部署讲透了

15. Qwen3.8 上榜后,别急着下载权重:远程服务器部署前先过这 6 关

16. Qwen3.8 上榜后,别急着下载权重:远程服务器部署前先过这 6 关

17. 爱生活的申宝的微博

18. 千问预告开源新架构模型

19. 3步玩转本地AI:零配置部署FlashAI通义千问完整指南

20. 阿里千问正式发布Qwen3.8-Flash

21. 阿里通义Qwen3.8-Flash开源,训练成本仅前代九分之一

22. 全新架构,极致性价比!阿里千问Qwen3.8-Flash发布并开源

23. Qwen 3.8 27B大模型本地部署指南:从环境准备到API集成实战

24. Qwen3.8-27B大模型本地部署优化实战:量化与推理后端选择指南

25. qwen3.8-27b量化模型实测对比情况

26. Deepseek涨价之后,我决定在一张16g显卡上

27. 给 llama-server 加两个参数,Qwen3.8-27B速度提升 30%

28. 花生AI也能做同款

29. 终于搞懂了!llama.cpp启动参数逐行拆解,让1080Ti与P100满血运行Qwen3.8-27B本地部署全攻略,竟能流畅跑满Qwen3.8百K上下文

30. Qwen3.8在GB10实测:一天三轮优化,解码翻倍

31. Qwen 3.8大模型部署指南:2.4T混合专家架构本地化实践

32. 阿里Qwen3.8-2.4T大模型炸场!紧咬Fable5,价格仅1/10

33. 超越Opus4.6 Max!私有部署 Qwen3.8-27B +DeepSeek Harness,快人一步Token自由

34. 🎉 16G丐版 M1部署 Qwen3.8-27B实测报告

35. 16G显卡qwen38-27b本地最佳实践-token自由

36. DFlash2实测:最高4.07×

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章