通义千问3.8-Flash发布:训练成本仅前代1/9,价格打三折,支持100万token上下文

源自227位全网作者

20:30

内容由AI生成

精选参考来源

1. 阿里通义 Qwen3.8-Flash(Next)发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9

2. 阿里智谱同日上新,效能与性价比重塑大模型竞争

3. Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding

4. 千问办公推出全新模式,Agent迎来量大管饱时代

5. Qwen3.8-Flash-Next

6. 千问开源Qwen3.8-Flash-Next架构,轻量化多模态大模型实现效能突破

7. Easy的微博

8. 基于下一代Qwen4架构,阿里千问明晚开源Qwen3.8-Flash-Next

9. 阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9

10. 阿里发布Qwen3.8-Flash模型并开源

11. 蚁工厂的微博

12. 大模型定价之锚问世——堪比 Opus 4.6 的本地 Qwen3.8-27B

13. 终于搞懂了!llama.cpp启动参数逐行拆解,让1080Ti与P100满血运行Qwen3.8-27B本地部署全攻略,竟能流畅跑满Qwen3.8百K上下文

14. Qwen3.8-27B开源,你家电脑就能跑“世界级”大模型!

15. 1Cat-vLLM 1.3.0 正式发布!🚀 本次版本重点重构 Tesla V100 / SM70 长上下文 Attention,进一步释放 Volta Tensor Core 性能,并新增 Qwen3.8-27B-FP8 完整适配验证!1.3.0版本提升巨大,欢迎大家多多测试尝鲜! ✨ 1.3.0 核心亮点 ✅ 全新 D=256 长上下文 Attention 内核,有效算力 17.92 → 46.63~47.1 TFLOP/s,约 2.6× 提升 ✅ 针对 V100 重构 Tensor Core 数据流与软件流水线,显著提升长 Prefill 效率 ✅ 优化 E5M2 FP8 KV Cache,进一步降低长上下文开销 ✅ 正式验证 Qwen3.8-27B-FP8 + TP4 + 256K Context ✅ 公开 1K~246K 连续长上下文性能曲线,246K 下 Prefill 仍约 2.02K tok/s,Decode 约 42~43 tok/s ✅ Flash-V100、TurboMind SM70、FlashQLA 等内核全部集成进 Wheel,部署更加简单 这次不只是参数调优,而是继续深入到 V100 Attention 内核和数据流本身。 欢迎大家更新测试、Star、Fork,一起把 V100 / SM70 的性能继续榨出来!🐱

16. 给 llama-server 加两个参数,Qwen3.8-27B速度提升 30%

17. Kimi K3仍领先Qwen3.8 Max

18. DFlash2实测:最高4.07×

19. 3090本地跑27B,Qwen3.8真行

20. 花生AI也能做同款

21. 🎉 16G丐版 M1部署 Qwen3.8-27B实测报告

22. 刚刚,Qwen3.8-Flash震撼发布,我们看到了Qwen4的骨架

23. Qwen3.8-Flash-Next 发布了,但 8G/16G 显卡还是跑不动:一份给普通折腾党的落地清单

24. 头顶两撮小呆毛的微博

25. 翔宇情-faketo的微博

26. 在 Mac Studio 上运行Qwen3.8-27B测评对比

27. 我部署了qwen 3.8 27B,在pg500-216上跑的(v100s pcie oem版)。速度不是很理想,输出大约30 tok/s。如果开mtp,可以达到40+。但也就这样了。 好像llama.cpp现在支持response api了,可以配置codex搭配它使用。 qwen 3.8 27b, 缺点就是慢。因为它是dense模型,每token都要把完整权重扫一遍,所以会遇到内存墙。速度3090/4090系列,速度都在20-40左右,高不到哪里去,使用体验比较差。 不过,qwen 3.8 27b,跑分还是可以的。live code bench v6,达到90+,跟opus老版本一个水平。live code bench题库是更新的,所以刷题可能性较小(但也未必不能刷,毕竟qwen3.8刚出来,live code bench v6出来有一段时间了)。但是,开源模型一般不会刷,因为别人可以等live code bench v7出来再测,如果分数暴跌,那就丢人了。 live code bench高分,说明不了太多问题,因为这个是小规模编程题,不能体现大规模架构能力。 现在llama.cpp已经支持response api了。我把它接入codex,居然真的能用。然后,加载了多模态,拖了一张图片,居然真的能识图,神奇。后来我又拖了个视频进去,结果codex要给我安装抽帧工具,想抽取关键帧看。

28. 大模型定价之锚问世——堪比 Opus 4.6 的本地 Qwen3.8-27B

29. 单卡 2080Ti 22G 跑 Qwen3.8-27B Q4 结果实测:32K 上下文,10token/s

30. Qwen3.8-27B-4bit(16GB)+ DFlash2 草稿模型(3.9GB) - 哔哩哔哩

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章