当前位置:
AIGC文章详情

125B参数只激活6B!千问新模型把大模型部署成本打下来了

源自239位全网作者

01:31

内容由AI生成

精选参考来源

1. Qwen3.8-Flash 开源:激活只有 6B,训练成本降到九分之一

2. 我部署了qwen 3.8 27B,在pg500-216上跑的(v100s pcie oem版)。速度不是很理想,输出大约30 tok/s。如果开mtp,可以达到40+。但也就这样了。 好像llama.cpp现在支持response api了,可以配置codex搭配它使用。 qwen 3.8 27b, 缺点就是慢。因为它是dense模型,每token都要把完整权重扫一遍,所以会遇到内存墙。速度3090/4090系列,速度都在20-40左右,高不到哪里去,使用体验比较差。 不过,qwen 3.8 27b,跑分还是可以的。live code bench v6,达到90+,跟opus老版本一个水平。live code bench题库是更新的,所以刷题可能性较小(但也未必不能刷,毕竟qwen3.8刚出来,live code bench v6出来有一段时间了)。但是,开源模型一般不会刷,因为别人可以等live code bench v7出来再测,如果分数暴跌,那就丢人了。 live code bench高分,说明不了太多问题,因为这个是小规模编程题,不能体现大规模架构能力。 现在llama.cpp已经支持response api了。我把它接入codex,居然真的能用。然后,加载了多模态,拖了一张图片,居然真的能识图,神奇。后来我又拖了个视频进去,结果codex要给我安装抽帧工具,想抽取关键帧看。

3. 超越Opus4.6 Max!私有部署 Qwen3.8-27B +DeepSeek Harness,快人一步Token自由

4. Qwen3.8-Flash:全新架构,更强更稳更划算

5. DFlash2实测:最高4.07×

6. 阿里Qwen3.8正式发布:总参数量2.4万亿,第三方榜单仅次于Claude

7. 科技微指数的微博

8. Day 0 Support for Qwen 3.8 on AMD Instinct GPUs

9. DGX Spark (GB10) 模型实战:从 Qwen3.8-27B 的 4 tok/s 到 Nemotron 3 Nano 的 56 tok/s

10. Qwen 3.8 27B 开源发布:一台消费级显卡就能跑的多模态大模型,编码能力叫板 Claude Opus

11. Qwen 3.8 27B开源大模型:性能与成本的甜点级选择

12. 2.4万亿参数Qwen3.8首日实现九芯适配,众智FlagOS释放多元算力产业价值

13. DFlash 2 Implementation Boosts Qwen 3.8 27B Inference Speed in llama.cpp

14. Qwen 3.8 27B Sets New Performance Baseline for Local Agentic Coding

15. Comprehensive Qwen3.8-27B Study on DGX Sparks: Quantization, Speculative Decoding, and TP/DP Scaling

16. Codex+llama.cpp+Qwen3.8-27B,RTX4090跑55t/s AI编程实测

17. Qwen3.8-27B开源,你家电脑就能跑“世界级”大模型!

18. Deepseek涨价之后,我决定在一张16g显卡上

19. 智谱的GLM-5.3终于开榜了,国产模型的年中上新,在今天算是告一段落啦。 AA竞技场标准的满功率版本排名的话: Kimi K3和GLM-5.3并列刚刚及格,是中国进T1阵营里的两个模型,与GPT-5.6和Claude Opus 5在一梯队。 Kimi K3属于老模型了,含金量更高些,月之暗面是颇有意外的AI公司。 唐杰说GLM-5.3是在控制变量,后训练迭代,不动基座、架构和参数,有这么大的提升,有惊喜。 第二档是Qwen3.8 Max和DeepSeek-V4-Pro、以及Qwen3.8 27B,性能与性价比的极致。 阿里的Qwen3.8这一代真心不错,Max版本开源,27B版本相当Opus at home,在Hugging Face,Qwen被下载了20亿次以上,比第2名到第5名加起来还多。 DeepSeek-V4-Pro感觉应该是出了点问题,很多人说的没错别太早下定论。 第三档是MiniMax-M3、MiMo-V2.5-Pro、Hy3,主打够用,便宜还要啥自行车呢? MiniMax垫给了智谱,M3原生多模路线比不过纯Coding,靠视频模型找回点脸面。 在DeepSeek-V4-Flash发布之前,小米的MiMo在OpenRouter上是性价比之王,跑自动化工具链的低价值高频次任务也相当扛打。 腾讯的Hy3是姚顺雨的作品,有点翻盘的意思,中美两边开花,支持WokrBuddy的功劳,又有OpenRouter价格战开打的成绩,均衡双修。 第四档就差点意思啦,蚂蚁的Ling 3.0 Flash、美团的LongCat 2.0,阶跃的Step 3.7 Flash,几乎没通用场景,只能细分领域。 聪不聪明你只管用,就问你快不快吧?在不追的工业化解决问题方案的任务里是还是有一定价值的。 最后,百度文心ERNIE 5.0应该不参战,就没胜负,精髓。 #条友这一周##爆料##AI妙生图##探寻人工智能,人与AI全新序章##AI写真辑#

20. 花生AI也能做同款

21. [中配]Qwen 3.8 27B NVFP4 在单张 RTX 5060 Ti 上的性能测试:16 到 29 Tokens/s

22. 拯救吃灰显卡!5060Ti 极限挑战 Qwen3.8-27B 记录

23. 英伟达服务器涨价超15%!百亿AI基建的「内存难题」

24. 终于搞懂了!llama.cpp启动参数逐行拆解,让1080Ti与P100满血运行Qwen3.8-27B本地部署全攻略,竟能流畅跑满Qwen3.8百K上下文

25. 0成本云端部署qwen3.8-27B尝鲜。一波波商业模型的涨价,让大家越来越意识到本地部署模型真的不是伪需求,Qwen3.8-27B一发布也是引爆了一波热度。 但大部分同学没有足够性能的设备来部署这个性能怪兽,我这篇提供了一个邪修的思路,利用kaggle的免费加速器性能,实现0成本云端部署,非常适合想体验尝鲜的同学。 一、部署教程(详见图文/文字可复制版本放在知识库【Qwen3.8】) 1. copy代码到自己的账号(需要注册账号) 2. 选择好配置 3. 一步步运行代码直到出现模型对话框,即可开始跟Qwen3.8对话。 二、项目不足之处提前告诉你 - 该项目是利用 Kaggle 平台的免费羊毛,且用且珍惜 - 云端部署,相较本地部署,会有更多的不稳定,比如网络波动 - 每周 30 小时的限额,体验尝鲜可行,但作为生产力,仍然需要升级设备 - 尝试了配置 API,但直接爆内存,依然需要升级设备 三、适合谁? - 没有足够设备,想体验测试Qwen性能如何 - 想评估值不值得升级设备 但如果你想用来做生产力,仍然需要做升级以获得更好的体验。 #知识库【Qwen3.8】#Qwen #模型选型 #成本模型 #开源部署

26. Qwen3.8-27B 介绍报告

27. 国盛证券点评Qwen3.8:2.4T参数跻身全球第一梯队,性能与性价比双突破

28. 和众汇富研究手记:阿里Qwen3.8迈入万亿参数时代

29. 阿里Qwen3.8正式发布:总参数量2.4万亿,第三方榜单仅次于Claude

30. 种斌Marco的微博

31. 国产开源双爆:Qwen3.8-Max 与 DeepSeek V4-Flash 同日亮剑,开发者该怎么选?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章