当前位置:
AIGC文章详情

1块钱百万Tokens!6B激活125B,这4款轻量模型谁最强

源自222位全网作者

01:59

内容由AI生成

精选参考来源

1. 阿里云AI团队发布Qwen3.8Flash:125B参数仅激活6B算力,为何能碾压行业性价比?

2. 阿里千问正式发布Qwen3.8-Flash

3. Phi-3免费开源超强AI模型!电脑手机本地一键部署

4. Phi-3 Forest Lab实战案例:用3.8B参数实现Mixtral级推理效果

5. Phi-3-mini-4k-instruct-gguf快速上手:支持中文的4K上下文轻量模型,首测仅需30秒

6. Gemma-2B-10M:32GB显存跑千万级上下文的工程突破

7. MiniCPM5 1B SFT — Hardware Requirements & GPU Compatibility

8. 中小团队AI落地终极指南:零预算也能跑通的4款轻量化国产大模型(支持单卡A10/A800部署,附量化后精度损失实测对比表)

9. 中小团队AI落地必读:轻量化模型排行榜TOP8实战测评(GPU显存<8GB、API调用成本<$0.02/千token)

10. 通义千问Qwen3.8-27B开放权重:原版和FP8怎么选

11. Qwen3.8-27B-DFlash2 开源:1.92B 草稿模型,SGLang 单并发吞吐达自回归 3.4 倍

12. 特刊01:DGX Spark 本地大模型(Qwen3.6和 Qwen3.8)推理性能实测报告

13. Qwen3.8-27B就是新的模型斩杀线

14. 实测 Qwen3.8‑27B:相较 Qwen3.6,代码与自主 Agent 能力到底进化在哪

15. 我部署了qwen 3.8 27B,在pg500-216上跑的(v100s pcie oem版)。速度不是很理想,输出大约30 tok/s。如果开mtp,可以达到40+。但也就这样了。 好像llama.cpp现在支持response api了,可以配置codex搭配它使用。 qwen 3.8 27b, 缺点就是慢。因为它是dense模型,每token都要把完整权重扫一遍,所以会遇到内存墙。速度3090/4090系列,速度都在20-40左右,高不到哪里去,使用体验比较差。 不过,qwen 3.8 27b,跑分还是可以的。live code bench v6,达到90+,跟opus老版本一个水平。live code bench题库是更新的,所以刷题可能性较小(但也未必不能刷,毕竟qwen3.8刚出来,live code bench v6出来有一段时间了)。但是,开源模型一般不会刷,因为别人可以等live code bench v7出来再测,如果分数暴跌,那就丢人了。 live code bench高分,说明不了太多问题,因为这个是小规模编程题,不能体现大规模架构能力。 现在llama.cpp已经支持response api了。我把它接入codex,居然真的能用。然后,加载了多模态,拖了一张图片,居然真的能识图,神奇。后来我又拖了个视频进去,结果codex要给我安装抽帧工具,想抽取关键帧看。

16. Qwen3.8-27B开源,你家电脑就能跑“世界级”大模型!

17. 3090本地跑27B,Qwen3.8真行

18. 16G显卡qwen38-27b本地最佳实践-token自由

19. 全球大模型与开发框架汇总:闭源开源训练推理全覆盖

20. Harness 神器 J-Space 造假案背后,思维链作者暴论,小模型 + 工具干不掉顶级大模型

21. Qwen3.8-Flash-Next

22. Qwen3.8-Flash发布,我们看到了Qwen4的骨架

23. Qwen3.8-Flash 开源:激活只有 6B,训练成本降到九分之一

24. 我部署了qwen 3.8 27B,在pg500-216上跑的(v100s pcie oem版)。速度不是很理想,输出大约30 tok/s。如果开mtp,可以达到40+。但也就这样了。 好像llama.cpp现在支持response api了,可以配置codex搭配它使用。 qwen 3.8 27b, 缺点就是慢。因为它是dense模型,每token都要把完整权重扫一遍,所以会遇到内存墙。速度3090/4090系列,速度都在20-40左右,高不到哪里去,使用体验比较差。 不过,qwen 3.8 27b,跑分还是可以的。live code bench v6,达到90+,跟opus老版本一个水平。live code bench题库是更新的,所以刷题可能性较小(但也未必不能刷,毕竟qwen3.8刚出来,live code bench v6出来有一段时间了)。但是,开源模型一般不会刷,因为别人可以等live code bench v7出来再测,如果分数暴跌,那就丢人了。 live code bench高分,说明不了太多问题,因为这个是小规模编程题,不能体现大规模架构能力。 现在llama.cpp已经支持response api了。我把它接入codex,居然真的能用。然后,加载了多模态,拖了一张图片,居然真的能识图,神奇。后来我又拖了个视频进去,结果codex要给我安装抽帧工具,想抽取关键帧看。

25. Qwen3.8-27B 介绍报告

26. Qwen3.8-27B就是新的模型斩杀线

27. 抛弃对大模型的幻想,这才是普通人可落地的Ai赛道

28. 阿里发布Qwen3.8-Flash,开源下一代Qwen4模型架构雏形

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章