125B大模型塞进12G显存,开源引擎Strata实测跑出94词元每秒

源自136位全网作者

18:17

精选参考来源

1
#Easy同学正在独立开发#一张 12-24GB 的显卡加 64GB 内存,就能把 125B 的 Qwen3.8-Flash-Next 跑到 93 tokens/s。Strata 是一个把 Qwen3.8-Flash-Next 跑在本地 PC 上的开源项目,Windows 和 Linux 都有一键安装脚本,除显卡驱动外全部自动装好,磁盘约 80GB。在 RTX 5070(12GB)+ Ryzen 5 7600 + 64GB 内存上:- 输出 53-93 tokens/s(短对话),128K 下 43-74 tokens/s- 读取提示词 1,620-2,180 tokens/s四个量化档位:Q2_0(37.6GB,最快)、IQ2_XS(39.2GB,推荐)、IQ3_XXS(47GB)、IQ3_S(54.8GB,公开测试与原模型持平)。ISTA-DASLab 的 Coder 版本砍掉一半专家,只留写代码和调工具需要的那些,第一分片 29.6GB,32GB 内存就能跑,支持 262K 上下文,作者给出的成绩是原模型的 91.3% SWE-bench Verified、98.7% LiveCodeBench v6。总共 24,576 个专家,每个词只用到其中 10 个,所以不必全放显存:显存里放注意力、路由器和 KV cache,其余空间留给随对话调整的高频专家缓存;全部专家常驻内存,显存里没有的由 CPU 就地计算,与 GPU 并行;SSD 上放 28.8GB 的 n-gram 表。模型自带的 MTP 层先猜最多 3 个后续 token,48 层一次性校验,平均每次产出 2.4-3.2 个 token,官方称快 1.6-1.8 倍且输出不变。启动后在 127.0.0.1:8080 打开网页版,同时提供 OpenAI 兼容接口(/v1)和 Anthropic 兼容接口(/v1/messages),可以挂给 Cursor、Claude Code 等客户端,也支持读图。首次启动要读 35-55GB 进内存,PC 可能卡几分钟。MIT 协议开源,1,746 star、202 fork。网页链接(由 流苏ªⁱ 撰写)#Strata##本地大模型##开源项目# Easy的微博视频
2
一张 RTX 4090 跑起 Qwen 3.8 Flash Next(125B),速度超过 100 tokens/s
全部
来源
内容由AI生成

精选参考来源

1. #Easy同学正在独立开发#一张 12-24GB 的显卡加 64GB 内存,就能把 125B 的 Qwen3.8-Flash-Next 跑到 93 tokens/s。Strata 是一个把 Qwen3.8-Flash-Next 跑在本地 PC 上的开源项目,Windows 和 Linux 都有一键安装脚本,除显卡驱动外全部自动装好,磁盘约 80GB。在 RTX 5070(12GB)+ Ryzen 5 7600 + 64GB 内存上:- 输出 53-93 tokens/s(短对话),128K 下 43-74 tokens/s- 读取提示词 1,620-2,180 tokens/s四个量化档位:Q2_0(37.6GB,最快)、IQ2_XS(39.2GB,推荐)、IQ3_XXS(47GB)、IQ3_S(54.8GB,公开测试与原模型持平)。ISTA-DASLab 的 Coder 版本砍掉一半专家,只留写代码和调工具需要的那些,第一分片 29.6GB,32GB 内存就能跑,支持 262K 上下文,作者给出的成绩是原模型的 91.3% SWE-bench Verified、98.7% LiveCodeBench v6。总共 24,576 个专家,每个词只用到其中 10 个,所以不必全放显存:显存里放注意力、路由器和 KV cache,其余空间留给随对话调整的高频专家缓存;全部专家常驻内存,显存里没有的由 CPU 就地计算,与 GPU 并行;SSD 上放 28.8GB 的 n-gram 表。模型自带的 MTP 层先猜最多 3 个后续 token,48 层一次性校验,平均每次产出 2.4-3.2 个 token,官方称快 1.6-1.8 倍且输出不变。启动后在 127.0.0.1:8080 打开网页版,同时提供 OpenAI 兼容接口(/v1)和 Anthropic 兼容接口(/v1/messages),可以挂给 Cursor、Claude Code 等客户端,也支持读图。首次启动要读 35-55GB 进内存,PC 可能卡几分钟。MIT 协议开源,1,746 star、202 fork。网页链接(由 流苏ªⁱ 撰写)#Strata##本地大模型##开源项目# Easy的微博视频

2. 一张 RTX 4090 跑起 Qwen 3.8 Flash Next(125B),速度超过 100 tokens/s

3. Strata:RTX 5070跑出53 tokens/s,125B大模型Qwen3.8-Flash-Next 本地部署实录

4. 一张游戏卡跑 125B 大模型:不用服务器,90 tok/s

5. 12G 显卡 + 64G 内存,居然能把 125B 大模型跑出 90 token/s?

6. Strata跑125B模型的实测表里,为什么没有RTX 4090?

7. 一张家用显卡,跑起 125B 大模型:Strata 开源了

8. 1250亿参数大模型跑在你的游戏电脑上 Strata完全指南

9. GitHub 7200 Star 的开源神器:12G 显卡白嫖 125B 大模型,附 3 步安装教程

10. Strata 让普通游戏电脑跑 1250 亿参数大模型

11. 12G显卡跑1250亿大模型:免费开源本地随便跑

12. 180B的MoE大模型,怎么能塞进一张12GB显卡?Strata × Qwen3.8-Flash-Next本地实测

13. Strata 让普通游戏电脑跑 1250 亿参数大模型 - 哔哩哔哩

14. [中配]Strata引擎实测:12GB显卡运行125B模型,真实速度与内存成本解析

15. 12GB显存跑千亿参数大模型

16. 8G 显存跑125B大模型!+ 最低32G内存 本地部署 Qwen3.8-Flash-Next

17. 12G 显卡跑 125B 大模型?我把体积、门槛、速度都算了一遍

18. 强推神项目Strata!16G显存真能跑125B?踩过3个坑

19. Strata!12G显存跑125B模型!开源推理引擎!

20. 一张显卡跑起 125B 大模型!

21. 显存+内存本地硬刚 125B 大模型!Qwen3.8-Flash-Next 实测:10 万字检索 3/3 全中

22. 8GB显存也能喂饱125B大模型?Strata项目有点东西

23. 125B大模型塞进12G显卡,实测跑通

24. Strata开源!家用显卡也能运行125B大模型

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章