125B大模型塞进12G显存,开源引擎Strata实测跑出94词元每秒
源自136位全网作者
18:17
精选参考来源
1
#Easy同学正在独立开发#一张 12-24GB 的显卡加 64GB 内存,就能把 125B 的 Qwen3.8-Flash-Next 跑到 93 tokens/s。Strata 是一个把 Qwen3.8-Flash-Next 跑在本地 PC 上的开源项目,Windows 和 Linux 都有一键安装脚本,除显卡驱动外全部自动装好,磁盘约 80GB。在 RTX 5070(12GB)+ Ryzen 5 7600 + 64GB 内存上:- 输出 53-93 tokens/s(短对话),128K 下 43-74 tokens/s- 读取提示词 1,620-2,180 tokens/s四个量化档位:Q2_0(37.6GB,最快)、IQ2_XS(39.2GB,推荐)、IQ3_XXS(47GB)、IQ3_S(54.8GB,公开测试与原模型持平)。ISTA-DASLab 的 Coder 版本砍掉一半专家,只留写代码和调工具需要的那些,第一分片 29.6GB,32GB 内存就能跑,支持 262K 上下文,作者给出的成绩是原模型的 91.3% SWE-bench Verified、98.7% LiveCodeBench v6。总共 24,576 个专家,每个词只用到其中 10 个,所以不必全放显存:显存里放注意力、路由器和 KV cache,其余空间留给随对话调整的高频专家缓存;全部专家常驻内存,显存里没有的由 CPU 就地计算,与 GPU 并行;SSD 上放 28.8GB 的 n-gram 表。模型自带的 MTP 层先猜最多 3 个后续 token,48 层一次性校验,平均每次产出 2.4-3.2 个 token,官方称快 1.6-1.8 倍且输出不变。启动后在 127.0.0.1:8080 打开网页版,同时提供 OpenAI 兼容接口(/v1)和 Anthropic 兼容接口(/v1/messages),可以挂给 Cursor、Claude Code 等客户端,也支持读图。首次启动要读 35-55GB 进内存,PC 可能卡几分钟。MIT 协议开源,1,746 star、202 fork。网页链接(由 流苏ªⁱ 撰写)#Strata##本地大模型##开源项目# Easy的微博视频
2
一张 RTX 4090 跑起 Qwen 3.8 Flash Next(125B),速度超过 100 tokens/s
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹