过去几天,如果你混迹 B 站、微博、知乎或者小红书的 AI 圈子,大概率被同一个名字刷屏:Strata。
它是个看起来毫不起眼的开源项目:MIT 协议、免费、一键安装,甚至只支持一款模型。但它干的事,足以让每一个游戏显卡用户心跳加速——让 12GB 显存的家用游戏 PC,跑起 1250 亿参数的 Qwen3.8-Flash-Next 大模型。有 B 站 UP 主记录,项目开源第四天他才 618 个 star,两天后这个数字变成了 14.5k。海外科技媒体 gigazine 的报道被 IT之家转发,标题简单粗暴:单张 RTX 5070,94 tokens/秒。哔哩哔哩微博
更有意思的是全网实测帖的画风分裂:有人 12G 显存 + 64G 内存跑出 128K 上下文平均 50 tokens/秒,直呼"个人AI这回是真进入token自由时代了"。有人 4090 上飙到 140-150。也有人拿两张老 2080Ti 只有 20 出头,留下一句"没有传说中的神奇"。同一个引擎,玩家手里的差距为什么能拉到 5 倍?微博知乎微博

我把官方 README 的基准表、两篇安装实测长文,和微博、知乎、B 站、小红书上的十几条玩家报告拢到一起,分四笔账算清楚。看完你就知道:自己的电脑够不够格、值不值得折腾。
第一笔账:先搞明白,12GB 显存为什么塞得下 125B
不是魔法,是这道题本来就有空子可钻。
Qwen3.8-Flash-Next 是 MoE(混合专家)模型:48 层、每层 512 个专家,总共 24,576 个"小专家",但每生成一个 token,每层只激活其中 10 个外加 1 个共享专家。也就是说,125B 是体重,一次前向真正干活的只有 6B 左右。哔哩哔哩知乎
Strata 抓住的就是这个空子:权重没必要全挤在显存里。它把一台机器拆成四层——显存缓存最常调用的几千个热点专家(实测占 4.69-5.21GB),系统内存放下全部权重,CPU 扛剩余计算,SSD 上放一张查找表;再配合投机解码(小模型先打草稿、大模型一次性验证,官方说快 1.6-1.8 倍)和分块读入提示词(每块 8,192 token),硬是让游戏卡干起了服务器的活。一句话:它没有把模型砍小,而是让整台电脑分工,谁快谁上。这也是为什么它对内存和硬盘的要求,比对显存狠得多。知乎知乎
第二笔账:速度账——官方 94 tokens/s 是天花板,中端卡现实是 30 上下
先看官方 README 给的基准,测试机是 RTX 5070(12G 显存)配 64G 内存。知乎
量化档位 | 生成速度 | 提示词读入 |
|---|---|---|
Q2_0(2bit 级) | 94 tok/s | 2,650 tok/s |
IQ2_XS | 79 tok/s | 2,090 tok/s |
IQ3_XXS | 62 tok/s | 1,750 tok/s |
IQ3_S | 53 tok/s | 1,620 tok/s |
Coder 版 | 55 tok/s | 2,180 tok/s |
再看全网玩家的真实成绩单:
配置 | 实测速度 | 来源 |
|---|---|---|
RTX 4090 48G | 解码 140-150,最高 180 | 知乎玩家 |
RTX 3090 24G | 100-140(官方预估) | README |
RTX 3090 24G | 97 | 小红书实测 |
2×2080Ti + 60G 内存 | 60 | 知乎玩家 |
RTX 5060Ti 16G | 40-50 | 知乎玩家 |
12G 显存 + 64G 内存(Q2、128K 上下文) | 平均 50 | 微博玩家 |
RTX 3060 12G + 64G + i5-12500 | 41 次请求平均 29.9(最慢 14.1) | 知乎实测长文 |
RTX 4060 Ti | 约 30 | 媒体实测 |
V100S 32G + 256G DDR3 老平台 | 解码 40-60,“勉强可用” | 微博玩家 |
2080Ti 11G 单卡 + 96G 内存(IQ3_XXS) | 20 | 微博玩家 |
规律很清晰:官方表是新架构中端卡的最优工况;卡越老、CPU 越弱、上下文越长,越向 30 以下回落。还有个官方不会告诉你的变量:缓存命中率。那台 3060 实测里,命中率 80% 的请求跑 37 tok/s,掉到 41% 只剩 14 tok/s——聊天话题越连续越流畅,东一榔头西一棒子地用,速度直接腰斩。30 tok/s 是什么概念:比你阅读速度快,比云端 API 慢。够不够用,取决于你拿它干嘛。知乎

第三笔账:门槛账——真正的关卡不是显存,是内存、硬盘和耐心
全网标题都在喊"12GB 显存就能跑",但把官方文档和实测日志摊开,门槛其实有四道:
显存 12GB 只是入场券:支持 NVIDIA RTX 20-50 系和部分 AMD RX 卡。Mac、迷你主机、核显笔记本,这条路暂时跟你没关系(苹果芯片走的是 MLX 那套,另说)。知乎
内存决定你能跑哪个档:32G 只能跑砍了一半专家的 Coder 版;48G 才轮到 Q2_0/IQ2_XS;64G 解锁全部 IQ3 档;想上 4-bit 的 UD-IQ4_XS,96G 内存起步、下载 94GB。小红书
硬盘要留 80GB SSD:模型下载约 70GB,有实测在国内网络下只有 0.8-1.1 MiB/s,一个分片就要 9 个多小时——好在支持断点续装,社区建议直接走国内镜像源。
耐心:启动要把 33-55GB 数据灌进内存,全程 2.5-3 分钟,期间整台机器明显卡顿;每次请求首字延迟 2-9 秒;只支持单请求排队,不是并发服务;12G 显存会被吃满,同机想开 ComfyUI 画图?先释放显存再重启模型,或者用懒加载模式。知乎

一句话:宣传里的门槛写在显卡上,真实里的门槛写在内存条和 SSD 上。
第四笔账:质量账——你省下的每一分速度,都是从精度里扣的
量化档位这回事,本质是拿质量换速度:
跑得最快的 Q2_0 是 2bit 级量化,日常问答、写草稿够用,但损失落在最难量化的场景里;
Coder 版砍掉一半专家,官方说能保住完整模型 91% 的 SWE-bench Verified 得分,代价是代码之外的任务明显变弱,中文尤其明显;
社区有人拿 IQ3_S 档实测后给出"质量打平 opus4.6"的说法——这是个人观感,没有权威评测背书,听听就好。微博
想上高精度也不等于好体验:4-bit 实验版大部分权重要从 SSD 实时读,64G 内存机器上只有 7-8.5 tok/s,直接回到不可用。

还有个隐蔽的坑:思考模式默认开启,会吃掉你的输出预算。实测日志里出现 4 次"达到 max_tokens 上限时还在思考,因此没有回答"——参数给小了(比如 500),输出全是思考链,正文一个字没有。思考预算要单独设置。知乎
那么,谁值得折腾,谁先别碰?
现在就可以动手的:
显存 12G+、内存 64G+ 的游戏 PC 用户:MIT 协议零成本,Windows 下一键脚本自动识别硬件,12G 卡照推荐选 32K 上下文 + 8-bit KV 缓存就行;
对数据不出本机有硬要求的人:它在本地 8080 端口同时提供 OpenAI 和 Anthropic 两套兼容 API,现有工具链改一行地址就能切过来,这比速度更值钱。知乎
token 重度消耗者:本地跑起来的边际成本约等于电费。社区已经在讨论"这会进一步冲击商用 API 定价"——站在消费者这边,这是好事。微博
先缓一缓的:
32G 内存用户:只能跑中文偏弱的 Coder 版,体验大打折扣,加内存再谈;
Mac / 迷你主机用户:这轮热闹暂时与你无关,别为了它单独攒机——项目才五天,版本从 0.1.15 一路狂奔到 0.1.40,等它稳定再决定钱包动作。哔哩哔哩
想拿它当生产服务的:单请求排队 + 2-9 秒首字延迟,定位就是个人玩具,不是服务器替代品。
决定装的话,避坑清单收好(全部来自实测日志):
给 Strata 一个干净的 Python 环境,别和 ComfyUI 的 venv 混——四次安装失败里三次是环境污染(numpy 装成 cp314 版、yaml 找不到,根子都是 PYTHONPATH 被污染)。知乎
模型走国内镜像源 + 善用断点续装,直连下载可能要你 9 个小时;
报"草稿头放不下",把草稿层词表从默认中日韩版(占 348MiB 显存)切成英文版(133MiB),省出来的显存留给专家缓存;
max_tokens 别抠,思考预算单独设;
开放给局域网其他设备可以,但官方明确要求必须配密钥。

最后,值得盯住的三个信号
第一,Strata 目前只支持 Qwen3.8-Flash-Next 一款模型。什么时候支持更多模型,是判断它从"爆款玩具"走向"基础设施"的关键信号。微博
第二,MoE 稀疏化正在成为行业主流:刚发布的 Mistral Large 4 总参数 1 万亿、每 token 只激活 49B,月底放权重。模型越稀疏,"个人电脑跑得动"就越会从例外变成常态——本地推理这条线,才刚刚开始。小红书知乎
第三,社区在认真讨论"本地部署需求会不会推高显卡和内存价格"。这个问题暂时没有答案,但如果你本来就打算加内存,现在的 64G 套装可能是一段时间里的低点。知乎
一句话收尾:Strata 没有让你"花游戏卡的钱买服务器的性能",它只是多给了你一个选项——用 3 分钟等待、80GB 硬盘和看得见的精度损失,换数据不出本机、token 自由。这笔账划不划算,不取决于它多火,取决于你的需求落在账本的哪一边。