上周一本地党还在吵“27B 要不要卸”,这周战场直接挪到了引擎。10 月 3 日,UP 主沈三殊把 kvmem 塞进 NInfer,发出“终极千问部署方案=ninfer+kvmem 首发”,5 天拿下 4139 赞、6147 收藏、7 万播放、1901 条评论。 同一天有人把评测视频标题写成“千问3.8双雄对决:整机流Strata 与 单卡流NInfer 怎么选”,评论区 111 条直接分成两拨人。 10 月 8 日凌晨,20 系引擎包刚上线,就有人晒出 2080Ti 跑到 180+tok/s 的实测。哔哩哔哩哔哩哔哩哔哩哔哩
两拨数字都是真的,但它们说的根本不是同一本账。装引擎之前,先对完三件事:数字口径、硬件账本、你自己的活。
一、先把“t/s”拆开:四个口径,别跨账本比较
decode 和 prefill 是两笔钱。 V100 双卡那条视频的标题写着“qwen3.8 27b nvfp4 峰值 236t/s decoding,2000t/s prefill”——读题 2000、答题 236,差了近十倍。 UP 主置顶的补充说得很老实:没有 NVLink,是 P2P 直连;dflash7 跑满 99% 能到 249t/s,“但不太现实就不这么写了”。他后面还凹出一版实验数据:mtp4 只比 mtp3 强 2.7%,85K 输入的 decode 从 100 提到 120,照抄 Strata 的流水线并发把 prefill 拉到 2500tps——代价是 decode 往下掉。日常等你答案的是 decode,跑分图给你看的是 prefill。哔哩哔哩
单流和并发不是一回事。 Strata 这两天更新了 response API 和 4 并发。 实测评论立刻跟上:开 2 并发时单流 decode 均速只剩 75tps,双流再对半砍,每多一个并发槽位都要额外占显存,“并发处理还不够成熟”。评论区也有人晒“单流 800tok”,马上被顶回去:“单流 tps 有 800 就厉害了。”哔哩哔哩
投机解码跑分要打折看。 “不要相信 dflash2 参与的复述题跑分,虚假的速度”——这条 6 赞的提醒,放在任何一个“XX 倍速”的标题下面都成立。哔哩哔哩
二、单卡流一拨:NInfer + kvmem,省的是内存,欠的是上下文
这拨的火从 9 月 20 日烧起来——“token自由=bonsai27b+ninfer 8g 显卡流畅运行”拿了 12922 赞、20 万播放,卖点就一句话:老卡、小显存、不用堆内存。 而 NInfer 本身更极端,刚开始只有 5090 能用。 首发 5 天后的数字墙:哔哩哔哩哔哩哔哩
机器(自报) | 成绩 | 出处 |
|---|---|---|
2080Ti | 180+ tok/s(NInfer+KVMem+Bonsai 27B,20 系引擎包) | 10-08 实测 |
笔记本 5070,8G 显存+单条 32G 内存 | 60+ tok/s、256K 上下文,缓存命中后鹈鹕任务到 75 tok/s | 首发视频评论区 |
5070Ti,Windows 原生 | GSQ-RCO 量化 NInfer 跑 27B,110 tps | 10-02 视频 |
16G 显存 | GSQ-RCO×NInfer,160K 上下文可选,decode 120+ tok/s | 9-30 视频 |
双 V100 16G | nvfp4 版 decode 峰值 236 t/s | 10-04 视频 |
4070S 12G+32G | 自改 Ternary-Bonsai-2-27B(visonly 版)能跑 | 首发视频评论区 |
首发视频评论区一条 5 赞的交作业说得最直白:8G 显卡能跑 60+tok/s 的速度,还能支持 256k 上下文。 但 1901 条评论也把坑一起交了出来:哔哩哔哩
套壳直接截断。 “部署了一下进 harness,但是失败了。第一轮一对话就提示 token 额度超出。8192/8192”,改一个多小时没改明白,最后“dsh 还把自己给删了”。 楼下补刀:“极简模式可以对话,标准以上全部截断。”想让本地模型接 agent 工具的,先拿这道门槛量一量。哔哩哔哩
长上下文是真短板。 NInfer 的环注意力机制,会导致长 prompt 丢失,做复杂 coding 就“原形毕露跑重复指令”。 还有更直接的:“Ninfer 几乎没办法用 agent,预填充一大就崩。”哔哩哔哩
kvmem 到底存了多少上下文,圈内自己都在吵。 一派的解释很技术:“kvmem 实际是选择上下文的方式,真实上下文大概就几十 K,这会有幻觉问题,这个课题很难”;另一派一句定性:16G 显存 64G 内存用 Strata 能给 iq3s 开满 int8 的上下文,NInfer 就只能压缩,kvmem 会损失智商。
8G 党的隐藏变量是缓存命中率:命中越高后续越快;单条内存换双条,“速度还能再上一层楼”。
三、整机流一拨:Strata,省的是显存,欠的是内存和硬盘
这拨的人画像很一致:显存不大、内存管够、要的是长上下文。评论区自报的数字墙:
机器(自报) | 成绩 | 出处 |
|---|---|---|
4060Ti 16G + DDR4 64G + 12400F + SATA SSD | iq3_s GSQ-RCO,256K 上下文稳 41 tok/s,iq3_xxs 能到 46~50 | 6G 答疑视频评论区 |
12G 3060 + 64G DDR4 3600 | 让 DeepSeek 优化参数后 40+、峰值 70+,Hermes 统计均速 42 | 同评论区(15 赞) |
5060Ti 16G + 64G | 原版 iq3-xxs,MTP+视觉全开,512K 稳定 | 同评论区(11 赞) |
12G 3060 + 128G 内存 + 双 E5-2680v4 | iq3_xxs 跑通 128K 上下文 | 同评论区(9 赞) |
双 3080 20G(无 P2P) | q4xs:256K 下 decode 40、prefill 1200 | 3080 踩坑视频评论区(9 赞) |
96G 内存 + 32G 显存 | 放弃 27B 转 flash iq3_s,100 toks,“96G 内存用了 70G” | 6G 答疑视频评论区(12 赞) |
双 V100 16G(无 NVLink) | Strata 跑 flash iq3:均值 60,写代码 100 | 双雄对决评论区 |
整机流不是 Strata 一家的信仰——同一周知乎有人实测:单卡 RTX 3090 + 系统内存,跑起 200GB 级 DeepSeek-V4.1-Flash,offload 这条路正在往更大的模型上走。知乎
这拨的三本账,评论区同样写得明白:
瓶颈根本不在显存。 56 赞高亮一句:原以为我的 16G 显存是搞本地 AI 的瓶颈,谁知是我 32G 的内存。 下面已经有人给出 1000 元升级路径:换 4 槽主板凑 64G;甚至实测 D3 四通道和 D4 双通道跑分几乎没差,只差 30–40% 的价格。哔哩哔哩
长上下文是这拨的核心资产。 “我算了下最大能上 1M 上下文,正好吃满内存”——这是 5060Ti 16G + 64G 用户给出的上限,512K 已经在稳定跑。 而同样这个上限,也是吐槽的源头:“谁家 6G 显卡配 64G 内存。”(9 赞)
SATA SSD 有概率“自杀”。 评论区有人交了实测:杂牌 SATA SSD 会有 prefill 静默自杀的情况,要把 NCQ 关了才行,代价是 prefill 速度 -200。 对 ngram 查表伤盘的担忧(“搞不好半年频繁花钱买固态硬盘”),被另一拨怼回去:“ngram 表反正放硬盘”“只有读,哪有写”。稳妥的交法也有人示范:几百块买条二手小容量 NVMe 专门放表,跑坏不心疼。哔哩哔哩
CPU 白捡的提速只有一处。 有人让 agent 把 Strata 参数测了 6 档,结论是“唯一有正收益的是 STRATA_PREFILL_CPU_SHARE=auto”——把 prefill 期闲置的 CPU 拿去算非驻留专家,短提示 prefill +26%~59%。哔哩哔哩
四、这三类人,先别装
A 卡用户。 首发视频评论区那条 7 赞写得很形象,A 卡用户看完视频,投两个币,失望的离开了。 首发包的抬头写得很清楚:40 系、30 系、50 系,10 月 8 日补了 20 系,就是没有你。“哪怕只有目前 80% 水平都好”的喊话下面,暂时没有官方回应。哔哩哔哩
6G 显存党。 6G 显存党的提问很直接:可以出一个 6G 的方案吗?6G 的实在是太少了。 回答是巧妇难为无米之炊:6G 显存连最小的权重都放不下。有人自己把视觉版权重回 6G 的 ptq1 版,结论“勉强能用”——视觉头只能挂 CPU(MMPROJ_DEVICE=cpu,rc3 起已是默认)。
Linux 用户。 Linux 用户的呼声只有六个字符:把 Linux 端上来!! 目前的包全是 Windows,驱动还点名要 CUDA 580+。
五、按卡装表:你的机器该进哪一拨
20 系包 10 月 8 日上线时,环境写得清楚:windows10+,cuda 驱动版本 580+。 站队之前,先对这张表:哔哩哔哩
你的情况 | 建议 | 备好这本账 | 先认清 |
|---|---|---|---|
8–16G 显存、32G 左右内存、以问答/写作/短代码为主 | NInfer + kvmem | 一条 NVMe 就够 | 真实上下文可能按几十 K 算,接 harness 先测截断 |
64G+ 内存(或愿意花一千元扩)、想要长上下文/agent | Strata 整机流 | 内存条 + 别用杂牌 SATA 盘 | decode 就 40–100 档,等答案慢 |
20/30 系老卡、不想加内存 | NInfer 分支包(20 系 10-08 刚放) | 预期当内测用户 | 并发、稳定性都是本周新变量 |
A 卡 / 6G / 要真·1M 级长文精读 | 先别站队 | —— | 观望下面四个信号 |
继续盯这四个信号:① Strata 并发从“双流对半砍”修到什么水位;② kvmem“选择上下文”的幻觉率,有没有人拿真实长文任务测出来(别再只看鹈鹕骑单车);③ qwen4 的架构之争——“能满足 NInfer 就倾向 flash,因为 qwen4 也是这个架构”和“qwen4 flash 大概率是不开源的”,都还只是评论区猜测,官宣之前别为它换队。 ④ A 卡有没有出现可用的 fork。哔哩哔哩
最后多说一句:这轮吵得再凶,本质是同一件好事——去年要 24G 显存起步的活,现在一张 8G 笔记本卡就有两拨方案抢着伺候。你手里是哪张卡、配多大内存、站了哪一拨?欢迎照第五节的表交作业。