「终极方案」首日965条评论,标题的110t/s被作者自己拆穿——两周11条NInfer实测数完,先把三条口径对完再折腾

源自333位全网作者

10-04 07:27

两周前,这个圈子还在算你的卡"能不能跑27B";这两周,大家开始算你的引擎"数字是怎么数出来的"。

9月20日,沈三殊那条「token自由=bonsai27b+ninfer 8G显卡流畅运行」播到17.6万、收藏1.8万,是整个本地部署区这一周期的播放王。10月3日凌晨,他的「终极千问部署方案=ninfer+kvmem首发」上线,头一天评论965条、播放2.96万。同一窗口里,「千问3.8双雄对决:整机流Strata与单卡流NInfer怎么选」也被推上了热门。知乎上NInfer与llama.cpp、vLLM的横评连排上新,垃圾佬圈把双V100拉出来实测,GSQ-RCO、conINFER、llama.cpp的adaptive-kv-streaming分支,全在Qwen3.8-27B这同一个模型上交手。哔哩哔哩哔哩哔哩哔哩哔哩

显存账、KV缓存账、内存涨价账,我们之前都算过了。这篇回答新问题:教程里的速度和你能拿到的速度,可能根本不在同一个口径上;而这个被捧上天的引擎,本来就不是万能钥匙。 我把9月14日到10月4日两周内的11条发帖实测、5篇知乎部署报告加评论区一手晒数汇总完,结论先放这:胜负手不在硬件档位,在数字怎么数、以及你愿不愿意为一周后的返工买单。

一、先认清这个引擎的出厂边界

被问得最多的一件事,知乎"敏哥聊技术"讲透了:NInfer不是通用推理引擎,原版只认RTX 5090,CUDA架构必须写成sm_120a,构建系统直接拒绝其他架构,模型侧只吃显式注册的.ninfer制品,GGUF、Safetensors一概不认,连连续批处理、优先级调度、请求抢占、多卡、分布式服务都在"明确不提供"的清单上。知乎

所以你看到的所有"跑通",全是社区硬改的结果。4080 SUPER党的原话是"引擎不认我的卡,也不认这种权重。两样都得我自己补",拿sm_89源码线自己编译,再手动把MTP投机解码头移植进三元制品。V100党是把v2分支合上官方v3、自己加Windows兼容层;双V100X2、V100Duo、conda包全是专门开的分支。沈三殊10月3日的置顶自己写了进度边界:先适配这三个系显卡,还没适配到的,先用之前的老方案顶顶。引擎越用越多的错觉,背后是十几个"作业贴"在接力。知乎知乎哔哩哔哩

二、对完三条口径,再心动

把各家标题数字和发帖人自己交代的口径摆在一起,画风是这样的:

实测帖(卡片)

标题数字

发帖人自己交代的口径

tux_la 双V100(9-30)

110t/s解码、2000t/s预填充

自认"标题党":110是5秒峰值,总TPS稳定73±5

彭于晏 单V100(9-28)

280tok/s

自己推翻:死循环刷高MTP接受率的"毫无意义"速度,修正后平均80+

上只当麻 5090L 24G(10-2)

单卡784.5t/s

8路并发聚合值;单流极限237.3

兄弟的猜疑 5070Ti 16G(9-30)

解码120+

128K页面生成场景实测123.6

乌拉拉 4080S(9-19)

96.7~130.8 t/s

单流;且是"两样都自己补"之后才有的数

三个词对完再抄作业。峰值≠日常——双V100实测者tux_la的置顶原话:“我是标题党 嘻嘻 1951@110tps是5s峰值 这里是一些avg数据”,写代码时解码均值90±4、思考时70±10,总TPS稳定在73±5,同一台机器70到236都是"真的"。decode≠整活速度——那张"单卡784.5tok/s",是8路并发聚合的引擎日志值,单流极限237.3、agent负载101.5,它的真实含义是"这台机器能同时服务几个人"。"可达"最危险——“开启dflash7后 在相关工作85k输入 decoding可达213t/s(jsonl翻译),文本翻译中达到135t/s”,任务类型、输入长度、开关条件全藏在限定语里,换成写代码场景,均值就回到前面说的90±4。连方案作者自己写的都算保守:「自适应之后的性能只能发挥极限的80%」。哔哩哔哩哔哩哔哩哔哩哔哩

有较真的方法党把这事做成了标尺:知乎"老章鱼"的V100对比报告用同一套脚本、同一套中文填充语料,每次请求带唯一 nonce 绕过 prefix 复用,预热之后只取稳态数字,结论是网传"llama 800t/s"同样是短提示峰值——两边都在用峰值打架,先问口径再选边。知乎

三、decode快的代价:有人长期用过,放弃了

最扎眼的反方证据来自4090的长期用户,他在评论区写道:第二是它长上下文的时候很容易 kv cache 失效,在 140k 上下文的长期任务里几乎不可用,填充需要 3 分钟,而且常常丢失缓存,总在重新全量 prefill。这条热评底下有人点破了规则:"我发现社区好像都在比 Decode 速度,但是没什么人去计算长上下文的总任务时间。"老章鱼在V100上也量到了同一形状的衰减:上下文从4.6K加到180K,填充速度一路从1018掉到267;并发跑两个100K请求,后到的那个要排队4分15秒才开始干活。哔哩哔哩知乎

反方论证同样完整:“agent里decode占绝大多数时间,prefill有缓存复用每次只填新放进去的部分”,就算prefill掉到900也不致命。两边都不算输,分歧在你的负载——丢长文档、做知识库问答的,llama.cpp/vLLM路线稳;派Agent后台跑活的,新引擎收益是真。同一个"快"字,两种活里两个答案。哔哩哔哩

8G档最该泼的冷水出自方案作者本人置顶:8g卡只能用ptq1,其他显卡全部用9g大小的那个bobsai模型,ptq1慢,9g这个飞快。标题里的"8G流畅",UP主自己已经限定过了。哔哩哔哩

四、分档:这波谁该上,谁别上

16G档(5070Ti/5080L/4060Ti):最热闹的一档。16G笔记本跑通Bonsai-2-27B的完整样本摆在那:“27B 的模型,16GB 的卡,9.8GB 的文件,25 万上下文,90 t/s——每一项单独看都不惊人”,合起来是一台离线可用的工作站。同一档里,GSQ-RCO Q3×NInfer给到5070Ti 16G页面生成实测解码123.6tok/s,llama.cpp这边有人用adaptive-kv-streaming分支把GSQ模型拉到200K上下文实战。三条路线互卷,这档最值得跟。知乎哔哩哔哩

V100垃圾佬档:先看完完整踩坑帖再动心。“花两千多入手、如今涨到四千"的实测者把账摆得很全——普通风冷是压不住这张显卡250W功耗,风冷仍会显存85度以上,最好上水冷;作者对同款卡的判断是"非经验丰富的程序员 强烈不推荐购买使用”。真要上,通道宽度决定命运:同为双V100,受限于PCIe通道太小的用户晒出来的数是prefill只有700、MTP3能到95t/s。知乎哔哩哔哩

24G+档(4090/5090):fork生态最全,但限制清单也最长。172K以上高KV精度上下文有限制;同机对比里"vllm启动就要240s"、NInfer只要十几秒——这类启动差直接决定你日常愿不愿意开它。哔哩哔哩

8G档:等一等。连"飞快"两个词都不属于这一档。

Mac/Strata党:整机流和单卡流两套账别混着比,双雄对决的评论区吵的就是这个;装机硬件账此前已算过,不重复。

五、真正的隐性成本:会作废的调优,和没人审的安装包

4090党云八云的简介就是这句丧话:他花十几个小时把"NInfer+27B@256K"调到自认完美、实测1.5倍速,一周之后原话是——上个星期我花了十几个小时,把本地这套部署调到了自认为的完美。一周之后,全成了废物。原因是分支在更新、v3格式还没兼容完,作者本人宣布"未来三天都暂时休息,内测群是充电大佬的福利",bug要走专门发布的Bug帖受理,死循环解决方案靠"私信一个开源万岁就行"。哔哩哔哩哔哩哔哩

再看安装链路:夸克网盘方案包、评论区第三方启动器、"别自己瞎搞,交给agent"的自动安装流程。方案作者自己在源头视频里就写过:本视频不做权重下载,只进行复现工程细则和工具包的发放。上月银狐仿冒DeepSeek客户端的事还热乎着——转引擎可以,权重从HuggingFace官方仓下,引擎从GitHub源码仓拉,来路不明的exe不管多好用都别双击。 顺带一提乌拉拉踩过的坑:三元权重的激活变换一旦配错,“形状全对、输出乱码”,而且这个乱码不会报错。这类细节不在任何标题里,只在折腾完的人的正文里。哔哩哔哩哔哩哔哩知乎

六、动手前四个问题,观察就盯三件事

要不要跟这波切换引擎,先问自己:

  1. 我的活是什么?Agent派发(decode占大头)还是长文档问答(prefill和缓存稳定性占大头);

  2. 我抄的那个数字,口径写清了吗?峰值还是均值、单流还是聚合、上下文多长、预热没有;

  3. 我现在这套调优备份了吗?换引擎的沉没成本不是显卡,是"十几个小时调好的东西一周作废";

  4. 安装包谁产的?官方仓库还是网盘exe?

接下来盯三个信号:沈三殊的调优名单和bug帖里,长上下文KV失效有没有解法;kvmem刚首发、只覆盖三个系显卡,能不能扩;以及多篇实测者共同的预告——按Qwen系列的发布节奏,Qwen4-27B很可能在2026年10月15日之后发布,届时是"再折腾一轮引擎"还是"直接换新基座",才是下一场口径仗。知乎

这波引擎大战,真正的分水岭不是"谁的引擎更快",而是谁的速度口径和你的负载对得上。别让5秒的峰值,替你决定今晚要不要通宵重装。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章