Bonsai2与Strata的速度表和翻车表:8G跑27B、12G跑128B都保真,装之前先把翻车表看完

源自153位全网作者

13:40

2026年9月下旬,本地大模型圈被两波「小卡跑大模型」刷屏淹没了。第一波是Bonsai-2-27B:9月17日PrismML把Qwen3.8-27B的权重压到三值{-1,0,+1},模型本体约5.9GB,而全精度版本约54GB。「保留98.2%能力」的官方口径,很快把「8G显存跑27B」喊成了流行语。知乎知乎微博

Bonsai2与Strata的速度表和翻车表:8G跑27B、12G跑128B都保真,装之前先把翻车表看完

第二波是开源框架Strata(GitHub项目Niko1221/Strata):9月28日起,「12G显卡就能跑128B的qwen3.8flash,等等党赢麻了」这类帖子从抖音烧到B站。同样的文案和数字跨平台搬运,互相能对上。抖音哔哩哔哩

两波都保真。但决定你装不装机的一半,刷屏帖的标题里没有:速度表和翻车表,是两张表。

先看速度表:同一个「能跑」,按硬件档差出5倍

Bonsai-2社区自测,按显卡档位:

  • RTX 4070 Laptop 8G:27~30 tok/s,作者原话「确实能跑,而且不是那种『模型加载成功就算跑』的能跑」,但「实用性还是差点意思」。知乎

  • 12G的3060M魔改卡+社区MTP:128K上下文,短提示下解码38.5 tok/s、prefill 476 tok/s。知乎

  • RTX 4080 SUPER+ninfer引擎:单流96.7~130 tok/s。知乎

  • RTX 4090 24G移植vLLM:单流74.1~86.8 tok/s(上下文拉到33K从86.8掉到74.1),三路并发每路256K。知乎

Strata路线(跑Qwen3.8-Flash系列MoE):

  • 5070Ti 16G+64G DDR5,Q2量化:UP主自报60~90 tok/s,并称「这速度跟deepseek体验差不多了」。哔哩哔哩

  • 4060Ti 16G+64G内存,IQ3_XXS:30 tok/s,同一作者说原生CLI只有15-16,框架翻倍。哔哩哔哩

  • 4090 24G+96G内存:评论区自报最高80+,用框架自带的「按任务轨迹调专家集」调完能到120 tok/s。

  • 同一个3bit量化包换回llama.cpp跑(不用Strata):解码约20 tok/s,prefill 200~300。

这张表有两个读数方法:其一,速度取决于框架、量化档和内存规格,同一个iq3包Strata给65、llama.cpp给20,抄作业前先确认UP主的配置和你的像不像。其二,标题里的数字基本都是解码速度(出字那一刻的快慢),prefill(从发问到出第一个字)普遍慢3~10倍——上下文一长,16G的5070Ti跑27B也就剩40 tok/s,还伴随显存占用顶满、风扇起飞。抖音

再看翻车表:98.2%保的是唠嗑,长程任务是另一把尺子

9月28日流传的海外复测熟肉,把两波刷屏共同的软肋摆上了台面:简单任务上,压缩后的Bonsai-2确实能到宣称的98%;但换成长程智能体任务——六个各自需要多步规划、查资料、调工具、写代码的项目——无一交付可用成果,典型症状是反复调用同一个工具的死循环;完整模型虽然也翻车,但能把项目做完,熟肉引述的官方长任务基准分项只保留约75~76%。哔哩哔哩

Bonsai2与Strata的速度表和翻车表:8G跑27B、12G跑128B都保真,装之前先把翻车表看完

细读官方材料,「98.2%」和「翻车」其实说的是两件事。综合口径里最低的那行Agentic & ToolCalling仍保住九成七(83.9对85.4),而有用户翻报告原文后直接点名:terminalbench和swebench两项长程基准的准确率下降了近20个百分点,「他们从一开始就应该在主基准表格中公布」。传播最广的科普帖也把边界写得很清楚,98.2%只是官方自测套件综合分,不是第三方复现。微博抖音

社区实测在同一个方向上对上数:有评论说自己拿iq2跑了一天,「死循环严重的很,27B gsq两下就搞定的事,它能绕一小时还卡死了」。知乎帖里也有HuggingFace社区的流行对比——Flash-Next的激进量化包「打不过Qwen3.8-27B的GGUF」,并留下一句「稠密模型比较耐量化」。也就是说,「128B的Q2」在干活这件事上不一定比「27B的Q4」聪明,「12G跑128B」视频下的最高赞评论就是这句:「Q2有啥用?折腾他干嘛,3.8 27B不香吗」(8赞)。哔哩哔哩

证据边界说清楚:以上都是社区样本,口径不统一、没有横评。目前证据只支持「唠嗑接近无损、长任务明显退化」,再往外推的结论都还没有。

标题里不出现的第三张表:隐性成本账

  • 门票从显存换成了内存。offload方案里32G内存「基本没法玩,卸到SSD慢得一批,24G显存+32G内存勉强算能运行」;刷屏帖一句「只要64G内存就够了」在评论区被围攻,D5内存眼下不便宜,评论里都在「舍不得加、等双十一」。

  • 多轮对话是隐形雷,「没有kvcache,多轮废的」;另一条熟肉视频直接把128K上下文跑爆24G显存的元凶指向了KV缓存。哔哩哔哩

  • 模型名陷阱。帖子们自己就没统一:Flash还是Flash-Next、125B还是128B,量化包后缀GSQ、RCO、IQx混着写。知乎有帖专讲装完后「调不动」:多数卡住的不是模型,是名字和接线。知乎

  • 「能启动≠能用」。几百块矿卡部署千问3.8-27B的帖子把话说明白:想要玩一玩、尝鲜可以,别把能启动当作能用。哔哩哔哩

四档人四个答案

  • 8G显存+32G内存:两波都不跟。唠嗑27~30 tok/s,128B没戏;这张8G卡(nvidia-smi里8188MiB)配Qwen3.8-27B的Q4档或4B小模型是稳的路。

Bonsai2与Strata的速度表和翻车表:8G跑27B、12G跑128B都保真,装之前先把翻车表看完

  • 12~16G显存+64G内存,用途是聊天、翻译、文案:可以折腾。Q4档27B或Flash的IQ3包,自测在30~90 tok/s之间,接受长多轮退化即可。

  • 要跑agent、写代码、读长文档:别碰激进量化的128B。稠密27B的Q4/Q6更靠谱,「耐量化」不是白叫的;真要用128B,等框架把专家调优和KV缓存这两关过了再说。

  • 只是想省API钱:先按兵不动。阿里Qoder把Qwen3.8-Flash限时免费开放到9月30日——用这两天白嫖一下同一个模型的云端版,摸清它缺什么,再决定要不要为本地版花硬件钱。知乎

留三个观察信号

  1. Strata自带的「按任务轨迹自动调专家集」还在迭代,评论区已经从30拉到120 tok/s,接下来两周看工具链稳不稳。

  2. 9月22日HuggingFace官宣Transformers原生支持llama.cpp量化包,GGUF从「邪道」转正,低显存党的部署门槛接下来会实打实降一截。哔哩哔哩

  3. DDR5内存价格——它才决定offload这套方案的真实门票价。

这一轮小卡跑大模型的进步是真的:5.9GB跑27B、12G塞下128B,都是实打实的工程进展。假的那部分,只有「装完就能顶4090」这个预期。装机前,先拿你手里最长的那个任务喂给它跑一遍——能不能用,死循环会告诉你。

内容由AI生成

精选参考来源

1. Ternary-Bonsai-2-27B-gguf

2. HuggingFace趋势榜第一,27B模型压到5.95GB,还保留98.2%智商。

3. Bonsai2-27B发布帖:比全精度小9倍,保留98.2%综合基准性能

4. 12G显卡就能跑128B的qwen3.8flash了

5. qwen3.8flash本地部署,16G显卡也能跑到65tps输出:专武框架Strata

6. Ternary-Bonsai-2-27B:8GB显卡硬塞27B三元模型,能跑,但我大概率不会真用

7. 感谢大佬小卡,qwen27b bonsai 192k也能拉家常了

8. “三进制”版bonsai 27b+ninfer=闪电侠

9. 把ternary 2-bit的Bonsai 2 27B搬进vLLM:一次移植的完整账本

10. 劲爆!12G显卡就能跑128B的qwen3.8flash了

11. 用Strata本地4060Ti 16GB显卡64GB内存跑125B的Qwen3.8-Flash-Next IQ3_XXS还能跑出30tok/s

12. 鹈鹕测试,本地部署qwen3.8-27B 64K上下文实测

13. 压缩后性能暴跌,智能体任务翻车|Qwen 27B on 6GB VRAM|熟肉

14. Bonsai2-27B在terminalbench和swebench上的准确率下降了近20个百分点

15. Qwen 27B压到5.9GB:98.2%是官方自测套件综合分,不是第三方复现

16. 【中字】海外博主实测:128K上下文跑爆24G显存,KV缓存才是隐形元凶

17. 本地部署AI后调不动?多数人卡在这两步,跟模型没关系

18. 几百块的矿卡也能部署千问3.8-27B?

19. Qwen3.8-Flash限时免费:9月30日前在Qoder零Credits畅用

20. 本地AI突然好用了?GGUF直进Transformers,3个开源新变化

0
扫一下,分享更方便,购买更轻松
1评论

  • 精彩
  • 最新
  • 性价比高

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章