换引擎不换硬件:Qwen3.8-27B在Mac上免费提速,官方74、推文144、民间实测26,三个数字差在哪一次核清

源自117位全网作者

14:53

这两周Mac本地圈最热闹的事,不是哪张显卡降价,而是一个不花一分钱的软件升级。9月18日,LM Studio团队上线了Inco AI开发的Splash推理引擎,专门给Apple Silicon跑Qwen3.8-27B和Qwen3.6-35B-A3B这两个模型。 随后一条"M5 Max跑到144 tok/s"的推文全网飞,小红书上一片"买Mac吧"的声音,评论区里也有人泼冷水,说同一家公司、同一个模型,两个数字差了95%。知乎小红书

同一个27B,官方表里74,推文里144,博主实测26到118都有一一这篇就把这三层数字全部摊开,顺便告诉你:你的那台Mac到底该不该换引擎。

先说Splash是什么:不是通用引擎,是"围着两个模型打"的定制方案

大部分本地玩家现在跑27B,走的是Ollama或者LM Studio里的llama.cpp/MLX后端。Splash的思路完全不同:它只优化Qwen3.8-27B和Qwen3.6-35B-A3B这两个模型,给每个模型单独写了Metal定制内核和内存方案,还配了一个专用的DFlash 2草稿模型做投机解码。知乎

注意,它用的是专用模型包,不是你硬盘里那些MLX或GGUF文件,得重新下载。接口层面倒是给得很全:流式输出、工具调用、JSON Schema输出、图片和内联PDF都支持,服务起来就是一个OpenAI兼容的本地端口,接到opencode、Cherry Studio这类工具里都是常规操作。 4-bit量化下这两个模型都能塞进48GB统一内存,还剩约25GB给上下文缓存,这对常驻后台跑agent的人来说是实打实的好处。知乎

官方给的安装门槛很明确:M3及更新的芯片、macOS 26.4以上、36GB统一内存起步,建议48GB以上。 安装方式两条路:命令行走`brew install incoai/tap/splash`,然后`splash serve --model incoai/Qwen3.8-27B-Splash`;图形界面则是升级LM Studio Bionic到1.1.5以上,在设置-运行时-实验性后端里下载Splash (Metal),再去探索页粘贴Hugging Face链接下载模型包。知乎小红书

官方数字:74和"快2倍"是这么来的,一半功劳是并发

先看Inco官方发布页的数据,全部跑在一台48GB的M5 Pro上。27B模型在短提示单请求下解码74 tok/s,对比oMLX的38,约1.9倍;32K上下文下是54对28,还是约1.9倍。 4路并发短请求时总吞吐达到170 tok/s对43,约3.9倍;32K预填充则是363对110,约3.3倍。知乎小红书

数字本身能核到,但有个细节值得玩味:“快几倍"里有一半是并发带来的。单请求是1.9倍,把1路改成4路并发,倍数就变成了3.9倍——你要是单人单对话使用,能拿到的就是那1.9倍,不是推文标题里的"接近4倍”。小红书

144的出处我顺着查了一遍:所有链条最后都指向同一条推文

那条最出圈的推文说Splash在M5 Max MacBook Pro上把27B跑到144 tok/s。有较真的博主把官方发布页和开源仓库说明页翻了个底朝天:两处都没有144这个数,能查到的最高就是74,而且标注的机型是M5 Pro,不是M5 Max。小红书

144从哪来的?快讯平台KuCoin发过一条数字一字不差的稿子,但标注来源就是那条推文;另一个开源项目的问题区里,发帖人自己写明"这些是厂商声称的数字,这里没有测过"。顺着所有出处往回找,最后都指回同一条推文。小红书

所以144不能说是假的,它只是至今没有任何独立测试背书,而它恰好又是传播最广的那个数字。

民间实测三组:从118到26,差距比你想的大

官方数字之外,我汇总了三组独立实测——要知道一个月前,社区跑这个27B普遍还是70tps的水平,这个引擎出现才一周多。小红书

第一组,小红书博主潮汐以北,M3 Max 40核GPU 64GB,跑了150多次请求。同样这台机器,Ollama跑27B是50 tok/s,换Splash基准测试能到118,但一进真实开发工作,只剩26-38 tok/s。 他做了排除实验,温度、工具调用、代码注释都不是变量,真凶只有一个——投机解码吃的是"内容的可预测性"。于是出现了同一颗模型的速度光谱:紧凑代码125、JSON 109、英文47、中文散文只有25,差出5倍。最冷的知识是:本地跑7分钟的活,41%的时间花在prefill"读题"上,这事从没人提过。他还拿云端GLM-5.3-Flash对照做了三份开发任务,质量3:3打平,速度差4倍——但本地0积分、不限流、高峰期永远在线。小红书

第二组,官方仓库问题区,一位M3 Max 128GB的用户。同一个27B,Splash解码30 tok/s,而Ollama走MLX后端是42.5,反而比Splash快29%;Ollama换另一个后端只有12,Splash又快2.5倍。同一台机器,只换对比那一侧的引擎,"快多少"的结论摆动了3.5倍,他自己也写明:几家的4-bit量化不是同一种4-bit。小红书

第三组,B站UP主黑粉科技HyphenTech,9月27日刚发,M5 Pro 64GB。27B解码中位约27 tok/s,35B-A3B约54,现场跑瞬时130-150、稳定100左右;而之前同样的27B走llama.cpp只有约9 tok/s。 这位UP的边界说明值得表扬:模型放在外置硬盘上速度未达最优,而且Splash是4-bit、llama.cpp是8-bit,“差距里混着量化位宽,不全是引擎的功劳”。他用这套东西让本地模型一次提示词写出一个GTA风格小游戏,40分钟交付。哔哩哔哩

这笔账怎么算:不同的人结论完全不同

把三层数字叠起来,我的判断是这样的。

M3及以上、36GB内存以上的Mac用户,值得马上试,但先跑对照测试。你的实际收益完全取决于你现在用什么后端、跑什么内容:从llama.cpp 8-bit换过来,收益最大,黑粉科技那组就是从9 tok/s提到稳定100左右;已经在Ollama里用MLX后端的,可能不升反降,仓库那位M3 Max 128GB用户就是例子;主力场景是写代码、出JSON的,吃到红利最多;主力写中文长文的,先看看速度光谱里那个25再说。方法很简单:拿你自己最常用的十段提示词,两边各跑一遍,别信任何博主的数字,包括我这篇。

32GB及以下的Mac用户,这波与你无关。两个专用模型包都装不下,8GB、16GB的机器就更别想了,等Splash什么时候出小模型包再说。哔哩哔哩

M1/M2用户,官方明确不支持,芯片门槛写死了M3起步。N卡、A卡、Windows用户,看个热闹就好。Splash是纯Apple Silicon方案,你的提速路径在别处:源码编译1Cat-vLLM跑FP8、Qwen3.6的MTP加速(社区实测约1.5倍)、或者面向agent场景的TokenSpeed引擎,这些都是另一篇文章的事了。

期望值管理:换引擎解决的是速度,不是体验的全部

最后泼一盆必要的冷水。速度光谱那个数字很说明问题:如果你的主力场景是写中文长文、中文散文式的输出,投机解码帮不了你多少,25 tok/s和阅读速度差不多;如果你写代码、出JSON,那才是Splash的主场。 还有个反常识的发现——prefill占了四成时间,意味着你喂的上下文越长,"解码快"这件事的体感收益越薄。小红书

但话说回来,本地推理的价值从来就不是"比云端快"。是深夜写代码的时候它不排队,是月底token额度见底的时候它不限量,是你把公司文档喂进去的时候心里踏实。这些价值,一个免费引擎把速度短板补上一截之后,反而更成立了。

接下来值得盯的信号有三个:一是被对比的oMLX等引擎会不会跟进定制优化,这场军备竞赛才刚开局;二是Splash的模型包会不会从两个扩到更多;三是中文长文本场景的独立实测现在还是空白,谁先补上谁就有流量。

你要是已经换了,评论区报一下你的机型和实测数字,这篇的空白正好大家一起填。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章