一天连发三个1.x,TensorFold 1.0的入场券却只有4款模型:爆火的27B官方自认新版更慢——换引擎前,先把"3倍提速"的口径对完
一、八天十连发:一个Zig写的引擎是怎么炸场的
10月7日中午,GitHub上TensorFold的Release页一天连挂三条:1.0.0、12分钟后的1.0.1、晚间的1.0.2。往前数,从9月30日的0.6.0到10月7日,八天发布了十个版本。
项目底子不浅:repo是ashhart/TensorFold,今年6月19日建仓,用Zig语言写的,Apache-2.0协议,官方描述一句话——LLM Inference Engine for Metal、CUDA and Vulkan。 截至10月8日上午,star数1090、fork 191,发布说明里公开致谢"145位贡献者"。GitHubGitHub
声量其实从9月27日就起来了。B站那条三分钟科普《震撼整个开源界,本地大模型提速3倍》,播放3600+、收藏180,它引用的数字成了随后一周全网转述的标准口径:M3 Ultra上代码解码翻倍到141–158 tok/s;同一台DGX Spark对比vLLM约3倍(102.9 vs 34.9 tok/s);首字延迟0.12秒;而且开投机草稿前后,输出sha256逐字节一致。 注意这期科普自己也写了备注:数据来自两位开发者的社区公开实测,单次通过、非权威评测。哔哩哔哩

一周内fork配方仓扎堆:MiaAI-Lab的双DGX Spark上跑GLM-5.3-Flash EXL3的配方repo攒到295 star;jayleaton的repo自称"解码比vLLM快1.8倍、4路256K并发、逐字节一致的投机解码",同时自己挂着"Work in progress";还有人把MiniMax H3视频生成搬上了M5 Ultra。B站评论区也有人来了一句"抄NInfer么"——这周的引擎混战,火药味是真有了。
二、复测党一周内立出的三个口径
热闹归热闹,这周同时出现的好几轮复测,干的其实是同一件事:把"快3倍"拆回口径。
口径一:单流Decode ≠ 整机变快。 UP主阿豪玩算力的视频把结论放在标题前半句——“很多人都在晒它的单流Decode”,而他的判断是:如果你只看生成速度,很容易低估vLLM。浮影空痕10月1日在双DGX Spark上给出真实数字:GLM-5.3-Flash EXL3,中文单流解码34.19 tok/s对vLLM的18.95 tok/s,确实约1.8倍。 可换成四路英文并发,合计只有88.8–92.8 tok/s,他特意注明"不是每条请求速度"。同一位UP主的另一条实机展示里,一台英伟达Jetson Thor T5000算力舱跑tensorfold版千问报出82 tps。 你要的是多用户API、RAG服务、家里多人共用,"并发合计"这一栏才是裁决项。哔哩哔哩哔哩哔哩

口径二:"3倍"的对面站着一个不对称的对手。 科普视频文末自己标注:对比双方量化口径不同(MLX 4-bit vs NVFP4)。双Spark复测还有另一层不对称:vLLM侧移植了低拒答权重补丁,TensorFold侧用原权重,草稿模型、数值路径、采样路径全都不同——UP主的原话是"不能把所有差异归因于引擎"。哔哩哔哩
口径三:你看到的可能是"旧版本"的成绩,官网自己也这么写。 知乎作者沙姆耶律耶维奇10月5日拿一台64GB M5 Max复现:TensorFold官网首页展示Qwen3.8-27B配DFlash2在128GB版M5 Max上跑到120–124 tok/s,但同一页标注了"earlier builds"(历史版本数据)和"Current-release benchmarks are pending"(当前版本跑分待发布),README的Measurements章节链接也指向历史commit。他复测当前0.6.5版,顺带把加速机制拆开讲:投机解码每轮草稿提出16个token、主模型一次验证,这轮耗时恒定约46ms、带宽打满——速度的唯一变量是草稿接受率。数数类任务几乎全中;中文散文里DFlash2的2262个草稿只命中72个,接受率3.7%;换成官方checkpoint复测,中文接受率同为3.7%,与量化无关,是草稿模型本身对中文预测能力差。 英文实测65.4–68.9 tok/s。科普视频评论区的M5 Max用户报的数更直白:平均70+、偶尔能到100+;另有人一句"预填充巨慢"。关于"逐字节一致",官方的限定也说得很细:那是与同一引擎关闭草稿后的输出比对,不同量化、不同后端之间本来就可能不同——评论区"拿精度换的""用omlx里的模型测了不太ok,在重新下权重"的吐槽,和这句限定互为注脚。知乎
三、官方的入场券清单:只有4款模型,27B被"承认"慢于老版
10月7日的1.0.0发布说明把口径问题钉得更死。原生Zig二进制加内置HTTP服务器,运行时不再需要Python/MLX,接口兼容OpenAI与Anthropic Messages。 消息很提气,但"仅以下模型与硬件组合获准入1.0.0"这张表很短:GitHub
模型 | 准入1.0.0的平台 | 服务范围 |
|---|---|---|
Nemotron 3.5 Lightning 30B-A3B | Apple M1–M5(Metal);GB10(CUDA) | 带草稿头;并发共享轮次 |
Qwen3.8 Flash Next | 仅M5 Ultra(Metal) | 贪心解码、单流 |
GLM-5.3-Flash | 仅两台M5 Ultra Mac配对 | 单流 |
Qwen3.5-2B | M5 Max | 单流 |
发布说明里最扎心的一句是关于27B的:Qwen3.8-27B已通过"drafted/plain输出相等"校验,但因为配对服务解码与冷prefill成绩都慢于Python 0.6.6,被留在1.0.0之外,等1.0.x移植。 也就是说,把这波引擎名声打出去的正是27B,而它的原生1.0版还不如旧的Python版快——官方没有遮掩。Bonsai、Gemma 4、Qwen3.6、DeepSeek-V4也在同一张等待名单上。GitHub
N卡党先翻页:1.0的CUDA只服务GB10(DGX Spark那颗SoC)上的Nemotron,同机速度还只是Python 0.6.6的1.01–1.10倍——"3倍"轮不到原生CUDA,官方原文也说得很直白:Other NVIDIA GPUs and the other families stay on the Python line for now。 4090党不用太难过:0.6.0(9月30日)才加入RTX 40系支持,你能玩的仍是Python线。顺带一提,DGX Spark的64GB版本月23日开卖、起价4999美元——Spark党多了个入门档,但1.0.0表里的CUDA栏依然只写了GB10。GitHub小红书

还有一道隐性墙是权重。1.0不认GGUF、只吃官方转换的MLX checkpoint,科普视频的原话是:目前只适配少数模型家族,需要官方转换的权重(不支持GGUF)。 `tensorfold pull`会把checkpoint下到Hugging Face缓存里,断点续传、逐个文件做sha256校验。 官方甚至做了保护:`pip install` 1.0.0会拒绝覆盖可用的0.6.6、直接打印指引。 你在oMLX/LLM Studio里攒下的存量模型库,到了1.0这边基本要重新下过。哔哩哔哩GitHubGitHub
四、对号入座:你的机器现在该不该上车
手握M5 Ultra、跑Flash Next或GLM-5.3-Flash:这波的主桌。但GLM要两台M5 Ultra Mac配对才进得了1.0.0;Flash Next在1.0只支持贪心单流;别指望中文散文也提速,草稿接受率摆在那儿。
M1–M4党(含Mac mini M4党、M2 Max旧机主):1.0准入模型基本只有Nemotron 30B-A3B一个(2B绑M5 Max、Flash Next和GLM绑M5 Ultra),其余家族官方明说继续在Python线。评论区M2 Max用户的原话是:MTPLX的适配度比TensorFold稳定的高。 跟着这句走,不急。哔哩哔哩
4090/5080党:原生引擎暂时没有你的事,现在留守vLLM/llama.cpp/SGLang不是落后。10月8日,微软发布了首批搭载RTX Spark N1X超级芯片的电脑Surface Laptop Ultra,最高配备128GB统一内存、可在本地运行超过1200亿参数的模型,起售价2599美元。 但1.0.0的准入表里,N1X机型同样没有栏位。36氪
DGX Spark党:同机对比,原生1.0只比Python引擎快1–10个点,别为那串t/s录屏重装系统。
要跑家庭API/RAG多人并发:1.0里只有Nemotron有共享轮次,官方数字是M5 Max上8路并发合计436.7 tok/s、单流262.8。 总盘子是单流的1.66倍,摊到每路只剩约55 tok/s;Flash Next和GLM一次只服务一个请求,"shared rounds"官方排期在1.0.x。并发场景仍是vLLM的主场。GitHub

五、四个值得继续盯的信号
官网那行"pending"的current-release benchmarks何时补上——"3倍"叙事有没有地基,看这页数字用哪个版本跑出来的;
1.0.x移植名单(27B、Bonsai、Gemma 4、Qwen3.6、DeepSeek-V4)落地时,27B的配对服务解码能否反超Python 0.6.6——反超之前,"27B爆火"和"1.0"是两个世界的事;
Flash Next/GLM的并发共享轮次是否如期进1.0.x——决定它能不能从"晒速玩具"变成"服务底座";
Mia、jayleaton这类百来star的社区配方repo与官方线是合流还是分叉——低拒答补丁、EXL3权重这些"能用的细节",现在都在fork那一边。
提速是真的,"3倍"也是真的——但它只在特定模型、特定硬件、特定任务的单流解码里成立。这台引擎刚满1.0,官方自己的口径反而比社区诚实:先把你手里的入场券对完,再谈换不换。