8G显存跑35B、比llama.cpp快两倍?FreeToken两周全网实测吵完:98赞热评说只有1/5速度,3090党"老设备焕新春"也是真的——国庆装机前先对完四张入场券

源自30位全网作者

12:09

8G显存跑35B、比llama.cpp快两倍?FreeToken两周全网实测吵完:98赞热评说只有1/5速度,3090党"老设备焕新春"也是真的——国庆装机前先对完四张入场券

这个9月的本地部署圈,FreeToken出视频的频率比新模型还密:“8G显存跑35B大模型,速度飙到近40 TPS”“比llama.cpp快近两倍”“4GB显存跑Qwen3.8-27B,白嫖党狂喜”。我把它家两个主视频的评论区、知乎和B站相关实测帖全部翻了一遍,两百多条真人反馈里,两条高赞评论互相打脸:一条98赞——“帮你们试了,实测速度是llama.cpp的1/5”;一条13赞——“单卡3090跑DeepSeek-V4-Flash原版MXFP4,11-12 token,用llama.cpp只有5 token,老设备焕发新春,适合挂机”。哔哩哔哩哔哩哔哩

两边都是真的。这就是这篇要替你把账算清的地方:FreeToken不是"小显存救星",它是一把很窄的钥匙,开对了锁是真省钱,开错了就是你国庆假期的第一周。

它到底在干什么:一句话版

MoE模型每次推理只激活一小撮"专家",FreeToken的做法是把高频专家常驻显存、低频专家丢在内存里就地算,GPU和CPU各干各的,用调度换带宽。 所以它吃的是"显存装不下整个模型"的场景红利——代价也全埋在这句话里:凡是过PCIe搬运的环节,都是它的短板。哔哩哔哩

评论区实测矩阵:你的配置对到哪一行

把各档硬件的真实数字摆平了看(全部来自视频评论区自述,非官方):

  • 9950X3D2 + 128G内存 + 5080:Qwen3.6-35B-A3B NVFP4跑到40-80 t/s,双路能到130。哔哩哔哩

  • 双3090 + 64G内存:35B-A3B NVFP4,256K上下文跑满,速度稳定在50-60 t/s,内存占用约31G。哔哩哔哩

  • 4090 + 128G:Qwen3.8-Flash-Next约40 tps,768K上下文;

  • 3060 12G + 32G内存:gpt-oss-20b对接Open-WebUI跑通,属于"低配能落地"的正例。哔哩哔哩

  • 8G显存 + 24G内存:7B都要卸载到内存,评论区原话"我还是去给模型厂商上供好了"。

8G显存跑35B、比llama.cpp快两倍?FreeToken两周全网实测吵完:98赞热评说只有1/5速度,3090党

看出规律没有:标题里的"8G跑35B"和评论里的"40 TPS"各自成立,拼到同一台机器上就不成立——它真正的工作区间是"50系或3090/4090级单卡 + 64G起步的双通道大内存 + MoE模型 + 不赶时间的长输出"。速度数字好看的全在激活参数小的A3B/Flash类MoE上;显存内存两头都寒酸的,跑起来也只是"能打开",不是"能用":有人实测4G显存+32G内存跑35B,上下文被挤到只剩1024。哔哩哔哩

三道死刑:决定要不要动手的,不是速度表

评论区翻车帖归拢下来就三类,每类都直接判死刑:

  1. Prefill慢。有人实测"等待几秒显示几十、几百、一千、一万",单卡22-25 t/s但prefill比LM Studio慢一截,“在我这里直接死刑”。 你是打字快、要它快读长文档的场景,这条最劝退。哔哩哔哩

  2. 只支持单卡 + 单卡约20K上下文。双3090的老哥原话:"每张卡都只能塞入20K左右上下文,无法拿来连入最低限度是32k的智能体。"想转本地跑agent的,这个月别在FreeToken上耗。哔哩哔哩

8G显存跑35B、比llama.cpp快两倍?FreeToken两周全网实测吵完:98赞热评说只有1/5速度,3090党

  1. 格式锁死。模型基本只能用官方仓库重新编译的版本,HuggingFace上下载的GGUF大多加载不起来,第三方破限量化不通用,视觉模型还没支持——“把带识图文件的模型文件夹拉进去,还是只显示chat”。 而且CUDA only,A卡党连门都进不了;有人5070Ti笔记本卡死在模型格式转换失败上,折腾到此为止。哔哩哔哩

8G显存跑35B、比llama.cpp快两倍?FreeToken两周全网实测吵完:98赞热评说只有1/5速度,3090党

四张入场券:对完再下载

国庆8天是装机折腾高峰,有人已经在评论区留下结局:“我在家里折腾了两个星期这个项目……最后放弃了……不适合我。” 开坑前对一遍:哔哩哔哩

  • 券一:N卡,最好是50系。评论区选型口径很直接:“freetoken只推荐50系显卡,其他的还是用llama.cpp吧”,40系的有人提示"试试exl3"。哔哩哔哩

  • 券二:内存≥64G双通道。老玩家点破关键:“主要是吃内存通道和频率,cpu核心8到16就足够了”——别急着升CPU,先把两条内存插成双通道、确认BIOS里的XMP/DOCP没被关。 有人查自己天天跑35B MoE的机器,发现标称3200的条子一直在跑2400默认频率——一半专家压在内存里,这个频率就是它真实的工作带宽。哔哩哔哩小红书

  • 券三:只跑MoE、只当挂机聊天机。稠密27B它帮不上忙,“一次要搬运所有权重,就看带宽”;它的甜蜜点是长时段稳定输出——3090党拿来挂机出长文,电费换token自由。

  • 券四:接受官方模型列表。要破限、要视觉、要自己挑量化,这条路上没有。

四条全中的,它是近期性价比最高的"老设备续命"方案;缺一条的,评论区早就给你备好退路:llama.cpp加nvfp4 GGUF、LM Studio,或者干脆继续上供API——“还不如lm”。 知乎那个五万多浏览的装机帖说得更直白:“不要被网上什么一张4090跑Deepseek满血模型忽悠,钱不够,直接用云端模型服务或者租用云端服务器,不要想多快好省的美事儿。”哔哩哔哩知乎

继续盯什么

项目还在日更,评论区自己都在吐槽"几天就出个新的,太快了跟不上了"。 真要给它第二次机会,盯三个更新信号再动手:双卡支持进roadmap、GGUF加载器扩到主流架构、prefill优化合并进主分支。这三个哪个落地,哪类人值得回头重装;都没有落地之前,先看别人折腾完,比自己折腾两个星期便宜多了。哔哩哔哩

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章