「35B跑进2.5GB内存」和「0.7 tok/s」都是真的:Edge0官方帖、模型卡和两次拆解的13组数字摆一张表——端侧显存的账没消失,只是搬去了SSD

源自230位全网作者

10-07 17:34

「35B 跑进 1.5GB 内存,手机上就能用。」十月的第一周,这套说法在小红书被新一轮教程帖顶上首页,配文的比方很抓人:资源占用接近刷短视频、隐私直接拉满。而在同一个项目的另一头,有人在 8GB 的 Mac 上实测后留下一句:页缓存耗光之后,它一秒只吐 0.7 个 token。

两边都是真的。一句是官方口径,一句是海外拆解,说的还是同一个开源项目——Edge0。

一条帖子、一张模型卡、两次拆解:时间线先摆正

9 月 10 日晚,Edge0 团队发官方开源帖(376 赞、481 收藏、72 评论):35B 参数模型,峰值内存 1–2.5GB,在手机、电脑上本地推理。权重不常驻内存,留在存储上按需取用;一个小的路由头提前一个 token 预测下一层要用哪些专家,“把读取的时间藏进计算里”。这条帖子没有说明测试设备。小红书

9 月 14 日,国内 UP 主发出第一波对比实测:这是基于 Qwen3.6-35B-A3B 的 MoE 模型,每 token 激活约 3B——这就是名字里 A3B 的意思。9 月 16 日,海外技术博主 Cloud Codes 做了期 20 分钟的拆解:Safetensors 头文件、源码、GitHub issue,一项项翻。哔哩哔哩哔哩哔哩

9 月 30 日,官方模型卡更新:四个平台的原生推理引擎(iOS/macOS/Android/Windows)开源;10 月 2 日官方再发一帖,把应用层开源,补了一句:1–2.5GB 不是宣传数字,是和内存、功耗、发热、首 token 延迟反复谈判后的结果。而截至 10 月 7 日,官方模型卡的头条是第三套数字:3 GiB 活跃内存、15 tok/s、4-bit。小红书Hugging Face

宣传口径、实测口径、拆解口径之间对不上的地方,就是这件事最有信息量的地方。我把官方帖、模型卡、国内对比、海外拆解里的 13 组数字摆进同一张表:

数字

内容

出处

备注

1–2.5GB

峰值内存

官方开源帖(9/10)

未注明设备与口径

2.9GiB(3GiB)

活跃内存

官方模型卡实测/头条

Mac mini M4 Pro、24GB

19.5GB

完整 checkpoint,其中 18.1GB 专家权重驻留 SSD

海外拆解

省的是内存,不是硬盘

453MB vs ~310MB

每层专家实际读取足迹 vs 文档标称

海外拆解

256 / K=4

专家总数 / 每 token 激活数

官方模型卡(现行)

拆解发现 Qwen 原生 K=8 被减半

14.9–17.7 tok/s

解码速度

官方模型卡自测

Mac mini M4 Pro、24GB

113 / 140 tok/s

长文 prefill 冷/热

官方模型卡

冷启动慢,预热靠系统文件缓存

100+ tok/s

原生 Qwen3.6-35B-A3B

国内 UP 主对比(M4 Max)

同场对比下 Edge0 约 15 tok/s

最高 +59%

Prerouter 解码增益

官方口径

对照的是它自己不预取,不是原生

79.2 vs 83.2

int4+adapter vs fp16 五项基准均分

官方 OpenCompass 自测

差 3.9 分;AIME 86.6 vs 92.7 跌得最狠

0% 命中

内置 64 槽专家缓存实测

海外拆解

真正干活的是 macOS 页缓存

0.7 tok/s

8GB M1 缓存耗光后

海外拆解

项目翻车现场

只有 Mac 数据

性能测试覆盖范围

官方模型卡

安卓/手机尚无第三方实测

第一本账:显存的账没消失,只是改记在"存储+缓存"两处

19.5GB 权重放在 SSD、只把路由命中的专家调入内存——这是整套机制的全部戏法,它也决定了两个前提:第一,你的盘要够大,要能再腾出 19.5GB;"2.5GB"的说法里省的是内存,不是硬盘。Hugging Face

决定生死的也不是算力,而是 I/O 和系统缓存:拆解实测内置的 64 槽专家缓存命中率为 0%,真正兜底的是 macOS 内核页缓存;8GB M1 的空闲缓存被耗光后,解码直接掉到 0.7 tok/s——机器"在跑",但没法用。官方模型卡也在脚注里承认:短上下文才是那个内存数,长上下文还要加 KV 缓存。所以"1–2.5GB"成立与否,取决于你的设备愿不愿意用硬盘和富余内存替它藏账。哔哩哔哩Hugging Face

第二本账:参数通胀是合法的,但损失是真的

海外拆解当时指出:Qwen 原生路由宽度是 K=8,Edge0 把它悄悄减半了,且当时文档里没写这个改动。到现行官方模型卡上,256 个专家、每 token 激活 4 个(K=4)已经写得明明白白。减半的理由不难猜:每步要从 SSD 流式加载的专家越少,速度越保得住。哔哩哔哩Hugging Face

K 减半加 int4 量化,官方自己在卡上摆出了成绩单:同一套 OpenCompass、同参数,int4+adapter 对 fp16 原版,五项基准均分 79.2 对 83.2,差 3.9 分;最疼的是 AIME,86.6 对 92.7,数学掉了 6.1 分。Recover-LoRA 用蒸馏"找回大部分量化损失"——"大部分"三个字是原话,不是全部。Hugging Face

拆解那边还复现了一串工程问题:预览版只支持单请求并发、NaN 溢出、带感叹号的输入触发崩溃。官方卡上也自认两条限制:这一版还没为 Agent 优化,工具调用、多步规划、长程自主都偏弱;且主要按基座模型的语言调优。哔哩哔哩Hugging Face

第三本账:15 tok/s 是诚实的,+59% 也是诚实的——但两句都要读对

官方卡自测解码 14.9–17.7 tok/s(Mac mini M4 Pro、24GB),长文 prefill 冷 113、热 140,意味着喂长文档的第一遍要等,预热靠系统文件缓存。这个数字和海外拆解实测的 15–18 tok/s 对得上,没有撒谎。Hugging Face

但要和"回不去 27B 了"式的兴奋区分开——国内对比里,原版 Qwen3.6-35B-A3B 在 M4 Max 上是 100+ tok/s,Edge0 大约只有它的七分之一。"最高 +59% 解码吞吐"也一样,它的对照对象是 Prerouter 不做预取的 Edge0 自己,不是原生模型。哔哩哔哩Hugging Face

更要紧的缺口在上面那张表的最后一行:以上所有速度数字都出自 Mac。评论区其实早就把问题问完了——9 月 11 日最高赞(7 赞)问"prefill 和 decode 分别能达到多少 tps",模型卡现在有答案了;9 月 29 日有人问"会有安卓版本吗,想要",9 月 11 日有人问"耗电和发热情况怎么样",这三个到今天官方都没有手机侧数字。下载侧还有个时间差:9 月 11 日有人反映 ModelScope 搜不到 35B 只有 8B,现行模型卡上 35B/8B 的 ModelScope 条目已经并列挂出。小红书

同一周,另外两件"端侧"的事

10 月 1 日,华为 Mate90 发布会把小艺端侧 30B MoE 全模态推上台前,10 月 7 日余承东的说法是"手机本地跑 30B 大模型"。真实用户帖里刷屏的却是存储账:点进下载入口"刚显示了一下 15G",512GB 版本需要手动下载、1TB 版本才自动开放,还有"1TB 也提示未检测到"的追问,客服口径是十月中逐渐开放。微博小红书

10 月 6 日,谷歌 DeepMind 发布 EmbeddingGemma 2:7.4 亿参数由文本 270M+视觉 170M+音频 300M 拼成,把文本、图片、音频、视频放进同一个向量空间,Apache 2.0,官方定位消费级硬件。768 维向量截到 128 维,原始向量字节数只剩六分之一,代价也写在官方评估表里:多语言 MTEB 从 61.36 掉到 57.89,多模态 MMEB v2 从 59.01 掉到 45.65。知乎小红书

三件事放在同一周看,说的是同一句话:端侧的瓶颈早就不是"参数能不能吹",而是装得下多少权重、盘和缓存愿不愿意替内存干活、官方什么时候给你推送。"手机上能跑"是真的,"要等十月中才开放下载"也是真的。

三种人,先对账再动手

手里是 16GB 以上、带 NVMe 的 Mac:现在可以装,把它定位成"常驻、私密、慢"的本地助手——写作、摘要、离线问答,别交给它官方自己都承认偏弱的 Agent 自动化,也别指望高频长文档不预热。

8GB 老 Mac 或安卓党:先别冲。缓存耗光 0.7 tok/s 的悬崖发生在同一套机制上,而安卓侧至今没有第三方实测,发热和耗电连官方数字都没有。等三样:缓存行为修复、安卓实测、手机侧 tok/s。

想"以机换卡"、指望端侧顶替云端或桌面 27B/32B 的:别指望。15 对 100+ tok/s、AIME 掉 6.1 分、Agent 能力自认偏弱——它不是你以为的那本账。

接下来盯四个信号:①Edge0 安卓/手机端第三方实测(重点看 tok/s、发热、耗电,官方卡只给过 Mac 数据);②64 槽缓存 0% 命中和页缓存依赖的修复,以及下一版 Recover-LoRA 能不能把 3.9 分追回来;③华为首批端侧大模型下载十月中的全量推送,512GB 用户能不能"上车";④EmbeddingGemma 2 的本地向量库实测——它是本周唯一"今天就能装进手机"的端侧选手,768 维还是 256 维,值得先用真实查询跑一遍召回再定。

一句话收账:Edge0 确实把 35B 塞进了手机和老 Mac,但它的"1–2.5GB"不是一张内存条发票,是四行账——19.5GB 存储、系统页缓存、3.9 分精度、每秒 15 个 token。显存的账在端侧从来不会消失,只是换个名字记。动手之前,把这四行对着自己的机器逐项过一遍。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章