手机跑上30B、iPhone标到140亿:这周端侧的数,我帮你和Mac、PC摆进同一张表

源自236位全网作者

16:12

这周本地大模型圈的推送浓度,接近过去一个月的总和。9月22日骁龙峰会同时扔出两颗2nm旗舰,高通顺手演示了300亿参数MoE模型全程在手机上干活;9月25日,苹果在一场面向IT管理员的Jamf大会(JNUC)上被拍到一张"本地AI天梯图",iPhone一栏写着140亿。9月23日,小米18 Pro完成发布,首发新一代骁龙8平台。再往前,9月初的华为发布会也放出过"手机首次支持300亿参数端侧大模型"的消息。微博知乎

与此同时,你的信息流里还混着一条小红书热帖:“2MB小工具跑起744B大模型”,点赞收藏都破百。

热闹归热闹,评论区问得最多的是一个很朴素的问题:端侧报的这些数,跟我那台跑27B的机器,到底是同一个坐标系吗?我们上一篇实测里,27B模型塞进32GB的M6 Mac mini,跑出过8.3 token/s——按这个标准,“手机跑30B"听起来像天方夜谭。把这周所有信源摊开对完,我的结论是:这是端侧第一次把口径讲对了,但"讲对了"离"你用得上”,还隔着三层。

先把这周厂商公布的数,按统一口径摆一张表

各平台"能跑多大模型",这周被第一次放进同一张坐标系:

设备/平台

统一内存

带宽

官方标注的参数上限

口径

iPhone 18 Pro / iPad(顶配)

最高16GB

76GB/s

140亿

活跃参数

MacBook Air

32GB

153GB/s

350亿

活跃参数

Mac mini

64GB

307GB/s

700亿

活跃参数

MacBook Pro

128GB

614GB/s

1200亿

活跃参数

单台Mac Studio

512GB

1.2TB/s

4800亿

活跃参数

四台Mac Studio集群

2TB

—

~1.6万亿

活跃参数

第六代骁龙8超级至尊版(手机参考平台)

—

—

300亿(MoE)

总参数,支持部署

手机传感器中枢(双Micro NPU)

—

—

2亿

本地常驻小模型

手机跑上30B、iPhone标到140亿:这周端侧的数,我帮你和Mac、PC摆进同一张表

苹果这张图最扎眼的地方,是它标注的列名就叫"活跃参数":iPhone 与 iPad 一栏是最高 16GB、76GB/s 和 140 亿。高通那边则是总参数口径:官宣与阶跃星辰、无量火科技、江波龙四方合作,把300亿参数MoE模型跑在手机端侧,给出的数词儿是"首个词元毫秒级生成"。知乎微博

三个不能直接对比的口径,比参数本身重要

第一,300亿 ≠ 你电脑上的300亿,140亿 ≠ 新Siri有140亿。MoE模型像一个顾问公司:会议室里同时只叫对口的几位专家到场。转载这张图的解读也说得直白:苹果今年介绍的一个稀疏模型,总量 200 亿参数,每次只激活 10 亿到 40 亿。140亿"活跃参数"不等于手机里塞了一个140亿稠密模型,更不等于你手机上那个助手变聪明了14倍。对本地玩家来说这不是新东西,你把27B模型的激活量摊开算过就知道;新的是官方终于把"激活"二字印在了幻灯片上。知乎

第二,“首个词元毫秒级” ≠ 你会感受到的打字速度。官方口径里最先放出来的数通常是TTFT(首token延迟),主要考预填充;决定"读不跟得上"的是解码速度。这周流传的参考机数据里,两组数各自成立:预填充超过330 Token/s,解码是28 Token/s——330是"多快开始回你",28才是"每秒吐几个字"。而28 Token/s对应的还是"参考机+30K上下文"的实验室条件,安兔兔563万分同样是参考机跑出来的成绩。微博

第三,参考机 ≠ 量产机,能装 ≠ 能用。阶跃那套30B-MoE端侧演示链——读邮件、提取行程、同步日历、推荐航班酒店、草拟回复——发生在参考设计上,官方称其为一次可感知的跨越。而"能装"和"能用"的极限反例恰好也在这周:colibri那个2MB的纯C工具,把744B模型的热层放内存、专家放硬盘,普通笔记本真跑起来了,答案是对的,但冷启动只有0.05–0.1步/秒。装得上,从来不构成卖点;带宽和调度才是。这也解释了为什么做存储的江波龙会出现在高通的合作名单里——端侧跑大模型拼到最后,拼的是内存墙。36氪小红书

手机跑上30B、iPhone标到140亿:这周端侧的数,我帮你和Mac、PC摆进同一张表

这周真正值得记下来的事:三把尺子公开了

苹果那张表的排序逻辑,其实就是你自己在表格里算过一百遍的东西:内存决定装多大,带宽决定多快,激活参数决定实际算力开销。iPhone的76GB/s和Mac Studio的1.2TB/s之间是16倍的差距,这个"参数上限"的梯队本质上是带宽梯队。高通的思路是同一条路的不同解法:Hexagon NPU给片上共享内存扩容50%,把KV-Cache挪到NPU就近位置,CPU堆到5GHz先解决智能体调度,重心从"跑大模型"移到了"让智能体不卡、不烫、不断电"。知乎

对比2024年端侧"最多7B"的官方自述,两年到30B MoE,这个斜率是真的。但社区泼冷水的证据同样充分:高通中国区董事长孟樸自己对36氪说,跨终端持续服务的个人智能体,“可能到2027-2028年,才会比较稳定地开始逐步落地”;现场验证的AI播客案例"需联网检索核查,整个应用并非完全离线"。知乎那个"隐私福音还是算力阉割:300亿参数装进手机靠谱吗"的问题下,关于小米18 Pro背屏联动本地大模型的高讨论回答态度很直接:“不大看好端侧,现在的运算能力,还是打个问号”。36氪

手机跑上30B、iPhone标到140亿:这周端侧的数,我帮你和Mac、PC摆进同一张表

对号入座:三类人现在各自该干嘛

1)正在装机/等装机的PC党:别拿"端侧30B"当暂缓的理由,但要改看带宽和内存。PC端这一年真正的痛点在价格和显存——"高端显卡涨疯了"的话题这周还在B站挂着讨论,"本地算力越来越稀缺、越来越贵"已经是社区共识。手机端侧解决的是"常驻、离线、贴身"这三件事,不解决你的长上下文代码任务和批量生产。而且注意,端侧28 t/s那个数字跑的是稀疏MoE,你本地跑的27B是稠密模型——同一个t/s,在两种架构下根本不是一回事。PC党真正该抄端侧作业的,恰恰是它"专家放硬盘、按需调度"的思路:这正是你这半年研究混合量化、磁盘加载在干的事。

2)Mac统一内存用户:14B进iPhone没抢你的活,反而是背书。苹果官方亲自把"内存/带宽/活跃参数"三列画成阶梯,等于承认了你们过去两年用MLX、低比特量化、组集群折腾出来的那套方法论。iPhone那76GB/s,跟你手里设备的307GB/s起跳不是一档;之前被问烂的"手机端侧模型出来了,我的Mac还值不值",这周的答案可以简化成:先问激活多少、带宽多少、token/s多少,三问都过了再谈买。

手机跑上30B、iPhone标到140亿:这周端侧的数,我帮你和Mac、PC摆进同一张表

3)想换新旗舰追"智能体手机"的:给三个观察信号再下单。①小米18 Pro这类首发新机上市一个月后的第三方实测:解码token/s(不是首token)、持续推理下的发热续航、真实上下文长度——参考机的28 t/s要能在量产机上复现七成才算数;②阶跃那套30B-MoE端侧模型会不会放出可本地化的权重,决定普通用户能不能自己验证,而不是只看演示;③苹果被曝在酝酿的低价AI订阅是否落地——如果连苹果都认为端侧要配订阅,"手机本地模型=免费token"的预期就该直接放弃。

手机跑上30B、iPhone标到140亿:这周端侧的数,我帮你和Mac、PC摆进同一张表

这周端侧最大的变化,不是手机装下了30B,而是"活跃参数、带宽、内存"这三把尺子第一次从装机党的Excel表格,走进了苹果和高通的PPT。对本地大模型玩家来说,这是好事:从此宣传口径和你的算账口径,终于可以用同一张表对线了。而下一个要吵起来的问题也已经排好了:等量产机的token/s实测刷屏那天,手机党会不会拿着参考数据,来PC区问"同样三万块,为什么你才8个token每秒"?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章