100 Token/s!M5 iPad Pro本地跑8B大模型实测惊到我了
这次测试其实挺有意思,因为它证明了一件事:苹果最新一代大内存 iPad Pro 已经具备非常强的本地大模型推理能力。
1TB 版本 M5 iPad Pro(16GB 统一内存),运行的是 Liquid AI 的 LFM2.5-8B-A1B Q4_K_M 量化模型。模型参数量约 8.47B,模型文件体积约 5.15GB,在 PocketPal 的 Benchmark 中跑出了 100.85 Token/s 的生成速度,Prompt 处理速度更是达到 1665 Token/s。
对于一台完全无风扇、仅靠电池供电的移动设备来说,这个成绩相当亮眼。很多人对手机和平板运行大模型的印象还停留在“能跑就不错”,但实际上,100 Token/s 已经远远超过日常聊天所需。正常阅读速度大约每秒只有几 Token,因此实际体验会是“字刚出来就已经看不过来”。
从测试参数来看,PocketPal 开启了 Flash Attention,GPU 层数设置为 100,充分调用了 Apple Silicon 的 Metal 加速能力。整个测试过程中内存占用约 5GB,仅使用了 16GB 总内存的三分之一左右,说明这台机器未来还有空间运行更大的模型,或者同时开启更长上下文。
另外也要夸一下 PocketPal。很多本地 AI App 只有聊天功能,而 PocketPal 这次加入的 Benchmark 模块把模型、量化格式、上下文长度、Prompt 速度、Token 速度和内存占用全部记录下来,对于喜欢折腾本地 AI 的玩家来说非常实用,也方便不同设备之间做横向比较。
如果按照目前这个成绩来看,M5 iPad Pro 已经不仅仅是“能跑大模型”,而是真正进入了“高性能本地 AI 终端”的范畴。随身携带一个能够以 100+ Token/s 速度运行 8B 模型的设备,放在两年前几乎是无法想象的事情。#我的数码装备进化史











