如果你最近刷到"手机也能本地跑大模型"的帖子,多半是被这三周的消息推着走的:9月1日,科大讯飞全资子公司词元星火把星火X2.5-4B和1.7B两款端侧模型开源,官方口径是端侧模型里首个原生支持100万token上下文。9月7日,293B的星火X2.5基座发布;9月9日,又有博主曝出华为Pura X View、Mate XT 2非凡大师支持端侧大模型下载部署,安装包一个约6GB、一个约15GB。往前数,7月15日网信办首次公示了7款手机端侧生成式AI备案;8月22日SuperCLUE发布了专门针对"手机本地能跑"的OnDevice端侧榜单。今日头条今日头条
信号很密,但越是这种时候越要先把账分清:这些帖子里说的"本地部署",和你我熟悉的那套显存、量化、t/s,不是一回事。这篇就替你把9月的端侧行情盘一遍,再告诉你今天真正能自己上手的门在哪。
一、先拆三本账:备案、榜单、爆料,各有一处水分
第一本账:备案≠你手机里跑着大模型。7月15日入名单的7款是Apple智能、华为小艺、OPPO AndesGPT、vivo蓝心、小米澎湃AI、三星盖乐世AI、努比亚豆包大模型,荣耀反而缺席。但"端侧备案"是服务合规口径,不等于每个功能都离线推理:Apple智能的公开方案是阿里千问作为AI能力集成、百度承接图像文本搜索和Siri升级,实际形态是端云协同的混合路由,功能rollout也才刚开始。更有意思的是名单的结构——7家里6家是手机厂商自研模型,唯一的例外是三星盖乐世AI:给它的端侧能力供货的是清华系创业公司面壁智能,MiniCPM系列从7月23日发布的Galaxy Z Fold8开始首搭,支持文本理解与多模态感知、全程本地运行。备案落地了,不代表你打开的那个"AI消除"就真在本地算。今日头条今日头条今日头条

第二本账:榜单第一和"端侧第一"不是一个榜。SuperCLUE OnDevice榜专门只排能直接在手机本地跑的模型,云端模型只做参照不参排,vivo蓝心BlueLM 3.5 Nano 3B以89.86分拿下端侧综合第一。Qwen3.5 9B(87.82)、Qwen3.5 4B(85.16)分列二三位,与作为云端参照的Gemini 3.6 Flash(93.64)、豆包Seed 2.1 pro(92.99)、Qwen3.8 Max(92.25)分差缩到个位数——这是真消息。今日头条

但同一周AgentCLUE Mobile手机GUI Agent榜上92.11分登顶的"蓝心小V",测评说明里写的是采用API调用方式、可借助云端大模型能力。“3B端侧逼近云端"和"手机助手第一"这两句话各自成立,拼在一起说"手机AI不输云端”,就是话术了。云端大厂也在把模型往小做:腾讯混元今年2月就把HY-1.8B做了2比特量化感知训练,等效参数量只有0.3B、内存占用仅600MB,比常用的一些手机应用还小,官方口径可本地化部署于手机、耳机或智能家居等设备应用。它那张精度—模型尺寸散点图里,2Bit量化点就标在"压缩6倍"的位置上。宣传话术照例打五折听,但"口袋里的模型又小了一档"这个趋势是真的。今日头条知乎

第三本账:华为那两个模型包是爆料,不是官宣。6GB多模态增强(本地图像生成、语音合成、相机超清增强、图库修图)、15GB多模态MoE(离线照片整理等复杂任务)的说法来自博主放出的系统截图。推送发生在今年8月:HarmonyOS 7.0.0.102 SP8版本推送后,支持端侧AI的机型多了"查看本地模型版本、参数大小"的入口,于是截图有了想象力空间。功能清单、机型范围、推送计划,最终都以华为官方公告为准——15GB安装包对256GB存储的机主来说,更得等官宣再动。今日头条
二、今天真能自己跑的,其实就三条门
门槛最低的一条:模型市场型App。阿里MNN系的MNNChat安卓/iOS都能装,模型市场里找到Qwen3.5-0.8B-MNN,点击下载约500MB,Android 10以上、预留1GB空间就能跑。有教程在X200 Pro上实测:预填充156.52 tokens/s,思考模式生成一篇约1800字长文耗时41秒、解码约43.31 tokens/s,断网照常工作。数字别直接套到自己中端机上——那是旗舰跑0.8B。微信

谷歌这条路线也铺开了:7月开源的LiteRT-LM是一个在手机本地跑大模型的推理框架,用Multi-Token Prediction提速,官方称推理速度能快最多3倍,Android、iOS、树莓派都覆盖,Pixel和Chrome里的本地AI功能背后就是它。今日头条
半自动的一条:Termux + llama.cpp,本地党熟悉的GGUF世界下放到手机。手机上没有终端,得先有Termux——一个在安卓上跑完整Linux环境的终端App。实测帖给出的经验值得抄作业:Termux别从应用商店装(Play版停更仓库是坏的),走F-Droid或GitHub Releases;编译必须在Termux家目录进行,放到/sdcard必报Permission Denied;量化选Q4_K_M甜点;Vulkan GPU加速"成不成看运气",先纯CPU跑通再加层。体感预期给死:1B流畅当主力、3B旗舰机能跑但长文明显降频、7B以上能加载但慢到没有交互体验;底线是6-8GB内存的64位ARM机。手机共享一块内存、没有主动散热,连续推理几分钟温控降频,天然适合"问一句答一句",不适合闷头跑长任务。跑通后llama-server起8080端口,同Wi-Fi的电脑还能把这手机当个小API节点使——赛博,但别指望它替你干活。微信
新开源的一条:星火X2.5-4B/1.7B,手机吃不到,PC和盒子先受益。两款模型权重已经在Hugging Face和GitHub上开放,对应API上线讯飞星辰MaaS平台、限时免费。它兼容llama.cpp、vLLM、SGLang,也能用Ollama、LM Studio快速部署,支持英伟达、昇腾、海光、后摩等硬件;1.7B在Domux智能家居测试集里控制指令端到端执行正确率90.3%、平均响应0.85秒。真正的看点是4B参数塞进原生100万token上下文,走的是混合注意力路线——但它的现实主场是车载、智能硬件和老PC,不是你现在这台手机的散热规格。今日头条

三、把端侧账和16G显存档摆进同一张账单
前阵子站内算过16G卡跑27B量化的账,那一档换来的是能干活的完整能力。端侧这边买的是完全不同的东西:
维度 | 手机端侧(0.8B-4B) | PC本地档(16G显存,27B Q4) |
|---|---|---|
成本 | 0元,现有手机 | 数千至数万(显卡/整机/二手机) |
速度 | 0.8B流畅;3B降频;7B+无体验 | 量化阶梯不同,23-67 t/s量级 |
能力 | 短问答、摘要、翻译、离线兜底 | 长文、代码、Agent任务主力 |
价值点 | 离线、隐私、毫秒级延迟、无token焦虑 | 完整私有化+可接入本地工具链 |
主要敌人 | 发热降频、存储占用、后台内存 | 显存预算、量化选型、折腾时间 |
IDC预计2026年中国Gen AI手机渗透率突破50%,正式迈入普及阶段——也就是说"口袋里有个能离线跑的模型"很快就是标配,而不是折腾成果。对已经在PC上跑27B的人来说,端侧不是降级替代,是把"断网兜底、隐私碎活"卸载给手机,主力继续留在显卡上。今日头条
四、三类人分流,外加四个观察信号
没电脑、被种草的入门党:先装MNNChat跑0.8B试一周,问它翻译、总结、查资料,看打开频率再说要不要上Termux。不花钱,别一上来就为"本地AI"换手机。
手里有16G卡的本地党:端侧浪潮不动你的主力位。真正该试的是星火X2.5-4B——拿Ollama/LM Studio拉下来,塞100万上下文的长文档,看它在你的老PC上能不能当"离线文档官"。
华为机主、持币观望党:等官方公告覆盖哪些机型、模型包真实体积、是否影响续航再开;博主截图不是推送计划。
继续盯四个信号:HarmonyOS端侧模型下载的官宣机型清单;Apple智能国行功能实际rollout范围;讯飞1024开发者节基于全国产算力的主力模型;以及下一轮端侧榜单会不会把"GUI Agent是否纯本地"单列出来。
最后照例提醒:每次"本地XX"起量,标题党量产帖就跟着来。去年是"GPT-6本地部署",这个月是"手机一键装大模型,附带部署安装包U盘直装"——模型权重在HF、GitHub、魔搭都有正规入口,凡是让你下"封装版安装包"的,先想想数据绕没绕过别人的机器。