你的手机,藏着一个免费的AI
没有月租,没有token计费,没有"每日免费额度用完请充值"。只有手机的充电的电费。
你的安卓手机里,现在就能跑起一个大模型。
不是云端的,是真正装在你口袋里的。
所有人都说:大模型在云端
服务器要租,API要买,流量要算。 连个天气都要走一次网络请求。
MNN Chat不信。
它把整个推理引擎塞进了一个安卓App里。 模型下载下来,跑在本机。 断网了?照样聊。
先认识一下MNN
MNN是阿里巴巴开源的轻量级深度学习引擎。 服务器、个人电脑、手机、嵌入式设备,通吃。
它不是实验室玩具。 淘宝、天猫、优酷——阿里系30多个App里都在跑。 直播、短视频、搜索推荐、商品图像搜索、安全风控,全是它的战场。
更硬的背书: MNN是Walle系统的基础模块。Walle是首个端到端、通用型、规模化产业应用的端云协同机器学习系统,论文发在操作系统顶会OSDI 2022上。 MNN自己的初步版本,也上过MLSys 2020。
而MNN-LLM,就是基于这个引擎做的大语言模型本地运行方案。 千问、百川、智谱、LLAMA,都支持。
你手机里那个"免费的AI",底座是它。
装完就能用
安装后,桌面多了一个图标:MNN Chat。
桌面图标桌面图标
打开,底部有个"模型市场"。 点进去,模型就在那摆着。
模型市场模型市场
下载源可以选。 建议选魔搭,实测能跑到 10MB/s。 不想一个个翻?直接搜模型名,或者按分类过滤。
选择下载源选择下载源
搜索与分类搜索与分类
先跑个分,再决定用谁
下载完别急着聊。 先进"性能评测",看看你的机器能跑到什么速度。
性能评测性能评测
评测结果评测结果
后端一般选非CPU模式。 作者那台天玑8100,测出来一个有意思的结果: CPU预填充更慢,但输出更快。
拉了啊……
三个设置,决定体验上限
回到"我的模型",长按你想跑的那个模型,点开设置。
长按模型长按模型
第一个:上下文长度。 给多少,它就记多少。
上下文设置上下文设置
第二个:运行后端。 CPU、GPU,还是别的,自己选。
后端设置后端设置
第三个,也是最关键的: 右上角,开启API网络服务。
开启API开启API
API服务界面API服务界面
服务状态服务状态
你的手机,变成了一台AI服务器
回到"我的模型",点击你想运行的模型。 加载成功后,会弹出一行提示:API服务正在运行。
没有?关掉App,重新打开。
模型加载模型加载
API运行提示API运行提示
点右上角,进API设置。 默认端口 8080,可以改。 默认监听 127.0.0.1——只给自己用。 想从别的设备访问?点"监听所有"变成 0.0.0.0,或者自动获取局域网IP。 不需要密钥的话,把API认证关掉。
API设置API设置
最后一步:接上你顺手的客户端
先自己测一把。 不想看思考过程的,可以在设置里关掉。
实际效果实际效果
关闭思考关闭思考
然后,打开 Cherry Studio。 新建一个自定义模型,填上你手机的IP和端口。
接入CherryStudio接入CherryStudio
配置完成配置完成
模型Id在 http://ip:port/v1/models
模型Id模型Id
完事了。
云端不是唯一答案
所有人都说:大模型要上云,算力要集中,推理要进机房。 MNN Chat不信。
它把"机房"做成了你口袋里那块屏幕。 没有月租。 没有排队。 断网了,它还在。
然后,你的旧手机顺便变成了一台免费的AI服务器。
♥
转发给那个还在为API账单发愁的朋友。 他只需要一个安卓手机,和这篇教程。
下载App⏬
https://meta.alicdn.com/data/mnn/apks/mnn_chat_0_8_3.apk
https://play.google.com/store/apps/details?id=com.alibaba.mnnllm.android.release
https://1816337022.share.123pan.cn/123pan/Y4kqVv-EIyqv?pwd=CXNK#
♥
彩蛋:让小爱同学也用上它
如果你家里还有一台吃灰的小爱音箱—— 还记得那篇《小爱同学,是时候给你换个脑子了》吗? 那个 XiaoAi-LLM-Router,一直在云端模型上跑着。
现在,给它换个供能方式。
把 MNN Chat 的 API 服务开着, 在 Router 的配置里,把模型指向 http://你的手机IP:PORT/v1。
小爱收音 → Router 路由 → 你手机里的本地模型思考 → TTS 播回。
云端一个token都不用走。 断网了?小爱照样能答。
两台旧设备,一台安卓手机,串成一条完全离线的AI回路。
