你的手机,藏着一个免费的AI

2026-09-21 17:12:18 0点赞 1收藏 0评论

没有月租,没有token计费,没有"每日免费额度用完请充值"。只有手机的充电的电费。

你的安卓手机里,现在就能跑起一个大模型。

不是云端的,是真正装在你口袋里的。

所有人都说:大模型在云端

服务器要租,API要买,流量要算。 连个天气都要走一次网络请求。

MNN Chat不信。

它把整个推理引擎塞进了一个安卓App里。 模型下载下来,跑在本机。 断网了?照样聊。

先认识一下MNN

MNN是阿里巴巴开源的轻量级深度学习引擎。 服务器、个人电脑、手机、嵌入式设备,通吃。

它不是实验室玩具。 淘宝、天猫、优酷——阿里系30多个App里都在跑。 直播、短视频、搜索推荐、商品图像搜索、安全风控,全是它的战场。

更硬的背书: MNN是Walle系统的基础模块。Walle是首个端到端、通用型、规模化产业应用的端云协同机器学习系统,论文发在操作系统顶会OSDI 2022上。 MNN自己的初步版本,也上过MLSys 2020。

而MNN-LLM,就是基于这个引擎做的大语言模型本地运行方案。 千问、百川、智谱、LLAMA,都支持。

你手机里那个"免费的AI",底座是它。

装完就能用

安装后,桌面多了一个图标:MNN Chat。

桌面图标桌面图标

桌面图标

打开,底部有个"模型市场"。 点进去,模型就在那摆着。

模型市场模型市场

模型市场

下载源可以选。 建议选魔搭,实测能跑到 10MB/s。 不想一个个翻?直接搜模型名,或者按分类过滤。

选择下载源选择下载源

选择下载源

搜索与分类搜索与分类

搜索与分类

先跑个分,再决定用谁

下载完别急着聊。 先进"性能评测",看看你的机器能跑到什么速度。

性能评测性能评测

性能评测

评测结果评测结果

评测结果

后端一般选非CPU模式。 作者那台天玑8100,测出来一个有意思的结果: CPU预填充更慢,但输出更快。

拉了啊……

三个设置,决定体验上限

回到"我的模型",长按你想跑的那个模型,点开设置。

长按模型长按模型

长按模型

第一个:上下文长度。 给多少,它就记多少。

上下文设置上下文设置

上下文设置

第二个:运行后端。 CPU、GPU,还是别的,自己选。

后端设置后端设置

后端设置

第三个,也是最关键的: 右上角,开启API网络服务。

开启API开启API

开启API

API服务界面API服务界面

API服务界面

服务状态服务状态

服务状态

你的手机,变成了一台AI服务器

回到"我的模型",点击你想运行的模型。 加载成功后,会弹出一行提示:API服务正在运行。

没有?关掉App,重新打开。

模型加载模型加载

模型加载

API运行提示API运行提示

API运行提示

点右上角,进API设置。 默认端口 8080,可以改。 默认监听 127.0.0.1——只给自己用。 想从别的设备访问?点"监听所有"变成 0.0.0.0,或者自动获取局域网IP。 不需要密钥的话,把API认证关掉。

API设置API设置

API设置

最后一步:接上你顺手的客户端

先自己测一把。 不想看思考过程的,可以在设置里关掉。

实际效果实际效果

实际效果

关闭思考关闭思考

关闭思考

然后,打开 Cherry Studio。 新建一个自定义模型,填上你手机的IP和端口。

接入CherryStudio接入CherryStudio

接入CherryStudio

配置完成配置完成

配置完成

模型Id在 http://ip:port/v1/models

模型Id模型Id

模型Id

完事了。

云端不是唯一答案

所有人都说:大模型要上云,算力要集中,推理要进机房。 MNN Chat不信。

它把"机房"做成了你口袋里那块屏幕。 没有月租。 没有排队。 断网了,它还在。

然后,你的旧手机顺便变成了一台免费的AI服务器。


转发给那个还在为API账单发愁的朋友。 他只需要一个安卓手机,和这篇教程。

下载App⏬

https://meta.alicdn.com/data/mnn/apks/mnn_chat_0_8_3.apk

https://play.google.com/store/apps/details?id=com.alibaba.mnnllm.android.release

https://1816337022.share.123pan.cn/123pan/Y4kqVv-EIyqv?pwd=CXNK#


彩蛋:让小爱同学也用上它

如果你家里还有一台吃灰的小爱音箱—— 还记得那篇《小爱同学,是时候给你换个脑子了》吗? 那个 XiaoAi-LLM-Router,一直在云端模型上跑着。

现在,给它换个供能方式。

把 MNN Chat 的 API 服务开着, 在 Router 的配置里,把模型指向 http://你的手机IP:PORT/v1

小爱收音 → Router 路由 → 你手机里的本地模型思考 → TTS 播回。

云端一个token都不用走。 断网了?小爱照样能答。

两台旧设备,一台安卓手机,串成一条完全离线的AI回路。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
1
扫一下,分享更方便,购买更轻松