前几年的旧物改造,顶流是"iPad改成电子相框"“旧手机当监控摄像头”。但今年入夏以来,折腾圈的目标突然统一了:把闲置设备变成"自己的AI"。
9月10日,B站UP主"青青王-AI"发了条视频:吃灰的旧安卓手机本地跑大模型、对外提供OpenAI兼容接口,电脑可以局域网调用手机里的AI。哔哩哔哩
这条内容B站26个赞、76个收藏;同一内容的小红书版本是74赞、197收藏。 收藏率远大于点赞率——这是折腾圈识别"值得蹲"素材的暗号:先收藏,周末就动手。 评论区也如期吵起来了:嫌的那句是"最大只能跑3B,没意思"“tps不得低完了吗”,护的那句回得也直接——跑小模型,慢慢跑就完了。小红书哔哩哔哩
谁对?我把近两个月B站、知乎、小红书上散落的实测数据拉到一起对齐了一遍。这波热潮比标题党们讲的要清楚得多——但也比"无脑冲"党讲的要多一层门槛。
一、闲置设备只有三个岗位,摆错必翻车
把所有案例归拢,旧设备在"私有AI"里其实只干三种活:
算力岗:真的跑模型推理。
仓库岗:不跑模型,但存模型。
展示岗:一行代码不写,只当云端AI的专用终端。
先把真实的实测数据摆成一张分层表:
设备档位 | 真实能跑什么 | 实测速度/占用 | 岗位 |
|---|---|---|---|
旧安卓手机(12GB内存+近三代旗舰SoC) | Gemma4-E4B(端侧多模态,QAT量化后文件3.96GB、运行时约4.5GB内存) | 小米17 Pro实测:LocalAI约7.6 token/s、Off Grid CPU约10.1 token/s | 玩具/测试岗 |
骁龙8 Elite级新旗舰或M5 Pro设备 | LFM2.5这类2.6B小模型(8层Attention+22层门控短卷积,消掉KV Cache瓶颈,仅占2.5GB内存) | CPU推理30-220 token/s(海外CloudCodes基准) | 端侧正经岗 |
12GB显存独显/大内存老PC | 35B级MoE(总参35B、激活仅3B),Q4量化 | 知乎百万阅读实测口径:输入700+ token/s、输出30+ token/s | 干活岗入门 |
128GB统一内存小主机(Strix Halo级) | Qwen3.8级别模型多引擎横评 | 32K上下文下Prefill 752 token/s、生成约41 token/s | 干活岗 |
16GB内存的Mac+一块大固态 | slotstream流式加载125B MoE(4-bit后105GB,主干仅3.8GB常驻,专家权重从SSD按需流入),兼容Ollama/OpenAI接口 | 官方README"诚实得少见"(B站锋芒AI转述) | 惊喜岗 |
这张表里最反直觉的一行是最后一行:跑125B模型的,是16GB内存的Mac——前提是MoE架构+固态流式加载,两样缺一不可。 而最容易被短视频藏起来的一行是第一行:旧手机的正常水平,就是10 token/s上下,这是端侧模型Gemma4-E4B在小米17 Pro上跑出的实测区间。 更细的分化来自架构:2.6B级、靠门控短卷积消掉KV Cache瓶颈的新端侧模型,在骁龙8 Elite、M5 Pro这级CPU上已经能到30-220 token/s。 写文档嫌慢、看长文嫌卡,回消息、试脚本、当局域网备用端点,刚好。哔哩哔哩哔哩哔哩哔哩哔哩
二、"旧固态=宝藏"的说法,半真半假
9月12日,小红书在传"旧电脑别扔,抠出硬盘秒变私人AI服务器":7B、13B、35B"全部保存在固态里",“普通电脑+旧固态"就能"永久免费AI自由”。小红书
这个说法的假一半:SSD是加载池,不是算力。 按Q4量化"每1B参数约0.6GB"的粗算公式,35B稠密模型光权重就要21GB上下——内存显存不到位,硬盘读上天也跑不动。"35B塞进固态=能跑"是典型的偷换概念。 真的一半在于:MoE+流式加载时代,闲置NVMe确实有了新编制。除了上面16GB内存Mac跑125B的例子,海外玩家用4张V100配NVFP4量化加SSD流式传输,把180B级模型推到了60 TPS。 旧固态的正确身份是模型仓库:装十几个量化版本随取随换,但得配一台内存/显存够格、且支持流式加载的主机。知乎哔哩哔哩
三、这笔账怎么算:先对四个理由,再谈钱
那条万字指南给"要不要本地跑AI"列的理由很实在:隐私——病历、合同、代码这类敏感内容送进云端就是送出去;离线——断网能用、不限流;成本——如果一个云端API每月固定消耗你几十上百块,本地一套设备两三年摊销未必更贵;可玩——模型随便换、参数随便调、接自己的脚本和知识库。它的结论毫不客气:"如果四条里一条都不占,关掉这篇,省下至少五千块钱。"轻度尝鲜用户请老老实实用API。 同一个口径,也适用于被"AI主机刚需"话术推着走的下单冲动:铭凡这类本地AI小主机已经卖到2k-1w全价位段、单条测评8.6万播放,但那是给占了两条以上理由的人准备的。知乎哔哩哔哩
至于电费,给个透明算法:假设按5W级推理功耗估,24小时连轴一天约0.12度电,一个月不到3度、两三块钱——手机档的电费基本可以忽略不计。旧设备折腾的真实成本从来不是电,是你的时间、踩坑的次数,和下面这个安全问题。
四、五个坑,全部来自社区血泪
鼓包电池别硬撑着上班。 小红书能翻出一串真实案例:收拾储物柜发现iPhone 4电池鼓到顶开手机壳(87赞140评的帖子,标题就叫"旧手机要定期看一看啊"),也有"放置很久会不会爆炸"的常年求助。 手机服务器的标准姿势要么软件限充——模拟健康使用,低于20%自动开始充电、高于80%停;要么拆电池直供电。 让一块十年电池常年插电满载,不是折腾,是养雷。小红书小红书
速度瓶颈在内存带宽,不在容量。 那条指南给的买卡优先级是"带宽排第一,显存容量排第二,算力第三",和打游戏选卡正好相反。 另一个高频事故是KV Cache随上下文线性增长,8B模型拉到32k上下文可能吃掉4-8GB,新手把上下文参数拉满导致的"明明够显存怎么爆了",就是这么来的。知乎
“OpenAI兼容”≠即插即用。 评论区老哥总结得全:除了确认Base URL,还要留意局域网地址变化(手机一重连IP就漂移,记得设静态)、并发能力、上下文长度和长时间运行的散热;接客户端前,先测聊天、流式和工具调用三件事。哔哩哔哩
手机的NPU暂时指望不上。 主流GGUF手机应用仍以CPU推理为主,GPU/NPU专用方案还不能像电脑端一样通用加载模型——所以旧手机跑不出电脑端那种"秒回",这是生态阶段,不是你的手机太烂。哔哩哔哩
别为"永久"付钱。 本地部署有个真优点:权重文件完整躺在你的硬盘里,厂商停服也背刺不到你,“公司明天倒闭,硬盘里的模型一个字节都不会少”。 但模型月月新、硬件上限出厂即定格——12GB内存的手机,天花板就是4B级。把它当"当期玩具"而不是"永久基建",心态就对了。知乎
五、对号入座:你家闲置值多少乐子
抽屉里只有一台旧手机:花一个晚上,装Termux+Ollama或LocalAI,当局域网端点和玩具。400块的二手一加6T都有人跑通了完整Ubuntu加Ollama;但期望值管理在"能聊天、能写小脚本",别指望替代云端干活。哔哩哔哩
有台16GB内存的旧笔记本/小主机:这是性价比最高的档位。35B级MoE(激活仅3B那种)在12GB卡+大内存下输入能有700多token、输出30多token,已经是"能干活"的下限,接自己的文档库、当代码副驾都成立。知乎
有Kindle或老iPad:别装模型,直接当展示端——已经有人把吃灰Kindle刷成API额度监控屏,每天盯着OpenAI、Claude的用量,零算力门槛,纯纯白嫖焦虑管理。小红书
什么都没有、正想买入:先回答第三节那四个问题。一个都不占,云API真不贵;占了两条以上,再去看2k档小主机也不迟——大内存双通道/四通道方案,能把8GB小独显的机器也拉进MoE牌桌,CPU可以帮着算。
至于36氪那条"2000台旧手机集群能不能打过数据中心"(714赞)——当乐子看就好,那属于行为艺术,不是个人折腾的路线图。36氪
这波"AI再就业"的乐子是真实的:一台三年前退役的手机,每月两三块电费,变成一个永远在线、不查你余额的私有端点——这种投入产出比,才是折腾党该动手的理由。至于"闲置设备全面替代云API",那是没跑起来过一个模型的人在替你兴奋。摆对岗位,再折腾。
你家抽屉里躺的是哪一档?评论区报个配置,看看谁的旧设备最能打。