把吃灰的树莓派改造成一台不上云的小脑子,是这波玩家最忙的玩法:有人拿树莓派5接了块LCD屏,把直播风景做成了会自动更新的"电子画框"。微博 谷歌那边也有动作:一个小团队做了一台完全离线的语音翻译机,在8GB的树莓派5上跑Gemma 4端侧模型,实测帖八月份起在国内圈子里刷屏。微博 但动手前先泼盆冷水:"几十亿参数跑树莓派"确有其事,只是和标题让你以为的不是一回事。先把真实能力谱看懂,再决定升级钱怎么花。

一、全网实测拼出来的三档能力谱
第一档,官方"幼儿级"。知乎用户云雀AI把这个项目完整复现了一遍:不联网的中英双向语音翻译,模型本体约2.59GB,支持中英阿西日韩六种语言。知乎 这条内容所在的知乎问题下浏览量有318万——大家要的从来不是聊天机器人,是一台不把家里说话传出去的设备。
第二档,日常够用的4B上下。国外博主的复测很直观:选的模型文件大概4.5GB,跑的时候CPU基本跑满,一个任务从头到尾花6分钟。知乎 知乎账号"树莓派研究所"做了个厨房语音助手,一圈试下来锁定gemma4:e2b——混合专家架构,比纯2B模型聪明,速度基本持平。知乎
也有没人愿意说的尴尬。Qwen3、DeepSeek-R1这类模型的深度思考模式加了参数也关不干净,在端侧纯属白烧算力。知乎 另一位玩家的SD卡实测,天花板停在3.5B,卡慢到让他专门下单了NVMe转接。知乎
第三档,“巨型"MoE极限模式。今年1月,ByteShape团队用逐张量混合量化把Qwen3-30B-A3B塞进了16GB内存的树莓派5:每秒8.03个token,平均2.70比特每权重,保留BF16基准质量的94.18%。微博 板子能装下三百亿参数,靠的是名字里那个"A3B”:总参数大,每个token实际激活的只有三十亿上下。回头再看4月份那篇"谷歌Gemma 4开源,31B参数树莓派能跑",拿了298个赞、234次收藏。小红书 标题没撒谎,但藏了最要紧的信息:官方端侧档是E2B和E4B,能把30B级塞进板子的,是第三方极限量化,不是官方默认体验。

二、瓶颈不是CPU,是内存带宽
三档看完,一句话总结:本地推理的墙是内存带宽,不是核心数。9月刚出的跨设备实测,从MacBook M4、Jetson Orin Nano一路测到树莓派5、Zero 2W甚至ESP32-S3,核心结论就是内存带宽决定模型跑得动多快。哔哩哔哩 树莓派5那四颗A76在这局里根本不是瓶颈,它们的活是把权重从内存一点点搬进寄存器。所以选模型别问"板子算力够不够",要问"装装得下、带宽喂不喂得动"。
反直觉的还有一处:比特数越少不等于越快,量化格式会触发不同计算内核,4比特附近存在"黄金区间",继续往下压反而可能更慢。微博 8 token/秒是拿内存预算换来的速度,不是把参数压扁白捡的。
三、升级钱按这个顺序花:电源、NVMe、散热、16GB
这是全网翻车帖归纳出来的顺序,一次都没乱过。
一,电源打头。云雀AI的复现差点折在这:多个软件包随机损坏、伴随I/O错误,换源清缓存全没用,真凶是5V/3A的电源——USB外设一多电压抖动,文件系统直接写坏数据;换官方27W(5V/5A)后get_throttled回到0x0,玄学错误全消。知乎 记一条准则:多包随机损坏又见I/O错误,别怀疑网络和镜像,先查电源和线材。

二,NVMe其次。模型文件动辄几GB,SD卡读取速度是实测帖里被吐槽最多的一环。
三,散热要紧但别拜教。持续推理四核满载,官方标配风冷照样降频,换52Pi冰塔就能解决,水冷排在它后面。知乎
四,16GB最后、但一买定音。单跑一个大模型不并行部署,8GB完全够用;16GB的意义一是模型常驻、省掉约70秒冷加载,二是想玩30B量化档的门票。知乎 别忘了价格环境:4GB版新板都卖到1067元,有玩家4月干脆把树莓派5同价换成了12GB的Radxa Q6A。微博小红书 为一次档位实验换整板,成本比你想的高。
四、花钱之前,软件层还有免费的
Ollama换成llama.cpp服务端,吞吐先提10%到20%;开cache_prompt复用KV缓存,同会话后续提问首字耗时从70秒压到5秒以内,整体吞吐再涨16%。知乎 语音识别嫌base.en三到六秒出字慢,换tiny.en速度直接翻倍;TTS用Piper逐句流式播报,第一句生成完立刻开口。蓝牙音箱不出声的也记一笔:新系统音频归PipeWire管,aplay绕过它找不到设备,换pactl/paplay。知乎
为什么现在折腾本地也多了层"确定性"的理由:Ollama Cloud八月底改版订阅,按token透明计价,Pro月付20美元含60美元用量;再往前,一条"为什么你应该放弃Ollama"的视频攒下25万播放。哔哩哔哩哔哩哔哩
而且很多人要本地agent,图的是板子能直接上手碰物理世界:有玩家把OpenClaw部署在树莓派5上,通电之后下条指令,板子自动生成程序、拨着舵机演奏了一段《沧海一声笑》。微博

五、谁该上手、谁别碰、接下来盯什么
适合两类人。一类是手头有8GB Pi 5、想要离线翻译和家庭语音助手、又不愿把家里说话交给云端的:官方项目代码和可打印外壳都开源了,跟着步骤一个下午能出结果,电源记得一步到位上27W。小红书 二类是把Pi当7×24家庭AI端点的:创客社区这个月刚分享过一台树莓派5桌面服务器的完整搭建。微博
不适合的也是两类。只有Pi 4、想为跑模型换板的——这一批实测帖里没有Pi 4的成绩单,别当探路者;想彻底替代云API的——别跟天花板较劲,那个CPU满载跑了6分钟的任务,不是硬件慢,是能力就到这。
三个值得持续盯的信号:LiteRT-LM这条官方端侧推理路线刚支持Gemma 4、号称一条命令上树莓派,会不会扩展到更大档位;gemma-translator这样的官方项目会不会成系列地出;以及换了国产大内存板的用户,配件生态补到哪了(那块Q6A的UPS,玩家等了小半年)。小红书 三个同时亮起,家庭大模型端点的窗口期才算真到。
树莓派5跑本地大模型的能力谱一句话收口:8GB日常够用,16GB碰天花板;先买电源、别省固态;看到"31B",先找旁边那个"A3B"再兴奋。