今天刷到一条让人心情复杂的视频:一个叫 CarWatch 的开源项目,用一块 300 欧元的树莓派 5,在车里本地跑起了 350 亿参数的千问大模型。完全离线,车像聊天室成员一样跟你对话、汇报车况,你问随车说明书里的内容,它带着页码引用回答你,说明书没写的直接拒答。哔哩哔哩听起来很美好,但官方 README 里标称的生成速度是:每秒 3.5 个 token。翻译一下——它每秒只能蹦出三个字半。问它一个问题,你得盯着屏幕看它一个字一个字往外挤。这个项目今天刚被搬运到 B 站,目前 GitHub 上 250 个 star,视频评论区还很安静,但我觉得它特别有代表性:2026 年"树莓派跑本地大模型"这波热潮的真实水位,就藏在这 3.5 个 token 里。
从今年 4 月开始,"树莓派 5 跑 Gemma 4,惊人可用"这类视频在 B 站一波接一波,播放量动辄大几千;知乎上"树莓派能跑多大的模型"这类问题也隔三差五冒出来。叠加树莓派这一路涨价,很多人心里都在打鼓:本地 AI 都火成这样了,我要不要趁现在买块板子、加钱上 16GB,也搞一套自己的离线 AI?
先说我的结论,怕你等太久:树莓派确实能跑大模型,但"能跑"和"能用"是两码事。它只适合三类人,其余的,钱可以省下来。
下面这份账本,是我把 B 站、知乎、YouTube 上能找到的实测数据全部翻了一遍之后整理的,每个数字都有出处。
一、全网实测摆在一张桌上,先看清楚"真实水位"
第一档:35B 大模型——能跑,是行为艺术。
CarWatch 就是典型:千问 35B,每秒 3.5 个 token,长时间运行稳定在 65 度。作者自己也承认"它不快,赢在离线、诚实、不被厂商云锁死"。这个尺寸在树莓派上属于"跑起来了"的里程碑,不属于"日常用"的范畴。
第二档:4B 左右的小模型——真正可用的甜点位,但要以分钟为单位。
这是目前实测最集中的区间。谷歌最小的 Gemma 4 E2B 模型,大约 40 亿参数、4.5GB 大小,在 8GB 内存的树莓派 5 上:
海外开发者 Zero to MVP 的实测(B 站搬运播放量 9000+):无桌面环境、纯 SSH 跑,给出一个详细回答大约要 5 分钟,他的原话是"慢,但内容清晰可读,适合非交互的自动化任务"。哔哩哔哩
知乎有博主复测了同一个模型:跑一次写代码/写文章任务花了 6 分钟,CPU 全程跑满,结论是"质量还不错,但基本还是极客行为";
谷歌官方甚至给树莓派专门做了一个叫 gemma-translator 的离线翻译机项目,模型 2.59GB,中英日韩西阿六种语言全程本地跑。知乎一位用户完整复现后写了篇长文,结论是:翻译机本身好用,最大的坑竟然是电源线——这个后面细说。
第三档:8GB 内存上跑 8 款模型的系统性横评,结论很扎心。
Blackdevice 团队用 8GB 内存的树莓派 CM5 加 NVMe 固态,统一提示词测了 8 款轻量模型:所有模型都能启动,但 Gemma3 系列的速度和效率远超其他选手;7B 及以上的模型"能启动,但等待成本过高,实用性勉强及格";而 DeepSeek R1 这类推理模型在小机器上会陷入大量无意义的循环推理,“等待时间完全无法接受”。知乎一句话:在树莓派上,模型不是越大越好,是越小越清醒。
第四档:内存容量之争——16GB 的钱,大概率白花。
这可能是对钱包最重要的一组数据。有博主用同一颗 DeepSeek R1 1.5B 模型,在 4GB、8GB、16GB 三个版本的树莓派 5 上做了严格对照测试(相同参数种子),结果:
模型实际内存占用稳定在 1.85GB 左右,多出来的内存根本没被用上;
不是内存越大越快,同一测试在不同机器上时间差最多能到 3 倍,瓶颈根本不在内存;
真正的杀手是散热:某款封闭机箱在 AI 负载下飙到 81 度,直接触发降频。
所以"加钱上 16GB 跑 AI 更爽"这个直觉,在 8GB 以下的模型场景里基本不成立。哔哩哔哩
另一个平行宇宙:视觉类 AI 走的是 NPU 路线,和跑大模型完全是两回事。
树莓派 5 加 Hailo 算力卡(就是官方 AI Kit 那条线),YOLO 目标检测能刷到 100fps;今年 6 月 M5Stack 还出了 LLM-8850 Kit,AX8850 芯片 24 TOPS 算力,号称 Qwen3、Llama3.2、Whisper 一键跑。如果你的目标是摄像头识别、语音唤醒这类任务,买 NPU 加速卡比给 CPU 加内存有效得多。
二、为什么会是这个水位?三个很多人没想明白的点
第一,树莓派跑大模型是纯 CPU 推理,没有 GPU 也没有 NPU 帮忙。 BCM2712 四核 A76 听着不错,但大模型推理拼的是内存带宽和矩阵运算,这正是它的短板。所以 token 速度有硬上限,35B 模型的 3.5 token/s 和 4B 模型的"5 分钟一答",都是这个物理规律的不同表现。
第二,真正卡脖子的往往不是算力,是供电和散热。 前面提到那位复现离线翻译机的知乎用户,一开始用 5V/3A 的电源,系统能启动、能 SSH,看起来一切正常,结果装依赖时各种"随机损坏",换源、清缓存都救不回来,最后用 vcgencmd get_throttled 一查——欠压加降频标志全亮。换成官方 27W(5V/5A)电源后,所有玄学问题消失。知乎他总结的判断准则值得抄下来:如果多个软件包"随机"损坏伴随 I/O 错误,别怀疑网络,先查电源。 跑 AI 是树莓派负载最重的场景之一,电源、散热风扇、主动散热壳,一样都不能省。
第三,树莓派本地 AI 的价值从来不是"替代 ChatGPT",而是三个字:进设备。 CarWatch 装进车里、翻译机断网能用、语音助手塞进音箱——离线、隐私、不依赖云端、永远不会被停服。如果你想要的是"随时随地问一下"的聊天体验,云端 API 或者手机上的端侧模型都比树莓派强得多;但如果你想要一个"长在某台设备里的、永远离线的 AI",树莓派几乎是唯一的平民方案。
三、那么钱该怎么花?按情况对号入座
情况一:你手里已经有树莓派 5(4G/8G)。
恭喜你,不用花冤枉钱。直接装 Ollama 或 LM Studio,拉一个 Gemma 4 E2B 或 Qwen3 的小尺寸量化版就能开玩。建议花小钱办三件事:一块 NVMe SSD(HAT 转接板加固态,模型加载速度差别巨大,知乎有实测 SSD 比 SD 卡快 10 倍的报告)、一个主动散热器、确认电源是 5V/5A 的 27W 官方电源。总花费两三百块以内。
情况二:你没有板子,想为本地 AI 专门买一块。
8GB 版本就是甜点位——上面那些实测全部基于 8GB,1.85GB 的模型占用也说明小模型根本吃不满。至于 16GB 版本,你需要知道它的价格走势。它 2025 年 6 月首发定价 120 美元,而今年 6 月已有嵌入式领域自媒体报道,树莓派 5 系列的价格区间最高已经标到 305 美元(16GB 版)。知乎知名博主 Jeff Geerling 更是直接出了期视频分析"16GB 树莓派 5 为什么不是好买卖"。哔哩哔哩叠加内存涨价带来的官方多轮调价,现在高位接 16GB 跑小模型,属于花了两倍多的钱买一个实测用不上的内存。除非你明确要跑 7B 以上模型(并且接受"能用但很慢"),否则不建议。
另外提醒一句:别只看裸板价。树莓派这一轮涨价传导到国内渠道,8 月底连打着"限时好价"标签的树莓派 5 8G 单板,券后价都已经要 1769 元。买之前多看几家,国补、预售、套装赠品都要算进去。
情况三:你想要的是 AI 干活,不是折腾本身。
说实话,这个需求树莓派满足不了。日常高频使用大模型,订阅云端服务或者用带核显的迷你主机(内存带宽和 CPU 性能都不在一个量级)性价比高得多。树莓派的正确打开方式是:做一个 24 小时在线的家庭语音网关、离线翻译机、车载助手、摄像头后端——一次部署,长期无人值守。
情况四:你的目标是视觉识别。
跳过内存焦虑,直接看 NPU 方案:官方 AI Kit(Hailo-8L)或第三方加速卡,搭配树莓派 5 做目标检测、垃圾分类、人脸门禁,这条线的性价比是树莓派 AI 玩法里最能打的。
四、接下来值得盯的三个信号
内存价格走势。 树莓派这一轮涨价的根源是 DRAM 和闪存成本暴涨(官方财报里专门提到靠供应商多元化和改用非 DDR4 内存来对冲)。内存不降价,树莓派就很难降价,16GB 这类高配版本会继续是重灾区。今天微博上还在有人吐槽"什么东西都在涨价,树莓派也越来越贵了"。微博
树莓派 6 的动向。 知乎上已经有人开始按历代节奏(3 到 4 年一代)预言 Pi 6。知乎有意思的是,有人评论说自己以为 6 快出了把 5 卖了,结果卖早了。哔哩哔哩在涨价周期里,手里的板子反而在升值。要不要等,想清楚。
官方在中国市场的动作。 树莓派 2025 财年中国区销量增长了 62%。知乎今天小红书上名为 RaspberryPi 的品牌账号刚刚完成认证、宣布入驻。小红书上周的 IOTE 深圳物联网展上,树莓派首席商务官也在谈中国市场的长期战略和边缘 AI 布局。哔哩哔哩官方渠道如果进一步铺开,国内买板子的价格和售后也许会慢慢正常一些。
最后
回到开头那个每秒 3.5 个 token 的车载 AI。它不快,但它代表了一个很实在的方向:AI 不必永远住在云端,一块几百块的板子也能拥有一个完全属于自己的、断网也能活的脑子。
只是这份"拥有"是有价码的:你要接受以分钟为单位的等待,要伺候好供电和散热,还要在涨价的行情里精打细算。想明白这三件事再下单,树莓派的本地 AI 就值得玩;想不明白,它大概率会变成又一块吃灰的板子。
你手里的树莓派跑过什么模型?最快多少 token 每秒?评论区聊聊,我看看谁的水位最高。