这块板子插在Raspberry Pi 5的PCIe口上,板上是Hailo-10H,官方标称最高40 TOPS INT4、自带8GB专用LPDDR4X,售价130美元——树莓派官方配件里"纸面算力"的天花板。知乎
CNX Software拿它和Pi 5的CPU对跑了四个小语言模型,结果这两天在中文社区重新传开,场面不太体面:
模型 | Pi 5 CPU | AI HAT+ 2 |
|---|---|---|
DeepSeek-R1 1.5B | 9.04 | 6.72 |
Qwen2.5 Instruct 1.5B | 11.73 | 6.74 |
Qwen2.5 Coder 1.5B | 10.26 | 8.06 |
Llama 3.2 3B | 4.78 | 2.60 |
(单位tokens/s,数据来自CNX Software。)
四行里CPU全赢,差距从27%一路拉到84%,而且模型越小输得越多——参数量小的时候,算力本来就不是瓶颈。知乎
给出更重结论的是横向对比:绝大多数树莓派项目并不需要AI外设,16GB内存版的Pi 5自己就能完成大部分基础AI任务。知乎
对这块板子8GB板载内存的判断也很直接:依旧不足,16GB版Pi 5本地跑大模型反而比它快,Jeff Geerling给出的结论就是不推荐拿它跑大语言模型。知乎
这场讨论也不是圈内自嗨。9月20日B站那期AI开发板全价位横评——官方简介写的是"从十几块的离线语音裸板,到上千块的高阶算力怪物"——不到900次播放挂出169条评论,评论区有人直接问"新手第一块板子到底是选ESP32还是树莓派?我预算400,想做智能家居的中控",从50块语音点灯到1000块人脸识别门禁,报出来的预算刚好覆盖入门边缘AI的全部姿势。哔哩哔哩
先说清楚,这篇不是劝退稿。真正的问题有两个:40 TOPS怎么会输给"插在自己上面的主机";以及130美元到底给谁花是值的。Pi 5现在什么行情大家都清楚,主板价格把配件的决策成本一起顶高了,这钱花错比花多更难受。
TOPS到tokens/s,中间隔着五道关
产品页那句"最高40 TOPS INT4"里,三个限定词每个都比数字重要:INT4是量化精度,换成INT8就不是这个数;"最高"对应特定算子加理想数据供给;TOPS只描述并行矩阵运算的理论吞吐。从峰值算力到你看到的输出速度,中间还要过内存带宽、KV Cache、算子支持、编译器运行时、PCIe协同这五道关,而只有第一道写在产品页上。知乎
断得最狠的是第二道关。文本生成分两段:读提示词的prefill是并行矩阵运算,专用硬件在这段确实占便宜;往外逐字吐的decode段,每生成一个字都要把权重和KV Cache重读一遍——1.5B参数在INT4下光权重就约0.75GB,3B约1.5GB、7B约3.5GB,每字搬一遍,瓶颈立刻从算力转到带宽。知乎
Eben Upton自己也说过,Pi 5和Hailo-10H用的是同一等级的内存子系统(LPDDR4X-4267),带宽量级接近,多出来的算力就很难换成速度。 这句得留个边界:同等级只说明量级接近,不等于两边有效带宽完全一样。知乎
后面三道关才是真正劝退的地方:
模型不是想跑就能跑。 普通GGUF不能直接拿来用,得经过Hailo Dataflow Compiler量化打包成HEF;Hailo-8的HEF和Hailo-10H的还互不通用,能跑哪些由官方已编译清单说了算。知乎
版本矩阵会卡人。 Hailo社区有帖子记录:HailoRT 5.4.0和hailo-apps安装脚本校验冲突,需要5.3.0的模型就卡着装不上;Hailo-10H的调度跟踪文件一直是0字节,官方称5.5.0才修。这些是社区个案,不代表你必中,但它们都指向同一件事:部署难点不在装硬件,在模型转换和版本对齐。知乎
PCIe口是被占用的。 插了AI HAT+ 2,NVMe通常就没法直插,要额外扩展方案。知乎
但它真不是废物:账要两头看
只看tokens/s,这块板子会被骂惨;看另外几个数就是另一回事。同一批测试里,系统功耗从Pi 5纯CPU的10.2~10.6W,降到挂板后的7.2~7.6W——不过原文特意提醒:那是特定模型和软件组合下的结果,不是所有模型的通用承诺。知乎
它真正的主场是把算力从主板上搬走:模型和大部分推理放在板载8GB上,Pi的CPU和内存空出来干采集、网络、界面这些正事,测试里主机用2GB内存就能跑完。知乎
Geerling测YOLO这类视觉模型时约30fps、CPU占用明显下降——摄像头先拍、视觉模型提取信息、语言模型再生成描述,这个组合比拿它跑文本对话值回票价得多。知乎
视觉生态也在朝它靠拢:2026年1月14日Ultralytics正式发布YOLO26,9月13日聚焦计算机视觉的YOLO Vision 2026大会刚在深圳落地。 按评测那边的说法,树莓派5加YOLO26可以快速打造智能摄像头、机器人视觉系统和自动化设备——边缘视觉恰恰是这类NPU配件在生态位上真正互补的方向。知乎知乎
四个场景对号入座,买前先问五句
场景一:摄像头+VLM、多路传感器、要低功耗常开——值得考虑,但先确认你要用的模型在不在支持清单里。 对比那篇点名的真正合适场景就两类:模型复杂度超出AI摄像头NPU内存上限的高算力检测/姿态估计,以及多路IP摄像头、红外热成像这类多传感器输入。知乎知乎
场景二:只想让文本大模型更快——先别买。 公开测试里,小模型速度低于CPU。知乎
场景三:想跑任意GGUF或Hugging Face模型——谨慎。 你的模型得在官方已编译范围内,不在清单上的只能自己啃转换工具链。
场景四:冲着"40 TOPS≈30路视频流"去的——不能只看标称值。 端到端还要算解码、缩放、预处理、PCIe传输和后处理,先实测再下单。知乎
再加一张"买前五问"清单,下次看到任何一块标几百TOPS的板子都通用:最高算力是INT4还是INT8、换个精度还剩多少;板载内存是独立推理内存还是共享主机RAM、KV Cache怎么算;支持哪些已编译模型、我要的在不在里面;预处理后处理算在哪一侧、主机还要出多少力;低功耗是哪套软件哪个模式下的功耗。知乎
还有一个更便宜的岔路口
如果需求只是图像类AI——目标检测、姿态估计这一档——AI摄像头(IMX500)把推理整个封在摄像头里,主板只收结果:哪怕搭配性能很低的树莓派Zero,也能获得远超"Pi 5+普通摄像头"的处理速度;代价是模型大小和复杂度必须适配摄像头内NPU的资源上限,官方imx500models包预置了分类、检测、分割、姿态的开箱模型。知乎
初代13/26 TOPS的AI HAT+是另一回事:没有板载内存、芯片本来就是给计算机视觉设计的,强行跑LLM会被PCIe瓶颈按住、速度反而变慢。知乎
至于老版AI套件,它就是AI HAT+的前代、现已停产,硬件算力等同13 TOPS版——手上有的接着用,没有的不必再找。知乎
把这周几篇中文讨论摆到一张桌上,收敛出的优先级其实很反直觉:先确认任务是不是Pi 5本身干不了的(16GB版本就是那个"不用买配件"的兜底答案),再考虑视觉专用的AI摄像头,最后才轮到AI HAT+ 2。对大多数普通用户,那位博主的话是"不建议购买任何AI加速外设"——三个配件对应的是三种完全不同的负载,而不是同一条性能阶梯上的三档。知乎
接下来盯什么
决定这块板子口碑会不会翻案的三件事:HailoRT 5.5.0有没有兑现0字节修复、官方已编译模型清单扩得多快、YOLO26和树莓派的适配还在不在加密。至于它现在值不值——文本快跑党不买,视觉常开党先查清单,多路传感器党它在官方生态里仍是顺手的答案。
买之前你问的是参数还是清单?到手后有没有卡在模型转换这一关?评论区聊聊你的那本账。