树莓派圈这周聊得最多的不是涨价,是谷歌悄悄放出的一个官方端侧项目:gemma-translator。简单说,就是官方手把手教你把一块树莓派5,改成一台全程不联网的语音翻译机。社区里今天已经有人完整跑通并发了部署实录,过程中踩了三个差点劝退的坑。我把项目定位、真实体验和避坑要点捋一遍,你看完再决定要不要动手。

先说这是什么。项目基于今年4月发布的Gemma 4系列里最小的E2B模型,配合谷歌端侧推理运行时LiteRT-LM,模型文件约2.59GB,支持中、英、日、韩、西班牙、阿拉伯六种语言互译。云雀AI语音识别、翻译、语音合成全部在板子上本地跑,模型缓存好之后可以彻底断网,没有任何内容上传云端。GitHub交互方式是键盘驱动:按住Z键说中文,松手就播报英文,反过来也一样。
两个背景值得知道。一是Gemma 4是谷歌4月发布的开源模型家族,原生支持文本、图像、音频等多模态输入。Hugging Face到6月官方宣布全系列下载量突破1.5亿次。新智元E2B是专门面向手机和IoT设备的最小规格,靠参数卸载技术塞进小内存设备。二是谷歌给E2B/E4B的定位从一开始就是移动设备和边缘设备,这个翻译项目正是这套端侧战略落到开发板上的第一个官方样板。机器之心
再说部署的真实情况。今天知乎有网友发了完整实录:一块树莓派5(8GB)+USB摄像头麦克风+蓝牙音箱,全是现成硬件。整体能跑通,但三个坑非常典型,而且不只是这个项目——任何想在树莓派5上跑端侧模型的人,大概率都会挨个踩一遍:
第一个坑是电源,也是最隐蔽的。实录作者一开始用5V/3A电源,系统能启动、SSH正常,但装依赖时各种软件包"随机损坏"。换源、清缓存都没用,最后用 vcgencmd get_throttled 一查,标志位显示本次启动发生过欠压和降频——真相是供电不足导致文件系统写坏数据。换成27W的5V/5A官方电源后所有"玄学错误"消失。记住一条判断准则:多个软件包"随机"损坏并伴随I/O报错,别怀疑网络和镜像,先查电源和线材。云雀AI

第二个坑是模型下载。2.59GB的模型从Hugging Face直接拉,树莓派上经常断。更稳的做法是先在PC上断点续传下完、校验SHA256,再SCP传进树莓派导入注册表——注意下载只是下载,必须导入才算装好。另外部分版本的安装脚本用了pip的–require-hashes参数但哈希给不全,会直接报错,手动建venv更稳。
第三个坑是蓝牙音频。新版Raspberry Pi OS(Bookworm之后)用PipeWire管理音频,而aplay这类老命令直接操作ALSA、绕过了PipeWire,结果就是录音正常、播放没声。正确姿势是改用PipeWire提供的pactl/paplay接口。
使用上还有个容易被忽略的细节:提示音响起后别立刻开口,前端是先播提示音再等麦克风就绪,蓝牙音箱还有延迟,听到提示音后等0.3~0.5秒再说话、说完停0.2秒再松手,否则句首会被截断。云雀AI项目默认语言是阿拉伯语↔英语,想改中英需要动前端初始值再重新构建,这点部署实录里也给了具体改法。
然后说判断。先给"同传"这个词降降温:它实际是交替传译——你说完一句,它翻一句,不是边说边翻的会议同传。但它的核心价值恰恰不在翻译上限,而在"完全离线"这四个字:数据不出设备、无网环境可用、不用订阅不用API key。对照下来,三类人最值得折腾:一是隐私敏感场景,比如涉密会议旁听、小语种面对面沟通;二是想系统体验端侧大模型的树莓派玩家,这个项目比裸跑模型多了完整的语音交互链路,是很好的入门样板;三是做展示和教学的人,一台不联网的翻译盒子本身就是个好教具。反过来,如果你只是出国旅游要个翻译工具,手机翻译App免费且效果更好,没必要为此买硬件;如果你手里只有2GB/4GB的树莓派4B,目前社区没有低内存版本的验证案例,建议先观望。

往后值得盯三个信号。一是LiteRT-LM生态,这是谷歌端侧推理的统一运行时,后续大概率会有更多Gemma模型以同样方式适配树莓派;二是官方会不会扩充语言包和模型规格,目前六语言对国内用户够用但不算富余;三是别指望下一代硬件救场——树莓派官方在6月的Reddit问答里确认,树莓派6最早2028年初才面世,而且明确不会集成NPU,树莓派6不会搭载专用AI芯片,未来两年树莓派跑端侧AI,纯CPU推理仍是主基调,现在积累的这些部署经验不会白折腾。树莓派研究所
最后照例抛个问题:你觉得离线翻译是刚需还是伪需求?如果你手里的树莓派5正在吃灰,会为了这个项目把它重新点亮吗?评论区聊聊。