乍一看,MediaPipe 有点"过气"。现在满屏都是大模型和 Agent,说自己在做手势识别,好像还是三年前的事。但8月中旬发生的两件事,让这个框架值得重新评估。
第一件,是8月12日到13日在上海世博中心举办的2026 Google开发者大会。在「Google AI Edge 携手 Gemma,解锁端侧 AI 无限潜能」这场分享里,MediaPipe Tasks 和 Gemma、LiteRT 一起被当作端侧 AI 的重点技术介绍,现场还演示了 AI Edge Gallery 等应用。知乎端侧AI和智能体加持下的全栈开发,被参会者称为这届大会的两个绝对核心。第二件更实际:8月下旬,毕设开题季到了。近两周知乎、B站密集出现 MediaPipe 的毕设内容,我们干脆把近3个月各平台真正做出来的项目盘了一遍,今天说清楚:这个框架没有过气,但选题之前先看明白方向。
这个在 GitHub 上积累超过3.5万颗 Star 的项目,是目前设备端机器学习领域最成熟的框架之一。知乎它值不值得写进毕设,取决于你怎么选题。
一、MediaPipe 正在被做成什么
量最大的是"标准答辩型",最典型的三类:手势音乐控制、驾驶员疲劳检测、老人跌倒检测。B站一条题为《驾驶员疲劳检测和酒后驾驶警报系统!》的视频8月中旬拿到11万+播放,作者介绍这套系统"采用 Python、OpenCV 和 MediaPipe 构建",能检测微睡眠、分心和打哈欠,还专为树莓派、Jetson Nano 这类边缘设备设计。哔哩哔哩这类题目之所以被反复选,是因为链路清晰:人脸检测、状态判定、报警提醒,每一步都能讲出东西。为什么选 MediaPipe?一位做手势音乐控制毕设的知乎作者说得很直白:不用训模型、不用GPU,普通电脑就能跑,工作量和展示效果还完全能满足毕设要求。知乎

也有人把"识别+提醒"的思路推向实用场景。7月中旬有开发者给长期盯屏人群做了一个开源的工位健康助手,用 MediaPipe Face Landmarker 在浏览器本地统计眨眼次数,再配合 20-20-20 护眼法则控制休息节奏。知乎整个处理都在浏览器里完成,没有后端,也不上传摄像头画面。这类题目的亮点不在算法难度,而在"真的能用"。
硬件组合型则把识别结果接到实体设备上。8月下旬的「Arduino+MediaPipe手势控灯」教程,从零件清单、接线、烧录一路讲到串口协议,最终用五指判定控制灯板。知乎边缘设备上,还有人用树莓派配合云台相机实现实时人脸追踪,软件只需要 Python 和 MediaPipe 库,硬件就是一台边缘设备加云台套件。哔哩哔哩这一类完成度高一档,答辩现场有看得见的实物,但也意味着软件之外还要承担硬件调试的风险。
互动装置类看起来最炫:TouchDesigner+MediaPipe 动捕插件、UE5 手势交互实验、浏览器里"用手触碰光"的互动页面。小红书上的手势交互作品「TOUCH THE LIGHT」,只需要一台普通电脑摄像头就能在浏览器里实时呈现,"当手指成为控制器,光、影像与声"随之响应。小红书一个免费的 TouchDesigner 动捕插件介绍视频,也有90赞、148个收藏。要注意的是,这个方向的创作者多为数字媒体作者,做的是作品而不是毕设,借鉴之前先确认导师认不认。
最新出现的是体感游戏类。8月25日有知乎作者放出项目:用一颗普通 USB 摄像头识别人体姿态,把不同动作转化成键鼠映射,直接体感游玩燕云十六声、原神这类动作游戏。知乎项目附完整可执行代码和自定义键位教程,理论上换一套动作映射就能适配任何动作游戏。还有基于手势识别的3D射击小游戏、复刻"切水果"的体感玩法。这类演示效果最好,但也最容易被答辩老师评价"像玩具",算法和工程部分必须讲清楚。

二、选题前要明白的三个判断
第一,"太简单"恰恰是它的优势。MediaPipe 卖的不是模型深度,而是现成管线:人脸网格、手部关键点、人体姿态,几行代码就能拿到稳定的关键点输出,剩下的工作是把姿态关键点映射成你要的动作和判断逻辑。知乎毕设真正要打磨的是拿到关键点之后做什么:判定逻辑、系统设计、交互呈现。如果花在折腾模型训练上的时间超过做系统本身,就本末倒置了。

第二,MediaPipe 和 YOLO 是分工,不是替代。8月中旬有B站作者专门做了「YOLO、MediaPipe、BPU 谁更准」的三种视觉部署实测。哔哩哔哩简单的区分办法:要回答"画面里有什么物体",用 YOLO 这类检测模型;要理解"人的脸、手、身体的结构和动作",MediaPipe 的现成管线更稳也更轻。不少出彩的题目其实是两个一起上:一个负责检测定位,一个负责细粒度分析。
第三,写代码认准新的 Tasks 接口。老的 mediapipe.solutions 接口已经不被官方推荐,新教程都基于 Tasks 编写,8月23日的 Arduino 教程就明确写着"版本下限是按能跑MediaPipeTasks写的"。知乎找教程时先看它用的是哪套接口,新旧混用只会给自己找莫名其妙的报错。Google 在开发者大会的官方议程里也写明了端侧运行的优势:数据隐私、降低延迟、离线使用,这三点正是 MediaPipe 类项目答辩时最拿得出手的价值点。知乎
三、按自己的情况选题
时间紧、基础一般:选标准答辩型,手势控制、疲劳检测、跌倒检测都可以。参考资料最多,风险最可控,把判定逻辑和系统完整性做扎实就是好毕设。
手头有硬件、会焊接:硬件组合型值得做,答辩现场的实物演示天然加分,但要提前给硬件调试留出一周以上的时间。
想出彩、导师开放:考虑体感游戏类或互动装置类,一定先录好演示视频备份,现场光线和背景都不受控。
目标是考研复试或简历加分:在以上任何一类基础上,补上对比实验和量化指标——准确率、帧率、误报率,这些是答辩老师最爱追问的内容。
常见的坑就三个:一上来就在开题报告里写"自训练模型",后来训不出来收不了场;只在宿舍灯光下把效果调好,换个环境就全线崩溃;没录演示备份视频,答辩当天摄像头或电脑出故障直接卡死。
四、后面值得盯什么
Google 已经把端侧 AI 定为核心方向,MediaPipe Tasks 后续有两件事值得跟进:一是 GenAI 方向,比如在端侧跑 Gemma 这类小模型的推理能力;二是 AI Edge Gallery 这类官方演示应用,会不会沉淀成毕设能直接用的新模块。这两条线一旦成熟,端侧实时行为分析、隐私友好型视觉应用这类题目,会再上一个台阶。
这学期毕设打算选什么题?或者去年踩过什么坑?评论区聊聊。