实测|沉浸式当“家庭机器人”的 12 小时,一文带你玩转具身数据采集
作者|樊雅婷**|FFF111f__戴着一顶设备干了大半天家务后,我的家第一次如此整洁。
衣服叠了,洗漱台擦了,桌子收了。重点是,每做完一件本该做的事情后,都会进账一笔钱。

虽然离靠它发财还有相当长一段距离,但至少证明了我刚刚做的家务,真的可以卖钱。
这些本来就存在的劳动,现在还能顺手再“卖”一次。
最近,觅蜂科技上线众包数据采集平台“觅蜂派”,把一部分具身数据采集任务交给普通人。
今年 6 月,我们写过 AI 时代的数据标注工。那时,大家还是坐在电脑前标图片、改回答、做审核。
到了具身智能时代,数据采集开始进入真实生活。
普通人在平台上申领设备后,就可以记录从叠衣服、做饭扫地、换猫砂到收发快递、分拣货物、作业流程等这些原本发生在生活和工作中的动作。
原来连续的生活,通过记录任务的方式被拆成一个个可以训练机器人的“物理世界 Token”。

觅蜂官方把这个新工种称为机器人训练师。
不需要会写代码,也不需要懂机器人。你只需要接单后,戴上设备,干本该要干的活,就能为具身大业添砖加瓦,还能顺便赚一笔钱,何乐而不为?
所以,收到 MEgo 之后,我决定用 12 个小时,沉浸式体验一下这个具身时代的新工种。
1
上岗第一天,学会怎么当机器人
成为“机器人训练师”的第一步,没有想象中复杂。
常规注册、登录、实名认证,然后按照说明书连接头戴设备。
按下开机键之后,头盔会发出提示音。App 里设备状态从离线变成在线,再连接 Wi-Fi,就能直接看到摄像头正在拍摄的第一视角画面。一共有五个视角,三个鱼眼视角和左、右目视角。

认证之后,就可以正式接单。
所以,到底哪些原本就要做的劳动,现在可以再卖一次?带着这个问题,我打开了任务大厅。
里面的范围比我想象中大得多。除了清洗、收纳这类家务,还有办公、生产、公共服务、住宿服务、文娱休闲等不同场景。原本散落在生活和工作里的动作,都变成了一项项可以领取的任务。
可以清晰地了解场景、任务类别、时长要求、剩余名额等信息。分享一个小 tip :【我的任务】页面里进行中的任务最多可以同时领取 10 个。

过去我从来没有想过的、原本应该做和随手做的小事,现在也能顺便变现。
当然,对于第一天上岗的我来说,最重要的问题还是,先选哪个?
巧了不是。
北京最近正好要换季了。
那就先来一个衣物换季整理。2-60分钟,对应的收益是0.67-20块。
其实,一条专家标注数据也是二十块。我一边整理换季衣服,一边投身具身智能建设无痛赚钱,怎么算都是我赚了。

于是我把换季的衣服全部翻出来,戴好头盔,开始干活。
以前收拾衣柜,是为了把家收拾干净。
今天不一样。
今天每拿起一件衣服,我都会产生一种奇怪的使命感。一直在心里想,叠一件衣服,就有可能正在教未来的机器人怎么做家务。我的一小步,机器人的一大步。
不得不说,这项工作的第一个副作用很快出现了。
它让我突然变成了一个勤劳的人。很应名了,我觉得自己像只“蜜蜂”。

衣服整理完了,我开始寻找下一单。
桌面可以收。
洗漱台也能擦。
一些平时视而不见、下次再说的家务,在“这玩意儿能赚钱”的激励下,突然全部变得眉清目秀。
就这样,我一下子连续干了好几个任务。整个家焕然一新。

1
干完家务,不代表挣到钱
所有任务采集完成之后,还要上传。
这里又发现了一个真的用过才会知道的小技巧:最好晚上统一上传。
因为设备上传数据的时候,不能继续录制。
如果你做完一单立刻传一单,就会出现一个很尴尬的情况,就是人可以连轴转,但设备不行,它得先传好上一个任务。好在上传不影响玩手机。
所以效率最高的方式是白天干活,晚上上传。
数据传完之后,可以在 App 里看到最终核定的有效时长,以及核定详情。如果有无效时长,还会显示对应的无效原因。


审核速度比我想象中快,视频上传几分钟后就能出结果。我的第一笔收入,也很快到账了,0.36 元。
说起来,这笔钱连瓶矿泉水都买不起,但那一刻还是有一种很奇怪的成就感。
1
机器人到底要什么数据
干了太多家务,身体很累,但心里还在想怎么能让有效数据变得更多,这样就能赚更多钱了。
所以,贯彻大学课堂教学原则,我们先来了解一下数据的分类以及训练目的,这样就能更好地理解什么是好数据。
粗略来看,目前具身模型训练的数据主要有这么几类:

我们现在这种就属于 2.1,Ego 第一视角数据。了解数据类型后,我们以 App 里的核定详情为参考,去判定什么是高质量的数据。
总结我这十几个视频的无效原因,发现一段相对好用的第一视角操作数据,至少有几件非常朴素的事情需要满足。
第一,关键动作和轨迹都很重要。
听起来像废话,但戴着第一视角设备干活就会发现,干起活来顾不上摄像头。
比如说,伸手去够一个东西,手可能直接跑出画面。或者有时候手顺手做了,但头不会转,然后关键动作没拍上。
对于一段操作数据来说,有价值的恰恰是这些。
第二,不是头越稳越好。
这件事还挺有意思。
我刚戴 MEgo 的时候,会本能地觉得,既然要保证画面稳定,那最好尽量不要转头。
但今年 6 月发布的一篇 ActiveMimic 研究恰恰讨论了相反的问题。
研究者认为,在第一视角视频里,人为了完成任务而主动转动视线、寻找下一步目标,这种 camera motion 不应该一概被当成噪音。它本身包含了一部分“接下来应该看哪里”的主动感知信息。
比如我要拿一个杯子,我先转头找到杯子,再伸手。这里“看向杯子”本身就是动作的一部分。
所以真正需要控制的,是那些和任务无关的乱晃。但这也是 MEgo 的特别之处,它不算重,但又有足够的存在感。
无意义的晃动是噪声,有目的的观察,本身也是数据。
这也是第一视角数据有趣的地方。它记录的不只是“手做了什么”,还记录了一个人完成任务的时候看了什么、什么时候看、接下来准备做什么。
第三,不能在采集过程中使用手机。比如我在做饭的时候看食谱,就被判定为无效时长。
刷完洗漱台以后,我甚至认真想了一会儿,未来的清洁机器人为什么一定要长得像人?它完全可以长这样。
效率显然比我高。
这也说明,“把人怎么干活记录下来”和“机器人直接照着人干”并不是一回事。人的数据提供的是经验,怎么把经验教会机器人,属于附加题了。
1
当日常劳动变成机器人训练数据
无本体数据有一个很直接的优势是,它不需要先造出更多机器人,也不需要为了采数据专门搭一套新的工作场景。
一个人戴上设备,就可以把原本就在做的事情记录下来。
目前看来,觅蜂派直接把“申领设备—领任务—采集—核定—提现”做成了一个众包闭环。官方称,已经累计生产超过百万小时无本体数据。

它也不是孤例。
美国人形机器人公司 Figure AI 也在最近揭秘了项目 Index,和觅蜂一样,让普通人注册,在家里或工作场所记录真实任务,再按贡献获得报酬。
过去,普通人对人形机器人的参与,更多是围观。
2025 年春晚,16 台宇树 H1 穿着花袄扭《秧BOT》;到了 2026 年,《武BOT》里的机器人已经能做后空翻、跳马、耍双节棍。短短一年,普通人能直观看见它们的动作能力在进化。

但看机器人表演,和参与机器人训练,是两回事。
现在,你无需再额外学习任何相关知识,就可以参与到机器人训练中。
处理这些数据的方式也在发生变化。以前人们坐在电脑前,用鼠标告诉模型“这是一个杯子”。现在,人直接伸手把那个杯子拿起来。
鼠标的操作,开始变成每个人直接的动作。
体验完之后,我摘下 MEgo。
这次数据采集,我对具身智能的贡献到底有多大,目前还不好说。能赚多少钱,也不好说。写稿时,还有不少任务没上传,所以这 12 个小时到底能赚多少钱,还需要等所有数据上传完才能知道。
但有一件事已经非常确定,我家确实比以前干净多了。




点个“爱心”,再走吧
