当前位置:
AIGC文章详情

半年榜首换4次,家家都说"全球第一":看完RoboChallenge的4万次真机测试,我知道具身智能榜单该怎么看了

源自25位全网作者

14:41

如果你今年关注过人形机器人新闻,一定见过这样的场面:今天这家宣布"登顶某国际榜单",明天那家宣布"打破硅谷垄断",海报上清一色的"全球第一"。

数据更夸张:2026年上半年,具身智能赛道322起融资、总额超过935亿元;目前活跃在行业里的各类榜单超过20个,几乎每周都有新的"全球第一"诞生。36氪但"第一"这么多,到底该信谁?

这就是 RoboChallenge 值得单独拎出来说的原因。它是目前行业关注度最高的真机评测平台,截至今年8月,累计执行的真机测试总量已超过4万次。科创板日报今天就把这个榜单彻底捋一遍:它考什么、谁登过顶、哪些地方可信、哪些地方要打个问号。

RoboChallenge 考的是"家务活"

2025年10月,Dexmal原力灵机联合 Hugging Face 发起 RoboChallenge,定位是全球首个大规模真机评测平台。微博它的第一个任务集 Table30 是30个标准化桌面操作任务,说白了就是让机器人做家务:做三明治、插花、擦桌子、处理柔性物体;没有机器人的公司也能参赛,提交模型,平台帮你上真机跑。微博它之所以被业内叫作具身模型的"真机考场",是因为考场里的"课桌"也不是定制的一次性机器:20台 UR5、Franka 等主流机器人直接"撕掉Demo滤镜",测试视频、轨迹、成功率全部公开可追溯。知乎

到2026年年中,RoboChallenge 已经被 CVPR 和 ICRA 两大国际顶会纳入竞赛赛道,小米机器人团队6月在这两个赛道拿下双料冠军。微博杭州媒体还披露,这支冠军队伍的机器人搭载的是杭州肇观智能的国产视觉芯片。微博

半年榜首换4次,家家都说

半年榜首换4次,裁判还亲自下场了

重点看这份过去10个月的"流水账":

  • 平台上线后,Physical Intelligence 的 π0/π0.5、微软 CogACT 等国际头部模型率先入场;

  • 2026年1月初,自变量宣布其开源模型 WALL-OSS 以46.43分超越 pi0。小红书

  • 2月,原力灵机自家的 DM0 宣称单任务、多任务双第一,同期社区爆发大讨论:“极佳"前一天刚登顶,第二天就被 RoboChallenge 发起方的模型拉下马,最扎眼的质疑是"裁判自己下场当选手”。小红书

  • 3月,Table30 V2 发布,聚焦真实应用场景、任务难度全面提升,专门考"换了题还会不会"的泛化能力。知乎

  • 5月20日,星动纪元的 Era0 拿下综合第一:成功率64.33%、过程分76.34,30项任务中17项拿到第一。微博在"做素食三明治""擦桌子"这两项最高难度任务里,它还是榜单上唯一做出非零成功率的模型。知乎

  • 6月中,阿里发布 Qwen-Robot 系列,其中操作模型 Qwen-RobotManip 自述在 RoboChallenge 真机评测里包揽前两名——注意这是发布方口径,连转述者都说真机实效还得等第三方实测。微博

半年榜首换4次,家家都说

36氪对这一幕的总结只有一句话:RoboChallenge Table30 的榜首,半年内换了四次。36氪这恰恰是真机评测的价值:战报可以随便写,机械臂把纸团扔进垃圾桶这件事,行就是行,不行就是不行。Era0 那个64.33%的成功率,翻译成大白话是:当今最强的模型,做家务每3次仍有1次失败。如果你正在等家用机器人进门,这个数字比任何战报都更有参考价值——技术在快速进步,但还没到"闭眼下单"的阶段。

榜单含金量几何?给你四个问题

当然,RoboChallenge 也不是无可质疑。2月的裁判争议真实存在,Table30 固定30题留有"应试"空间也是事实——这正是 V2 要加考泛化的原因。

把视野放宽到整个具身评测圈,就更热闹了。7月底36氪扒过一个典型案例:千寻智能的 Spirit v1.6 宣称在另一个众包榜单 RoboArena 上综合得分全球第一,结果有人梳理该榜单公开的310条评测记录后发现,72%的分数只来自两个注册账号。36氪其中一个账号给它评测了179次、胜率高达97%,而英伟达官方用同款模型测21次,胜率是0%。最后榜单官方回溯调查、移除可疑数据,这款模型从主榜消失。

注意,翻车的是 RoboArena,不是 RoboChallenge。但这个瓜的借鉴意义很实在:不同榜单的机制完全不同,可被操作的空间也完全不同——众包投票式可以注册小号自己给自己打分,仿真式有仿真与现实的差距,封闭式可以定向刷题。

我把辨别方法总结成四个问题,以后看到任何"登顶"战报,直接套用:

  1. 谁管设备?真机榜、仿真榜、众包投票榜是三回事。后两者分别有 sim-to-real 差距和"自己考自己"的漏洞;真机集群最难造假,但也最贵,一台人形机器人动辄几十万元。

  2. 证据公开吗?测试视频、轨迹、评测记录能不能公开追溯。RoboChallenge 最大的信用资产是全链路公开,而 RoboArena 翻车,恰恰是因为评测记录公开、被人反向梳理了出来。

  3. 题目能刷吗?越是固定题库,分数越要打折。Table30 初版同样有这个问题,V2 才开始考泛化。

  4. 裁判下场了吗?发起方亲自参赛时,就要多看一眼评测过程能不能独立复现、有没有第三方结果可以互相印证。

除了看总分均值,按能力维度拆开看也是识榜方法之一:把公开评测数据按维度画成雷达图,Era0、DM0、Spirit-v1.5 们各自的长板短板一目了然。

半年榜首换4次,家家都说

接下来,值得盯这几个信号

行业也在补自己的"尺子"。标准层面,工信部发布的《人工智能关键基础技术 具身智能基准测试方法》(YD/T6770-2026)已于6月1日实施,这是具身智能领域的首份行业标准,各家榜单的口径是否向它对齐,会是第一块试金石。科创板日报

平台层面,高校、科研机构与开源社区等多方共建的仿真评测平台 RoboColiseum 于8月上线,其仿真评测与真机部署的相关性达到89.5%,同一模型在仿真与真实世界中的评测差异小于10%。科创板日报低成本仿真评测能不能替代一部分真机测试,会直接影响这类榜单未来的更新速度和成本。

半年榜首换4次,家家都说

组委会层面,RoboChallenge 今年春天完成了第二批扩容,星动纪元、极佳视界、地平线、长虹等8家企业入驻,更早之前的首届组委会里则已有清华、智源研究院、智元机器人、Qwen、星海图等机构。知乎参与方越多,"裁判兼选手"的争议越有稀释空间,这也是这个平台公信力值得持续观察的信号之一。

一句话收尾:具身智能这个赛道里,战报是最便宜的,真机素材是最贵的。下次再看到"全球第一",先把上面四个问题套一遍,再决定要不要跟着鼓掌。至于下一个值得追的瓜:Table30 V2 的泛化榜单上,谁能坐稳、能坐多久。

内容由AI生成

精选参考来源

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐