具身智能领域迎来关键突破。智元推出的GenieReasoner系统,直击VLA模型“思考”与“动作”脱节的核心痛点。其创新架构与实测数据均表现优异,更同步开源了行业评测基准,为解决具身智能的推理与执行难题提供了全新方案。
智能速览
GenieReasoner采用统一离散化预训练架构,解决了语义推理与动作控制的模态对齐难题。
在空间理解等核心维度,其综合推理准确率达87.6%,超越同类模型12.3个百分点。
跨5类真机本体的执行成功率达89.2%,远超行业平均水平。
开源的ERIQ评测基准填补了行业评估标准空白,可量化评估具身大脑能力。
强化的具身推理能力,能让端到端动作执行表现提升超过35%。
精华内容
GenieReasoner的实测数据为何能登顶SOTA?其技术内核与开源基准又将如何重塑行业格局?下面深入剖析。
架构破局:精准同步思考与行动
传统VLA模型常因“思考”与“动作”的模态差异导致执行偏差。GenieReasoner的创新在于采用统一离散化预训练架构,结合流匹配技术,有效解决了语义推理与动作控制的对齐难题。
这一技术路径将传统Tokenizer的动作精度瓶颈降低了40%以上,使得机器人的“思考”与“动作”能够实现精准同步,从根源上减少了执行错误。
实测登顶:全面领先的硬核数据
性能是检验技术的唯一标准。在空间理解、任务规划、工具使用三大核心维度,GenieReasoner的综合推理准确率高达87.6%,显著超越同类VLA模型12.3个百分点。
更值得关注的是其泛化能力,在覆盖机械臂、移动机器人等5类真机本体的测试中,跨设备执行成功率达到了89.2%,远超行业65%的平均水平,展现了强大的通用性。
开源赋能:填补行业评估空白
除了模型本身,智元同步开源的ERIQ具身推理评测基准价值巨大。该基准聚焦真机操控全流程,能够解耦并量化评估具身大脑在空间理解、任务规划、工具使用等不同维度的能力,填补了行业长期缺乏统一、可复用评估标准的空白。
此举将推动整个行业更高效地进行技术迭代与公平对比。
GenieReasoner不仅是一次技术上的迭代,更是具身智能从“能用”迈向“好用”的关键一步。通过开源ERIQ基准,智元展现了推动行业共同进步的决心。未来,随着逻辑深度与执行精度的持续突破,具身智能的想象空间将被进一步打开,下一个时代会是什么样?