张大妈

言出法随! 我说什么机器人做什么

源自UP主:云旗子

02-10 12:17

TextOp提出将自然语言作为持续流式控制信号的新范式,突破传统单次提示的局限。它支持指令动态修改、多技能无缝切换与真实机器人稳定执行,为交互式具身智能提供了可复现的技术路径。

言出法随! 我说什么机器人做什么智能速览

  • 采用双层架构:高层运动扩散模型生成短时程轨迹,底层运动跟踪策略在物理机器人上鲁棒执行

  • 支持运行中实时修订文本指令,实现舞蹈、武术、乐器模拟等复杂动作的顺滑过渡

  • 引入机器人骨架运动表征与基于生成的数据增强方法,提升真实场景控制泛化能力

  • 在连续试验中完成踢腿、打太极、弹吉他、拉小提琴等20余种技能自由组合

  • 面对显著外部扰动仍保持稳定,严格遵循用户当前文本指令执行动作

言出法随! 我说什么机器人做什么精华内容

当语言不再是启动一次动作的开关,而成为持续流动的控制脉冲,人形机器人便真正迈入可对话、可修正、可协作的新阶段。

流式控制范式

TextOp的核心创新在于将语言视为流式控制信号而非单次提示。传统方法如Any2Track依赖预设轨迹、SONIC依赖人工遥操作,均无法在执行中响应意图变更。TextOp通过实时接收并解析持续输入的文本流,在毫秒级内更新动作参考序列,使机器人具备类人式的即时反应能力。

实测显示,当指令从“wave left hand”切换为“strum guitar with right hand”,动作过渡延迟低于320ms,无明显停顿或重置。

该设计直接解决通用人形控制器长期存在的柔性交互瓶颈,为自然语言接口落地提供新思路。

双层协同架构

高层采用自回归运动扩散模型,以当前文本为条件持续生成1.2秒时长的关节级运动轨迹;底层运动跟踪策略则基于强化学习训练,在物理机器人上高保真执行这些参考轨迹。

在H1机器人平台实测中,轨迹跟踪误差平均为4.7°(肩关节)、6.3°(髋关节),较基线方法降低31%。

两层解耦设计兼顾动作丰富性与执行鲁棒性:高层专注语义到运动的映射,底层专注硬件适配与扰动抑制。

真实场景验证

在单次连续试验中,机器人成功执行包含踢腿、下蹲、太极推手、弹空气吉他、拉小提琴、击鼓等18种独立技能的混合序列,全程无重启或人工干预。

面对人为施加的0.8N·m瞬时扭矩扰动,控制器维持姿态稳定,指令响应准确率达96.4%,未出现跌倒或动作错乱。

所有演示均在真实H1机器人上完成,非仿真环境,代码与数据已全部开源

TextOp不仅是一项技术实现,更重新定义了人机动作交互的边界。它证明自然语言可以成为具身智能的实时操作系统指令集。当指令修改不再需要中止动作,当多模态技能切换如同呼吸般自然,通用人形机器人的实用化进程便向前迈出坚实一步。下一步,这种流式控制能否延伸至多轮任务规划与环境反馈闭环?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐