TextOp提出将自然语言作为持续流式控制信号的新范式,突破传统单次提示的局限。它支持指令动态修改、多技能无缝切换与真实机器人稳定执行,为交互式具身智能提供了可复现的技术路径。
智能速览
采用双层架构:高层运动扩散模型生成短时程轨迹,底层运动跟踪策略在物理机器人上鲁棒执行
支持运行中实时修订文本指令,实现舞蹈、武术、乐器模拟等复杂动作的顺滑过渡
引入机器人骨架运动表征与基于生成的数据增强方法,提升真实场景控制泛化能力
在连续试验中完成踢腿、打太极、弹吉他、拉小提琴等20余种技能自由组合
面对显著外部扰动仍保持稳定,严格遵循用户当前文本指令执行动作
精华内容
当语言不再是启动一次动作的开关,而成为持续流动的控制脉冲,人形机器人便真正迈入可对话、可修正、可协作的新阶段。
流式控制范式
TextOp的核心创新在于将语言视为流式控制信号而非单次提示。传统方法如Any2Track依赖预设轨迹、SONIC依赖人工遥操作,均无法在执行中响应意图变更。TextOp通过实时接收并解析持续输入的文本流,在毫秒级内更新动作参考序列,使机器人具备类人式的即时反应能力。
实测显示,当指令从“wave left hand”切换为“strum guitar with right hand”,动作过渡延迟低于320ms,无明显停顿或重置。
该设计直接解决通用人形控制器长期存在的柔性交互瓶颈,为自然语言接口落地提供新思路。
双层协同架构
高层采用自回归运动扩散模型,以当前文本为条件持续生成1.2秒时长的关节级运动轨迹;底层运动跟踪策略则基于强化学习训练,在物理机器人上高保真执行这些参考轨迹。
在H1机器人平台实测中,轨迹跟踪误差平均为4.7°(肩关节)、6.3°(髋关节),较基线方法降低31%。
两层解耦设计兼顾动作丰富性与执行鲁棒性:高层专注语义到运动的映射,底层专注硬件适配与扰动抑制。
真实场景验证
在单次连续试验中,机器人成功执行包含踢腿、下蹲、太极推手、弹空气吉他、拉小提琴、击鼓等18种独立技能的混合序列,全程无重启或人工干预。
面对人为施加的0.8N·m瞬时扭矩扰动,控制器维持姿态稳定,指令响应准确率达96.4%,未出现跌倒或动作错乱。
所有演示均在真实H1机器人上完成,非仿真环境,代码与数据已全部开源。
TextOp不仅是一项技术实现,更重新定义了人机动作交互的边界。它证明自然语言可以成为具身智能的实时操作系统指令集。当指令修改不再需要中止动作,当多模态技能切换如同呼吸般自然,通用人形机器人的实用化进程便向前迈出坚实一步。下一步,这种流式控制能否延伸至多轮任务规划与环境反馈闭环?