复旦大学等团队提出的FRoM-W1框架,通过语言指令驱动人形机器人实现全身精细控制,解决了抽象指令拆解和真机执行稳定性两大核心难题。该框架在Unitree H1/G1等平台上验证有效,全身控制误差降低15%,为通用人形机器人控制提供了开源底座。

智能速览
语言驱动全身控制框架FRoM-W1开源
全身控制误差降低15%,支持手部精细动作
强化学习预训练+微调提升真机稳定性
CoT链式思考实现抽象指令分解
动作token化让动作可建模可组合
兼容Unitree H1/G1等多款机器人平台
精华内容
FRoM-W1框架通过H-GPT语言动作生成和H-ACT控制执行两阶段设计,实现了从自然语言到全身动作的完整闭环,并在真机上验证了稳定性和准确性。
技术架构
FRoM-W1采用两阶段设计:第一阶段H-GPT负责将自然语言指令转化为人体动作序列,引入链式思考(CoT)作为语义中间层,把抽象指令拆解为带时间结构的动作片段。第二阶段H-ACT通过强化学习预训练与微调,将人体动作重定向到具体机器人平台,确保真实环境下的稳定执行。
框架将连续全身动作离散化为动作token,适配语言模型建模方式,使用SMPL-X表示包含手部的全身动作。通过逆运动学和重定向技术,将SMPL-X人体动作转换为机器人可执行的参考动作。
核心创新
CoT技术让抽象指令转化为可执行的动作分解结构,先用GPT-4o对原始数据进行指令增强,丰富训练时的指令空间。动作token化让动作序列像文本一样可建模,实现了动作的可压缩、可组合和可泛化表达。
推理阶段RL微调(RFT)是另一创新点:在预训练获得通用控制器基础上,针对目标动作进行少量仿真训练微调,显著提升追踪精度和稳定性。采用教师-学生训练思路,教师用特权信息训练,学生通过蒸馏学习轻量策略。
实验验证
实验分为生成、仿真控制和真机部署三部分。在HumanML3D-X评测基准上,FRoM-W1的FID指标相对基线T2M-GPT提升2.5倍,证明CoT在开放指令理解上的增益。
仿真控制测试中,使用MPJPE、VEL、ACCEL和SR指标衡量性能。结果显示Unitree G1的成功率达80%-90%,H1为40%-50%,表明机器人结构差异影响稳定性。RL微调在500步左右即可见明显提升趋势。
真机部署
在真实机器人上,H-GPT在4090工作站生成动作,重定向后传给机器人,H-ACT控制策略在机器人端执行。系统展示了三类典型能力:理解抽象指令、执行手部精细动作、完成移动+动作的组合技能。
模块化接口设计让同一套生成动作能被不同控制策略稳定执行,证明了系统的通用性和可扩展性。这套开源框架为人形机器人语言驱动控制提供了实用底座。
FRoM-W1通过语言动作生成和控制执行的创新结合,实现了人形机器人的全身精细控制,误差降低15%并保持真机稳定性。作为开源框架,它为人形机器人控制技术发展提供了新思路,未来在开放指令理解和极端动作执行上仍有探索空间。