长时世界模型、具身行动 | 多模态大模型8.16日报

源自7位全网作者

06:09

正在加载内容...

精选参考来源

1
AI能生成连续2小时的连贯虚拟世界了!无限时长交互世界模型新突破 【生成式AI】【世界模型】
2
【清华联合伯克利提出连续世界模型,机器人不用再逐帧猜环境】在#具身智能# 的演进中,世界模型被寄予厚望:它不仅要生成未来画面,更要帮助机器人理解世界如何连续变化。然而,当前主流的视频生成与部分机器人世界模型,它们的底层架构大多仍受制于一个固有的思维定式:离散的下一步预测(Discrete Next-step Prediction)。简单来说,这种模式将连续的物理世界切分成了一帧帧静态的画面。AI 预测未来时,必须像翻连环画一样,根据当前帧去推演下一帧。这种方式在短时间的视觉生成上大放异彩,但面对长视距的物理任务时,却暴露出明显缺陷:由于误差会逐帧累积,时间一长,AI 就容易偏离原本的物理规律,产生不合逻辑的幻觉。近日,清华大学智能产业研究院(AIR)与加州大学伯克利分校(BAIR)团队合作提出了一种全新的预测范式 ODEWorld,其建立在连续的“物理时间流”(Physical-Time Flow, PT-Flow)之上。与传统方法直接预测下一帧是什么不同,ODEWorld 试图学习的是:世界究竟怎样从当前状态连续地变化到未来状态。戳链接查看详情:网页链接
全部
来源
内容由AI生成

精选参考来源

1. AI能生成连续2小时的连贯虚拟世界了!无限时长交互世界模型新突破 【生成式AI】【世界模型】

2. 【清华联合伯克利提出连续世界模型,机器人不用再逐帧猜环境】在#具身智能# 的演进中,世界模型被寄予厚望:它不仅要生成未来画面,更要帮助机器人理解世界如何连续变化。然而,当前主流的视频生成与部分机器人世界模型,它们的底层架构大多仍受制于一个固有的思维定式:离散的下一步预测(Discrete Next-step Prediction)。简单来说,这种模式将连续的物理世界切分成了一帧帧静态的画面。AI 预测未来时,必须像翻连环画一样,根据当前帧去推演下一帧。这种方式在短时间的视觉生成上大放异彩,但面对长视距的物理任务时,却暴露出明显缺陷:由于误差会逐帧累积,时间一长,AI 就容易偏离原本的物理规律,产生不合逻辑的幻觉。近日,清华大学智能产业研究院(AIR)与加州大学伯克利分校(BAIR)团队合作提出了一种全新的预测范式 ODEWorld,其建立在连续的“物理时间流”(Physical-Time Flow, PT-Flow)之上。与传统方法直接预测下一帧是什么不同,ODEWorld 试图学习的是:世界究竟怎样从当前状态连续地变化到未来状态。戳链接查看详情:网页链接

3. 告别"停下才能干活"的僵化模式,全球首个"边移动边操作"的全身家务机器人模型,实现移动与操作统一预测

4. 从零跑通 nanoVLM:在笔记本上实现一个视觉语言模型

5. 机器人世界模型如何预演未来

6. 视频生成模型框架梳理

7. AI到底有什么区别?多模态又是什么?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章