当前位置:
AIGC文章详情

张大妈

让 AI 靠“看人打游戏”学会真正的因果决策

源自小红薯:Ricky

02-06 21:05

一项名为 Pixels2Play 的研究表明,当 AI 模型与数据规模足够大时,仅通过观看人类游戏录像进行行为克隆,就能让 AI 从单纯模仿动作,进化到理解环境并做出因果决策。这一发现为训练具身智能提供了新思路,展示了一条无需复杂奖励函数或交互环境的可行路径。

让 AI 靠“看人打游戏”学会真正的因果决策智能速览

  • Pixels2Play模型仅通过游戏画面就能学会玩3D游戏。

  • 研究开源了一个包含8300小时游戏视频的大规模数据集。

  • 模型和数据规模越大,AI的因果决策能力越强。

  • 大模型能根据局势判断,而非机械地模仿视觉模式。

  • 该方法无需设计奖励函数,仅靠人类行为数据即可训练。

让 AI 靠“看人打游戏”学会真正的因果决策精华内容

大规模行为克隆如何让 AI 超越模仿,掌握真正的决策能力?通过一项对 Pixels2Play 模型的系统性研究,可以观察到模型规模与因果推理能力之间清晰的关联性,揭示了数据规模背后的质变。

端到端模型

研究者提出了一个名为 Pixels2Play(P2P)的端到端游戏智能体。该模型的输入是游戏实时画面和可选的文字指令,输出则是键盘和鼠标操作,意味着它不需要访问游戏内部状态,仅靠“看屏幕”就能玩3D游戏。

为了训练这个模型,团队开源了一个规模庞大的数据集,包含了超过8300小时的真实玩家游戏录像,以及与之对齐的超过6亿帧画面与操作数据。

规模的力量

论文系统地比较了参数量从1.5亿到12亿不等的多种模型,发现了一个清晰的趋势:模型越大、训练数据越多,它在复杂场景中的决策能力就越稳定。

具体而言,小模型更容易陷入对特定视觉模式的机械式反应,而大模型则表现出更强的稳定性,能够根据当前局势判断行动的必要性。这种差异体现了规模带来的质变。

因果的觉醒

这种从机械模仿到局势判断的转变,正是论文所强调的因果推理能力。大模型不再是简单地学习“这种画面通常对应什么操作”,而是开始理解“如果我现在这样做,接下来环境会发生什么”。

这说明,当规模足够大时,行为克隆不再局限于学习表面的行为模式,而是能够隐式地学习到环境的因果结构。

实际价值

这一发现的重要性在于,它挑战了以往“模仿学习只能学表面行为,真正的决策能力需要强化学习或显式世界模型”的认知。这种大规模行为克隆方式的优势在于,它不需要设计复杂的奖励函数,也无需搭建昂贵的可交互环境,仅仅依赖已有的人类行为数据即可。

此外,P2P模型可以在消费级GPU上以约20FPS的速度实时运行,且数据和模型均已公开,具有很高的可复现性和研究价值。

这项研究揭示了规模定律在行为克隆中的惊人威力,展示了从海量人类数据中涌现因果推理能力的可能性。它为构建更通用的具身智能体开辟了新路径,未来,这种“看会”的能力将如何应用于更复杂的现实世界任务,值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章