ChatGPT核心贡献者姜旭:具身智能的下一站,是互联网视频的规模化革命
2026世界人工智能大会(WAIC)在上海召开。具身智能首次升格为核心赛道,200余家企业、208款终端、300余台真机同台竞技。在人形机器人从"空翻跳舞"转向"拆垛上料"的行业拐点,一位华人创业者的亮相引发了格外多的关注。
姜旭,OpenAI前研究员,InstructGPT、ChatGPT及GPT-4等基础模型的核心贡献者,2023年离开OpenAI,2024年回国在深圳创办亮源新创。他是少数完整经历ChatGPT关键技术演进周期的华人科学家之一。
"2023年离开OpenAI时,大模型的发展已经进入高度确定性的阶段。大语言模型、多模态模型未来几年的演进方向在当时已经清晰。"姜旭在WAIC期间的两场公开分享中回顾了自己的转向逻辑,"但我也在思考:如果人工智能要继续发展,下一阶段最大的机会在哪里?"
他的答案是具身智能。原因很简单——人类世界由数字世界和物理世界两部分组成。过去几十年,互联网积累了海量文本数据,让基础模型学会了理解数字世界;而物理世界中的智能,还没有被真正释放。
世界模型的真实瓶颈:理解与生成难以兼得
WAIC主论坛的圆桌讨论中,姜旭抛出了一个行业尚未充分共识的判断:仅有世界模型,不足以实现通用具身智能。
"过去几年,无论是大语言模型、代码模型,还是智能驾驶,真正实现突破都经历了三个共同的阶段——可规模化的预训练、可规模化的对齐,以及可规模化的部署。世界模型不会是例外。具身智能本质上仍然是一个新的大模型问题。"
他进一步拆解了世界模型的核心任务。第一,预测世界的下一个状态,对于视频生成模型来说就是预测下一帧;第二,也是更重要的,预测下一个动作。
"如果必须在两者之间做取舍,预测动作比预测状态更加重要。因为我们训练世界模型的最终目的,不是为了生成视频,而是为了控制机器人。"
这一判断直指当前行业的一个深层矛盾:今天主流世界模型架构,还没有很好地同时完成"理解"与"生成"两件事。理解本质上是一种感知能力,而生成本质上是一种重建能力。过去几年,多模态大模型领域曾希望通过统一架构同时完成两者,但行业已逐渐形成共识——两者很难通过同一种表征统一完成。
"今天很多世界模型往往采用统一方式去处理状态预测和动作预测,因此很难同时兼顾两种能力。最终模型要么更偏向生成,要么更偏向理解。"姜旭表示,这也是亮源新创重点攻克的方向——通过架构创新和数据创新,更好地统一状态理解和动作预测。
数据路径:互联网视频是唯一具备规模化潜力的答案
具身智能领域目前面临的最大挑战,是数据稀缺。
大语言模型的发展路径看起来顺理成章:互联网文本数据→规模化预训练→模型能力提升→强化学习对齐→产品应用。但姜旭提醒,很多重大技术突破在发生之前都并非显而易见。
"我2019年加入OpenAI时,使用互联网规模文本数据进行预训练本身就是一个非常具有争议的想法。很多人并不相信,仅仅通过一个通用模型学习海量数据,就能够超过传统专用模型。GPT-3发布之后已经在大量NLP任务上取得突破,但整个行业真正形成共识,还是等到ChatGPT出现之后。"
类似的情况也发生在强化学习对齐领域。今天RLHF(基于人类反馈的强化学习)被视为大模型不可或缺的一部分,但在早期,这同样是一个充满争议的方向——很多人认为强化学习应该主要用于机器人和游戏领域,而不是语言模型。
"所以回到具身智能,它也会经历类似的发展过程。"姜旭的判断是,未来实现真正通用机器人,首先需要解决规模化预训练的问题。而互联网视频,可能是唯一具备规模化潜力、能够支撑通用机器人发展的数据来源。
据估算,互联网视频数据规模达到百亿小时级别,而通过机器人采集获得的数据通常只有百万小时级别,两者之间存在数量级差距。更重要的是,互联网视频覆盖了人类在各种环境、各种任务中的行为——"你能想到的人类在任何场景下完成的任何动作,都有很大概率能够在互联网视频中找到。"
"预训练本身能够容忍大量噪声。对于预训练来说,噪声并不是关键问题。"姜旭表示,这也是亮源新创自成立以来重点投入的技术路线。
商业化落地:高容错场景先行
技术路线之外,落地场景的判断同样关键。
姜旭认为,具身智能本质上是大模型向物理世界的延伸,其商业化规律应该参考过去几年大模型应用的发展路径。AI时代最大的红利,本质上是智能供给的红利——它并不是因为突然出现了新的需求,而是因为过去几十年互联网积累了海量数据,再结合近年来算法突破,把这些数据转化成了智能。
"因此,具身智能最先发生能力跃迁的领域,一定是互联网已经积累了大量数据的领域。"
互联网规模最大的数据是视频数据,约100亿小时,主要来自人们日常生活。这意味着,具身智能最早实现能力跃迁的,也更可能是日常生活场景。
但仅有能力突破还不足以实现商业成功。姜旭提出了另一个约束条件:高容错率。
"大模型天然具有很强的泛化能力,它可以在很多场景都'做一点',但在早期往往不具备足够高的精确性和可靠性。"
他举了几个例子:早期AI做PPT存在明显幻觉,但定位是助手;代码模型负责提供建议,由程序员最终确认;今天的视频生成模型,很多时候也是一种创意工具。过去几年真正成功的大模型应用,几乎都率先落地于高容错场景。
"具身智能也很可能遵循类似规律,首先在高容错场景实现商业突破。"姜旭同时提醒,大模型的训练路径已经越来越清晰,但真正找到适合模型能力的产品形态和商业场景,并不比训练模型本身更容易,"OpenAI在ChatGPT成功之前,也经历了大量产品探索,其中很多都没有成功。"
因此,对于具身智能公司而言,一个更现实、成功率更高的策略,是保持开放心态,持续探索丰富的应用场景,而不是过早假设唯一正确的商业化方向。
亮源新创的路线图:12到18个月闭环
按照亮源新创的研发节奏,姜旭给出了一个相对具体的时间表:未来12至18个月左右,实现第一次较强的通用具身智能能力突破。
这个突破包含几个重要环节:首先,完成一次具有一定规模的具身智能基础模型预训练;在此基础上进一步开展规模化的强化学习和对齐;最后,通过规模化部署,推动数万台甚至十万台级别的部署规模。
"我们的目标是在未来一年到一年半左右,实现从规模化预训练、规模化对齐到规模化部署的完整闭环。"姜旭表示,智能才是真正的产品,机器人只是智能进入物理世界的重要载体。真正重要的,是让基础模型能够持续进入物理世界,在真实环境中学习、进化,并在规模化部署过程中持续获取真实世界数据,形成基础模型持续学习的数据飞轮。
作者:科技不焦虑
