文心一言视频生成能力解析:从渲染器到世界模型的演进之路
06-09 18:49
精选参考来源
知乎 2026-01-29
新浪微博 2026-03-18
来源
精选参考来源
1. 国产模型开源封神,谷歌Genie3紧急开源?蚂蚁AGI撕开世界模型闭源防线
知乎 2026-01-29 00:00:00
2. 从“开车”到“懂世界”:理想MindVLA-o1重新定义自动驾驶基座理想汽车在英伟达GTC大会上,正式发布下一代自动驾驶基础模型 MindVLA-o1,定位为面向物理世界的通用智能体,首次实现感知、推理与控制的深度统一,完成自动驾驶从“功能堆叠”到“智能体思考”的跃迁。它的核心价值,不止于更稳的驾驶,简单总结三点:1. 3D空间理解:原生3D ViT架构,精准建模物理世界,复杂场景感知更可靠2. 多模态思考:把感知、推理、决策融于一体,像人一样预判与思考3. 通用物理智能:同一套VLA模型,既可控车,也能驱动机器人,打开跨域智能的想象空间总之目前最核心的变化就是它会让自动驾驶看得更远、想得更深、行得更稳、进化更快、部署更高效,所谓自动驾驶,只是物理AI的第一站。当车真正理解空间、学会思考,智能出行才真正被改写。#李想称机器人也用VLA##理想全能辅助驾驶来了##理想发布下一代自动驾驶基础模型#
新浪微博 2026-03-18 00:00:00
3. CVPR2026上,刘先明分享了小鹏的进展,以及对基座模型的思考:小鹏的技术路径并非在 VLA 和世界模型中二选一,而是将两者结合,构成物理世界基座模型。两者训练目标不同,互为补充。第二代 VLA 负责“如何行动”。通过人类驾驶行为的输入(视频/指令)与输出(动作)进行建模。这种方式的挑战是人类行为数据在时间上是稀疏的,只能提供结果监督。世界模型负责“理解行动后的世界变化”。采用类似大语言模型预测“下一个 Token”的逻辑,在海量视频上密集预测下一帧画面或下一个物理状态。提供高密度的训练信号。小鹏通过四篇学术论文,来展示世界模型的具体作用:可控生成(X-World): 给定一个驾驶动作,模型能生成符合物理规律的未来视频。用于闭环仿真和造数据。长时序推演(X-Foresight): 将视觉与动作结合,预测未来场景演化,直接给 VLA 的控车决策提供支持。加速推理(X-Cache): 提出跨段块级缓存技术,极大减少重复计算,将推理速度最高提升 2.7倍。主动思考(X-mind 待发): 解决端到端模型的“黑盒”痛点,输出决策的中间推理过程,提升可解释性。在训练端,小鹏的单版模型训练量超 4万亿 Token,集群 GPU 硬件利用率达 90%。VLA2.0+图灵芯片,相较于开源模型+通用芯片,计算利用率从 22.8% 提升至 82.5%,推理时延从 800毫秒 压缩至极限的 80毫秒。小鹏的最终目标,是 L4 级自动驾驶及具身智能。
新浪微博 2026-06-05 00:00:00
4. 世界模型VLA SOTA!DriveWorld-VLA:自驾VLA的统一潜在空间世界建模(小米&北交)
微信公众号 2026-02-10 00:00:00
5. 超越DriveVLA-W0!DriveLaW:世界模型表征一统生成与规划(华科&小米)
微信公众号 2026-01-04 00:00:00
6. 中科院&长安汽车提出Latent-WAM:隐式世界动作建模+3D几何感知蒸馏实现双榜SOTA
微信公众号 2026-04-02 00:00:00
7. 博世一篇最新的端到端世界模型工作:统一理解、规划和生成
微信公众号 2026-01-12 00:00:00
8. 盘点一周AI大事(5月17日)|AI终于正常说话 Google发布Android大脑 Gemini Intelligence Google推出Gemini 光标 Google视频模型Veo 4曝光 Thinking Machines 发布最强实时交互模型 Interaction Models 面壁智能发布最强开源小模型 MiniCPM-V 4.6 Sakana开源 AI 指挥官 Conductor Model / Fugu Adaption发布 AI 研究员 AutoScientist 研究员开源最强运镜视频模型 Warp-as-History 研究员开源最强打光视频模型 Relit-LiVE 研究员开源最强图生 3D 模型 Pixal3D 研究员开源最强视频配音模型 Just-Dub-It #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-17 00:00:00
9. 登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变可交互4D世界
微信公众号 2026-03-20 00:00:00
10. 打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来
微信公众号 2026-03-26 00:00:00
11. 探寻世界模型最优解!SGDrive:层次化世界认知框架,VLA再升级(理想&复旦等)
微信公众号 2026-01-14 00:00:00
12. Wayve最近的GAIA-3分享:全面扩展世界模型的评测能力......
微信公众号 2025-12-19 00:00:00
13. 涌现的时空:基于不可叠合性原理的统一框架 8.4 完整版
知乎 2026-03-24 00:00:00
14. 全面解析“世界模型”:定义、路线、实践与AGI的更近一步【硅谷101】
哔哩哔哩 2026-03-06 00:00:00
15. NVIDIA吴新宙:世界模型是自动驾驶最本质的一环
微信公众号 2026-04-27 00:00:00
16. 刚刚,小鹏把世界模型的家底,在CVPR上公开了。
微信公众号 2026-06-04 00:00:00
17. 詹锟在GTC上分享了理想目前智能驾驶方面的进展,最关键的一点就是最新的VLA模型——MindVLA-o1,基于统一 Vision Language-Action 的 Omni 架构,在单一Transformer 中联合建模感知、推理与控制。主流 VLA 方案的三大局限性(图二):①3D 视觉 / 语言与动作对齐慢,延迟高②长尾场景数据无法规模化,真实世界长尾场景数据采集成本高、覆盖不全,模型泛化差③VLA 模型参数量大、推理重,车端算力无法支撑那么理想的VLA是怎么解决这些的呢?(图三)多模态输入——MindVLA-o1-MoE(快慢思考)——Action Output(输出轨迹)※多模态输入采用了3D 视觉基座,让其自主学习 3D 空间语义,减少了大量的人工标注数据,模态在同一表示空间获得更高效率和更强泛化能力※新增了一个Latent World Model(潜在的世界模型),将输入图像编码为潜在 Token再重构,去模拟未来一下秒的关键画面,比如这一帧进去的图片是“右侧车辆偏压线”(To),模型预判 “右侧车辆会强行加塞”,并推理两种动作:直接行驶 → 碰撞(To+1)。立即左避 → 安全(T'o+1),去提前选择安全动作,解决长尾场景下的决策难题(图五)※多模态输入进模型以后,会将语言指令会通过3.2B的MOE模型,做 CoT(思维链)推理,同时将其他视觉特征则生成动作 Token,最后生成稳定轨迹,减少了推理时间※构建强化学习框架让模型在真实和模拟环境中学习探索,反补世界模型做技术升级,优化驾驶策略(图七)。※面向端侧大模型的软硬件框架,提升端侧 VLA 模型设计和部署效率,换句话说Orin和Thor还会有一定的升级(图八)自动驾驶系统逐渐演化成通用物理世界基础模型,可控制车辆、机器人和机械臂,还能生成具身智能训练数据,未来将驱动各种物理系统,具身 AI 将走进人们生活。#懒博小课堂##微博新知##理想L9#
新浪微博 2026-03-17 00:00:00
18. #大众9X首发MomentaR7世界模型# 人在现场,刚刚提问完。MomentaR7相比于R6来说是大版本升级,引入世界模型,看懂世界,理解世界运行规则,曹总现场透露表现全球第一梯队 。可以说 这次的R7,更是在强化学习的基础上,引入了核心的世界模型,让AI第一次真正读懂物理世界的本质,理解物体的物理属性、运动的因果关系、交互的潜在可能,属于是打响了2026年物理AI元年的第一枪。唯一需要挑刺的地方是,新车上市的时候能否直接搭载R7,还有悬念,主持人问了,曹总没正面回答。 上海·长三角国际电竞文化中心
新浪微博 2026-03-16 00:00:00
19. 当AI学会了创造世界,科幻电影中的机器人时代开始全面加速! #AI新星计划 #科技改变生活 #玩个很新的东西 #世界模型 #具身智能
抖音 2026-01-30 00:00:00
20. 国产具身世界模型「破晓时刻」!中科第五纪FlowWAM登顶全球榜单,斩获双料第一
微信公众号 2026-04-23 00:00:00
21. 为什么2026年大模型都在往“理解生成统一”方向发展?去掉VAE和VE到底能带来什么本质性的提升?
知乎 2026-05-03 00:00:00
22. 从原生4K直出到创作者扶持,AI视频的竞争规则正在重写
微信公众号 2026-05-09 00:00:00
23. 地平线最新提出HorizonDrive:自动驾驶世界模型新范式、实现分钟级自回归生成
知乎 2026-05-25 00:00:00
24. Vidu Q3 登顶中国AI视频新王者,一句话生成16秒音视频,音效惊艳
微信公众号 2026-01-30 00:00:00
25. 世界模型双冠王诞生!国产世界模型力压谷歌、英伟达等持续领跑
微信公众号 2026-04-27 00:00:00
26. 一站式生成大片,声画同步的AI视频模型来了
哔哩哔哩 2025-12-16 00:00:00
27. ICLR 2026 | FlowAD:隐空间时空世界模型构建自车场景交互新范式(上交&百度)
微信公众号 2026-03-14 00:00:00
28. 内容标识制度:给生成式人工智能内容赋予清晰“身份”
微信公众号 2026-05-13 00:00:00
29. 双SOTA!GenieDrive:物理一致的自动驾驶世界模型(港大&华为诺亚)
微信公众号 2025-12-24 00:00:00
30. 告别纯文本时代AI教母李飞飞剑指“空间智能”
微信公众号 2026-02-15 00:00:00
31. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-04-19 00:00:00
32. 实测 世界模型 Genie3 通过一些奇怪的案例
哔哩哔哩 2026-02-03 00:00:00
33. 今年 CVPR 多了一个会,叫做「第一届具身 AI 基础模型部署研讨会」,但面孔好多是老面孔,包括 Waymo CEO Dragomir Anguelov 和 Wayve CEO Alex kendall,这都是常客。车企里主要是两家,特斯拉的 AI 负责人 Ashok Elluswamy 和小鹏的 AI 负责人刘先明——好吧,其实是三家,还有一位是先明在 Cruise 的前同事 Ben Snyder,但如今 Cruise 都没了,请原谅我不觉得通用是物理 AI 领域的主要玩家。这篇先写一下先明做的分享,标题是「构建自动驾驶的世界模型」。我就不发全文了,只发些重点。「VLA模型从人类行为中学习。 给定视频流和指令,它输出动作序列或直接控制信号。VLA 的监督信号比较稀疏,但是是高层次的:人类动作隐含地编码了感知、推理、意图、风险评估、社会交互以及物理理解。世界模型则从世界本身学习。 它不仅预测动作,还能预测未来状态、未来观测,或潜在的未来表征。世界模型的监督信号更加稠密:每一帧图像、每一个运动、每一次交互都成为训练信号。二者构成了训练物理世界基础模型的两个互补目标:VLA从人类如何行动中学习,世界模型从世界如何演化中学习。世界模型的三大关键要素:思考(Thinking):在模型采取行动之前,我们需要理解它在「思考」什么。对于 VLA 系统而言,可解释性对于调试、建立信任和迭代优化至关重要。可控(Control):用于自动驾驶的世界模型必须是可控的。当自车转向、加速、制动或变道时,生成的未来场景必须在物理和几何上保持一致。长时序推演(Rollout):自动驾驶决策具有序列性,一次动作的影响可能在几秒后才会显现。更深层次的要点在于规模化。自动驾驶不可能通过人工设计每一个边缘案例来解决。它最终将通过规模化模型、规模化数据,以及能够迫使模型真正理解物理世界的规模化目标来实现。VLA是一种目标,世界建模是另一种目标。下一代物理 AI 模型:下一代自动驾驶系统不仅要学习模仿人类驾驶,还要在行动之前学会预测、仿真和推理世界。」最后先明的总结是 Driving by understanding. Understanding by predicting. Prediction by scaling. 这三句大家都能看明白,但是我没有想出很好的翻译,大家有没有好的翻译?
新浪微博 2026-06-04 00:00:00
34. 文远WeRide GENESIS世界模拟器方案解析
微信公众号 2026-01-29 00:00:00
35. 【世界模型不会取代LLM,它是LLM缺失的那一层】快速阅读: 世界模型正从学术概念走向主流讨论,但“取代LLM”是个假命题。更准确的描述是:LLM处理语言和推理,世界模型负责物理仿真和因果接地,两者将形成分层协作的架构。目前的应用重心集中在机器人领域,非物理领域的潜力仍被严重低估。---在Nvidia的GTC大会上,世界模型(world model)突然成了每个严肃对话的收尾词。这种感觉像2021年所有人突然“懂了”transformer的那个时刻。世界模型不预测下一个词。它在内部构建一个关于世界如何运转的表示,能模拟环境、向前规划、推演因果链条。这和LLM做的事情在结构上不是同一回事——LLM理解的是语言,它“知道”猪不会飞,是因为文本里这么写;世界模型则要直接编码重力、质量、无翼这些约束本身。一个是通过描述世界来理解世界,一个是直接对世界的规律建模。但说“再见,LLM”是彻底搞错了方向。有观点认为,两者根本不互斥。更接近现实的架构是:LLM作为语言接口和意图解析层,世界模型作为物理仿真和因果推理层,专用代码处理确定性执行。世界模型填的是LLM一直缺的那个空——当LLM生成一个计划,它没有内部物理引擎来验证这个计划是否在现实中成立。六年前特斯拉的车开进卡车,不是因为模型不聪明,是因为它没有“卡车几乎总是拖着挂车”这种世界级别的先验约束。目前几乎所有的世界模型应用都流向了机器人、自动驾驶和物理操控。这让人有点不安。商业管理、药物发现、金融决策——这些领域同样需要因果推理,同样需要“如果这样做,接下来会发生什么”的模拟能力。但资源和研究还没怎么往这里走。Yann LeCun是这个方向最值得追踪的声音。他对JEPA架构的执念和对LLM局限的批判,提供了比大多数会议演讲更诚实的坐标。有个问题没人认真回答:在药物发现或业务仿真这类高价值非物理场景里,你怎么知道世界模型的因果信念是真实校准过的?机器人领域有sim-to-real gap研究来逼出误差,其他领域的等价检验是什么?LLM的置信度和正确性脱钩这件事,我们花了好几年才学会和它相处。世界模型面临同样的清算,而赌注会更高。这不是反对世界模型,是说“它理解因果”和“它能生成连贯的因果仿真”是两个不同的声明。第一个没法从外部观测,第二个可以。混淆这两者,是AI每一代新技术都会重蹈的错误。在这个问题被解决之前,真正有价值的工程工作可能不在模型本身,而在路由层——哪类任务交给LLM,哪类交给世界模型,哪类用确定性代码,怎么在它们之间传递状态。这部分目前几乎没有人在认真做。ref: www.reddit.com/r/artificial/comments/1s828dj/world_models_will_be_the_next_big_thing_byebye
新浪微博 2026-04-02 00:00:00
36. 29 岁创业者融了 5000 万美元,押注世界模型和UGC
知乎 2026-03-06 00:00:00
37. 百度打响“O计划” :从搜索到“智能体调度”
知乎 2026-02-10 00:00:00
38. 做AI短片、漫剧的,你们又有救了! 一键复制粘贴就能完成角色一致性,减少学习成本!
哔哩哔哩 2026-04-09 00:00:00
39. #小鹏第二代VLA发布# 小鹏二代VLA,朋友们都说很强,强不强得看实车表现不是吹出来的,这个周末我就会去试驾,到时候给大家分享真实体情况。小鹏VLA2.0,本质上跟华为蔚来的世界模型类似,是小鹏原生多模态物理世界大模型,是全新的物理世界大模型。换句话说:是【VLA跟世界模型的融合】。先说结论:小鹏VLA2.0时刻,将会是小鹏自动驾驶的里程碑时刻,他会使安全接管里程提升50倍,媲美FSD在美国的能力表现。小鹏将会用这套软件去做L4自动驾驶。VLA和世界模型,各有优劣势,而小鹏的做法是对的,把两者结合起来。可以预见一下,小鹏才是那个最终引领自动驾驶路线的企业。✔第一代的VLA,将【视觉感知—语言理解—行动执行】直接关联,把看—懂—做的联系起来。一代VLA依赖语言作为中介,将摄像头雷达看到的东西,转化成语言token(比如红灯,有行人),然后基于语言模型推理规则(比如遇到红灯就要停车,遇到行人横穿马路就刹车),然后输出动作。✔VLA擅长通过语言规则理解复杂场景,决策都是可以被解释的(比如刚才是有锥桶所以停车了),这里说一下,物理世界模型是无法解释所有决策的。✔但是第一代VLA会损失时间和空间上的精度,他没有办法预测物体下一步的运动轨迹是什么,比如前方掉落物体以后,物体的运动轨迹,VLA是不知道的,而世界物理模型可以预测这些。世界物理模型,其实就是自动驾驶大脑对这个真实世界的“建模”,模拟这个世界的运行方式。因为看到VLA这些不足,小鹏推出第二代VLA,其实就是小鹏把VLA和物理世界大模型做结合了。✔小鹏第二代VLA已经不依赖人类语言作为中间媒介了,模型直接学习物理世界的交互规律,通过模仿学习,直接掌握在物理世界中如何开车。✔小鹏汽车第二代VLA,把“L”省掉,直接由视觉输入,直接学习和模仿物理世界,不需要经历语言转译这一步。VLA: 看到红灯—遇到红灯就要停车—停车。二代VLA: 看到红灯—模型—停车✔二代VLA,省去了中间翻译的过程,真正意义上模仿的人类开车。物理模型具有自己思考的能力,不需要人工标注,还能够还原真实物理世界的运行规律。比如VLA可能无法知道前方汽车掉落一个物体落地后第二次反应,而二代VLA世界模型能够根据物体形状方位预测他落地后的轨迹,这是不是更像人了呢?而且小鹏VLA会同时用在汽车,Robot机器人,以及飞行汽车上,这也是小鹏独有的优势。✔小鹏的二代VLA就是自动驾驶的未来,和终局。把真实世界建模,高度模仿人类大脑,最终肯定让小鹏智驾领先行业。小鹏坚持AI已经十个年头,而且具有自研AI芯片的能力,是整个世界自动驾驶领域唯二把AI作为公司立身之本的企业,另一个就是特斯拉。
新浪微博 2026-03-04 00:00:00
40. 复旦铁三角:开辟最优物理AI路径!时空一体世界动作模型问世
知乎 2026-05-31 00:00:00
41. 扭结宇宙学:非交换时空的拓扑起源与量子统计的基础地位 12.0 版本
知乎 2026-04-05 00:00:00
42. 【百度发布文心大模型5.1:搜索能力国内第一,预训练成本仅为业界6%】5月9日,百度正式发布新一代基础大模型文心5.1,已同步在千帆模型广场和文心一言官网上线。该模型采用“多维弹性预训练”技术,总参数压缩至约1/3,激活参数压缩至约1/2,仅以业界同规模约6% 的预训练成本实现了基础能力领先。关键信息:在LMArena搜索榜中,文心5.1以1223分位列国内第一、全球第四,成为唯一上榜国产模型。其Agent能力超越DeepSeek-V4-Pro,创意写作能力与Gemini 3.1 Pro持平,推理能力接近全球领先闭源模型。此前用预热版本就已在文本榜展现竞争力,上榜后更是超越GPT-5.5。百度千帆平台和文心一言官网已同步上线模型,面向企业用户和开发者开放体验。Create 2026百度AI开发者大会将于5月13日至14日在北京举行,届时将披露更多技术细节与商业化规划。观察:通过“多维弹性预训练”技术,百度打造出全球首个千亿以内参数、搜索与文本水平就达到业界顶尖的模型,为国产大模型的普惠化与商业化应用提供了新路径。#百度##文心大模型5.1##LMArena##国产AI#
新浪微博 2026-05-09 00:00:00
43. 百度上线文心5.0,模型参数2.4万亿,采用原生全模态统一建模技术,具备全模态理解与生成能力,支持文本、图像、音频、视频等多种信息的输入与输出。这是老罗数字人的表现。文心5.0以1460分位列LMArena文本榜国内第一、全球第八,超过GPT-5.1-High、Gemini-2.5-Pro等多款国内外主流模型。 兔撕鸡大老爷的微博视频
新浪微博 2026-01-22 00:00:00
44. 上交一篇VLA结合世界模型的工作VLA-World:利用短程场景生成做反思推理
微信公众号 2026-04-17 00:00:00
45. 百度的「倒金字塔」,如何重构 AI 价值链
知乎 2025-12-23 00:00:00
46. 时空涌现的费米统计起源:基于反对称关联的统一框架,9.0 导师修改意见版
知乎 2026-03-24 00:00:00
47. 002-AI引爆短视频创作革命(短视频创作者必备的能力)
微信公众号 2026-03-16 00:00:00
48. 【#全球用户涌入中国AI视频生成模型#AI“技术平权”加速:#1人剧组时代或将来临#】近日,字节跳动正式上线新一代视频生成模型Seedance2.0,并接入旗下生成式AI创作平台即梦以及豆包App。这款视频生成模型发布后,凭借逼真的画面效果与简易的创作方式迅速走红。用户只需要输入简单的文字、图片或者视频素材,就能生成几秒甚至十几秒的视频。在海外社交平台上,美国企业家埃隆·马斯克转发演示并评论称,这一模型“进展太快”。业内人士介绍:“每天都有很多用户来体验,甚至有很多外国朋友自带翻译软件来学习怎么用。”一些外国用户在实测后也惊叹,该模型能够彻底改变电影制作。 据了解,Seedance2.0在训练阶段就用了大量东方美学的素材,而且它在镜头语言的控制、复杂的交互呈现上也有非常强的能力。宋东桓是一名AIGC内容创业者,近日他也在测试Seedance 2.0,并已将它应用于电商短视频制作。在他看来,与此前的模型相比,Seedance 2.0在连续分镜生成、语音还原、表情演绎、动作控制以及镜头调度等方面都有明显提升。过去的AI影视仍需要进行剪辑和配音等后期环节,如今不少流程都可以一次性完成。多位业内人士表示,AI视频生成技术的升级正在加速“技术平权”。“也许我们能一天做出一个90分钟电影来。”业内分析认为,AI视频生成模型的升级,将进一步推动AI漫剧、短剧以及互动影视等细分领域加速发展,尤其是漫剧市场规模有望实现快速增长。清华大学新闻与传播学院人工智能学院双聘教授沈阳:“一人公司、一人剧组慢慢会成为一个潮流。”#中国AI改变电影制作让老外惊叹# http://t.cn/AXtJDEhr
新浪微博 2026-02-15 00:00:00
49. 刚刚,创智+模思发布开源版Sora2,电影级音视频同步生成,打破闭源技术垄断
微信公众号 2026-01-29 00:00:00
50. #互联网技术[超话]##个重磅信号!#黄仁勋 #AI #人工智能#机器人 #自动驾驶 #CES2026 #英伟达#新年演讲# 黄仁勋在2026年CES展会上的新年首场演讲,以"物理AI"为核心主题,宣告人工智能正式迈入从理解数字世界到改造物理世界的新阶段。以下是演讲的核心内容整理: 一、时代定调:双重平台转移开启AI新纪元 黄仁勋指出,计算机行业正经历十年一遇的"平台重置",同时发生两大平台转移:一是应用程序全面构建于AI之上,软件开发从"编程"转向"训练",运行载体从CPU迁移至GPU;二是软件的开发与运行逻辑彻底革新,AI应用不再是预编译的固定程序,而是能理解上下文、实时生成内容的智能系统。这一变革正驱动全球价值约十万亿美元的计算机基础设施进行现代化改造。 二、物理AI的ChatGPT时刻已至 物理AI成为演讲的核心焦点。黄仁勋认为,AI的演进可以分为四步:感知AI、生成AI、代理AI、物理AI。当模型能够理解重力、摩擦、惯性、动量守恒等物理定律,AI才能真正走出屏幕,进入物理世界执行任务。 支撑物理AI战略的三大技术支柱已全面成型: Newton物理引擎:实现低于0.01秒的实时物理计算响应 Cosmos基础模型平台:以1000亿参数达成1毫秒级推理延迟,支持多模态物理世界理解 GPU+LPU混合架构:算力效率提升100倍,成本降低90% 三、Rubin计算架构全面量产 英伟达推出新一代Vera Rubin计算架构(简称Rubin架构),该平台已进入全面量产阶段。Rubin架构通过CPU与GPU协同设计,AI训练性能较前代Blackwell提升3.5倍,推理性能提升5倍,token生成成本最高降低10倍。该架构包含六款全新芯片:Vera CPU、Rubin GPU、NVLink 6 Switch、ConnectX-9 SuperNIC、BlueField-4 DPU和Spectrum-X以太网交换机。 四、自动驾驶与机器人突破 自动驾驶领域:英伟达发布全球首个开源端到端AI系统Alpamayo,这是业界首个具备思考推理能力的自动驾驶AI模型。2025款梅赛德斯-奔驰CLA将首发搭载该技术,计划2026年第一季度在美国上路,随后推广至欧洲和亚洲市场。 机器人领域:黄仁勋宣布"机器人领域的ChatGPT时刻已经到来"。英伟达发布了专为人形机器人设计的Isaac GR00T N1.6视觉语言行动模型等开源工具,同时推出Cosmos Reason 2推理型视觉语言模型。特斯拉Optimus人形机器人已通过Omniverse数字孪生平台完成90%以上的训练,自主运行比例达85%,2026年第一季度将实现5万台量产,成本降至2万美元以下。 五、开源生态战略加速 黄仁勋强调,开源模型与前沿闭源模型的差距已缩短至约6个月,且仍在持续缩小。英伟达不仅开源模型,还开源用于训练这些模型的数据,以建立真正的"系统信任"。现场展示的多款开源模型包括三家中国开源模型:Kimi K2、Qwen和DeepSeek V3.2。黄仁勋特别提到,DeepSeek R1的出现意外推动了整个行业的变革进程。 六、全栈AI体系构建 英伟达的角色已从芯片供应商转变为"全栈AI体系"的构建者。通过"三台计算机"的架构——训练(DGX超级计算机)、仿真(Omniverse与RTX)、推理(AGX系列边缘设备),英伟达构建了从云端训练到现实部署的完整闭环系统。同时,通过开源模型、数据及NeMo开发库,英伟达正推动技术民主化,让更多开发者和企业能够参与到物理AI的创新浪潮中。 黄仁勋在演讲结尾强调,物理AI的落地将重塑全球千万家工厂与数十万个仓库的运作逻辑,开启AI与实体经济深度融合的新时代。 http://t.cn/AXb9Z9MM
新浪微博 2026-01-07 00:00:00
51. #小米汽车发布世界模型全新框架#小米汽车发布全新世界模型框架Xiaomi Auto World Model,首次将三维重建与视频生成深度耦合,打破行业“重建、生成独立”路线。重建提供几何锚点保证稳定,生成补充观测外内容提升真实,实现高稳定性、一致性和真实性。这个框架在Waymo、nuScenes等主流测试中全面取得SOTA,已落地于合成数据、仿真测试和智能座舱等业务场景#大v聊车#
新浪微博 2026-05-26 00:00:00
52. 李飞飞3D世界模型爆火后,国内首个免费版来了:我当了回「为所欲为」的造物主
微信公众号 2025-12-22 00:00:00
53. 智能的核心在于学习与感知,而非表层的模仿与生成。大语言模型的生成能力,本质是基于海量文本的概率性拼接,虽能输出契合人类语言逻辑的内容,却无法真正理解文字背后的物理意义、因果关联与现实场景。跳出语言文本的局限,转向对物理世界的感知,从单一模型迈向多元架构,才是AI的未来之路。
新浪微博 2026-01-04 00:00:00
54. 004-AI短视频的准备工作(创作AI短视频的基本流程)
微信公众号 2026-03-16 00:00:00
55. 小云雀短视频智能体,一站式打造专属短视频
微信公众号 2026-01-03 00:00:00
56. GAN之父Ian Goodfellow病后归来,剑指高效世界模型
微信公众号 2026-03-07 00:00:00
57. 【京东开源JoyAI-Echo长音视频生成框架:对话式编辑,迈入全球第一梯队】6月3日,京东正式推出JoyAI-Echo长音视频生成框架,采用四项技术创新,实现“对话式编辑”功能,宣称已进入全球第一梯队。关键信息:评测集涵盖3000个镜头,语音内容准确率0.8646,81.7%用户认为其音频质量更优。代码与权重已全部开源,GitHub正式上线。该框架可覆盖虚拟故事创作、数字人直播、品牌营销等多种场景。观察:京东将自研AI视频能力以开源形式开放,意图在长视频生成赛道建立技术影响力,为数字内容产业提供新的基础设施。#京东 #AI视频生成 #JoyAI-Echo #开源框架 #大模型#
新浪微博 2026-06-04 00:00:00
58. #seedance2.0和kling3.0视频对比#海外网友做了字节的Seedance 2.0 和快手的 Kling 3.0 两个视频AI的对比,使用相同基础图像和提示生成多镜头视频,展示科幻、动作等场景的并排结果,以公平评估模型性能。这个视频包含10组镜头对比,突出运动连贯性、物理模拟和细节渲染 无心简影的微博视频
新浪微博 2026-02-15 00:00:00
59. 不管如何,我认为目前仍然是OpenAI的chatGPT在核心智能上是最强的,因为图中这道变分题仍然只有它能解出来chatGPT 5.5只用了12分钟(之前分别是5.2 (55m), 5.4(36m)),而现在无论是Gemini还是DS都做不出来。目前生成图上面,可控性也比之前好了许多,见图2,虽然拓扑上仍然没全对,但好了许多(图3为Gemini生成,就要差一点)。我相信这种水准的可控性已经可以满足我画图的所有需要了。
新浪微博 2026-04-24 00:00:00
60. 主流大模型关于内容生成有幻觉的提示。千问:内容由千问AI生成,仅供参考。腾讯元宝:内容由AI生成,仅供参考DeepSeek:内容由AI生成,请仔细甄别。百度文心:内容由AI生成,仅供参考。讯飞星火:内容由AI生成。天工:内容由AI生成,不能保证真实。Gemini:Gemini的回答未必正确无误,请注意核查。ChatGPT:ChatGPT也可能会犯错。请核查重要信息。
新浪微博 2026-01-30 00:00:00
61. 百度文心一言5.0
知乎 2026-05-22 00:00:00
62. 文心一言(文心5.0)深度解析
微信公众号 2026-03-29 00:00:00
63. 文心一言4.0重磅更新
知乎 2026-05-28 00:00:00
64. 文心 ERNIE 5.0 技术报告解读
微信公众号 2026-02-07 00:00:00
65. 文心一言深度解析
百度 2026-02-14 00:00:00
66. 百度文心助手与文心一言有何区别?技术迭代方向在哪?
今日头条 2026-01-27 00:00:00
67. 百度文心一言4.0正式上线
微信公众号 2026-03-01 00:00:00
68. 李飞飞定义世界模型三大功能
网易 2026-06-05 00:00:00
69. 李飞飞厘清世界模型分类 模拟器才是行业核心枢纽
今日头条 2026-06-05 00:00:00
70. 李飞飞厘清世界模型定义 仿真器才是核心支柱
今日头条 2026-06-05 00:00:00
71. 李飞飞最新长文解析,什么才是真正的世界模型?| 硬核拆解
微信公众号 2026-06-05 00:00:00
72. 什么是世界模型?李飞飞三个词讲明白了
哔哩哔哩 2026-06-05 00:00:00
73. 世界实验室李飞飞谈如何构建大型世界模型
哔哩哔哩 2026-06-06 00:00:00
74. 百度文心一言5.0发布,中文能力超越GPT-5
微信公众号 2026-05-14 00:00:00
75. 百度 文心一言 5.0 正式版 测评
微信公众号 2026-01-23 00:00:00
76. 文心5.0正式版发布,霸榜LMArena的“最强文科生”到底强在哪?
知乎 2026-01-24 00:00:00
77. 世界模型专题研究
知乎 2026-05-06 00:00:00
78. 百度发布文心大模型5.0正式版,具备全模态理解与生成能力
今日头条 2026-01-22 00:00:00
79. 2.4万亿参数原生全模态大模型,文心5.0正式版上线
知乎 2026-01-22 00:00:00
80. 看完这份报告我终于懂了什么叫“原生全模态”
什么值得买 2026-02-08 00:00:00
81. 超越GPT-5?百度文心5.0炸场发布,登顶全球数学榜
知乎 2026-01-22 00:00:00
82. 百度AI收入直接过半!文心一言4.0上线,国产AI这下彻底翻身了
今日头条 2026-05-21 00:00:00
83. 豆包、文心一言、Kimi信源偏好差异实测
微信公众号 2026-05-28 00:00:00
84. DeepSeek vs ChatGPT vs 文心一言
今日头条 2026-05-06 00:00:00
85. 文心一言 vs Kimi
微信公众号 2026-04-03 00:00:00
86. Kimi、千问、文心一言、智谱清言,谁才是中文AI写作之王?
今日头条 2025-12-17 00:00:00
87. 文心一言
微信公众号 2025-12-26 00:00:00
88. 视频生成模型离世界模型有多远?从“相关性模仿”到“因果性理解”的鸿沟
微信公众号 2026-02-16 00:00:00
89. 百度重磅发布!文心一言6.0实现多模态一体化,8K视频+3D模型一键生成
微信公众号 2026-03-26 00:00:00
90. “HFD-QG启发的世界模型引擎”置于城市道路自动驾驶这一极端复杂的物理和社会场景中
微信公众号 2026-01-02 00:00:00
91. 文心一言5.0正式发!多项性能超越GPT-4o
今日头条 2026-05-04 00:00:00
92. 李飞飞最新长文:当视频生成、机器人和NVIDIA都自称世界模型,我们需要一个分类法
今日头条 2026-06-06 00:00:00
93. DreamWorld: Unified World Modeling in Video Generation
知乎 2026-03-08 00:00:00
94. 世界模型成 AGI 共识方向:李飞飞估值 50 亿,杨立昆融资 10 亿
微信公众号 2026-04-03 00:00:00
95. 上海AI lab:因果干预纠正扩散模型物理幻觉
小红书 2025-12-24 00:00:00
96. 《多模态大语言模型技术发展报告》正式发布 | 中科算网算泥社区
微信公众号 2026-02-05 00:00:00
97. 李飞飞长文拆解世界模型实现路径
网易 2026-06-04 00:00:00
98. 李飞飞都下场了,这事儿不简单:世界模型成 2026 最火风口
今日头条 2026-04-01 00:00:00
99. 腾讯混元&浙大&南航开源端到端视频音效生成模型HunyuanVideo-Foley,解锁视频“声临其境”新境界。
微信公众号 2026-02-02 00:00:00
100. 从文心5.0技术报告聊聊什么是原生多模态?
小红书 2026-02-06 00:00:00
101. 建议收藏|一文读懂「世界模型」
小红书 2025-12-17 00:00:00
102. 2026年中文大模型横向测评:DeepSeek vs 文心一言 vs 通义千问,谁更适合你的真实场景?
微信公众号 2026-04-09 00:00:00
103. 世界模型爆发!李飞飞开源渲染神器,阿里发布"快乐生蚝",AI正从数字走向物理世界
微信公众号 2026-04-19 00:00:00
104. 每天一个AI大模型——文心一言Turbo
微信公众号 2026-01-28 00:00:00
105. World Model is A Mess!世界模型已经被营销裹挟?
知乎 2025-12-30 00:00:00
106. 世界模型(World Models)
今日头条 2026-05-16 00:00:00
107. 世界模型的定义与物理引擎探索 #世界模型 #物理引擎 #AI游戏 本文主要介绍了世界模型的基本定义及其与视频模型的区别。世界模型需要理解当前状态下所有可能性及结果,并能够根据用户的操作生成新的状态与画面,远比传统的视频模型复杂。 在具体应用上,世界模型具有准确模拟物理规律和材料互动的能力。例如,如果要创建某种材料,模型需要能处理材料之间的相互作用,这种互动成为实现更真实模拟的重要因素。 作者还分享了个人通过PyTorch写物理引擎的经历,强调虽然方法简陋但有助于明白数据生成及训练过程,从而更好理解世界模型关键的设计原则和实现难点。
抖音 2025-12-15 00:00:00
108. 教育垂直大模型落地校DeepSeek、文心一言定制化升级,多模态交互解锁教与学新体验!!!
微信公众号 2026-04-30 00:00:00
109. 《文心一言×百家号:AI赋能内容创作全流程进阶操作手册》
微信公众号 2026-04-14 00:00:00
110. 刚刚,李飞飞亲自下场定义世界模型
微信公众号 2026-06-04 00:00:00
111. 李飞飞:世界模型的功能分类
知乎 2026-06-05 00:00:00
112. 世界模型四大范式:规划器、模拟器、合成器、动作模型
微信公众号 2026-04-21 00:00:00
113. “AI教母”李飞飞深夜发文:所有人都在造“世界模型”,但根本不是同一件事
微信公众号 2026-06-04 00:00:00
114. 从办公到创作:WPS AI、千问、文心一言、豆包,一文讲清怎么选!
今日头条 2026-05-22 00:00:00
115. 2026年AI大模型横评:GPT-5、Claude 4、文心一言4.0谁更值得用?
今日头条 2026-04-06 00:00:00
-
罗永浩怒斥电视机厂商:不毁灭没天理!170 541 -
评论有奖|这几件夏季洗护小事全网愣是争了好几年,今天一次性说清楚150 378 -
快把随手买的套套扔掉!赤尾这三款王炸,解锁情侣完美亲密体验226 143 -
实测3款国产热销套套,赤尾真正打破国外技术垄断了吗?219 124
已收藏
去我的收藏夹