VLM的3D空间认知升级:AI离真正理解现实世界还有多远?
06-09 16:38
精选参考来源
精选参考来源
1. 如果AI的终极形态不是在屏幕里,而是在现实世界里替人类干活。 你觉得下一个爆发点会先出现在机器人,自动驾驶,还是医疗?#大咖观察 #红衣聊AI #科技 #人工智能 #黄仁勋
抖音 2026-01-07 00:00:00
2. VLA不够了?触觉,将改写具身智能新格局
微信公众号 2026-05-06 00:00:00
3. 3月17日,基座模型负责人詹锟在2026GTC大会上发布了新一代自动驾驶基础模型MindVLA-o1咱们先大概了解一下这套模型:理想 3D ViT:从视频流直接还原完整 3D 空间、位置、语义、运动用激光雷达做几何提示,融合语义 + 3D 感知用前馈 3DGS 拆分静态 / 动态物体,预测未来状态类比人类:先补好 “0 6 岁空间认知”,再学开车。多模态思考:不只看,还会 “想” 和 “推演”不只靠语言逻辑,还要空间想象 + 未来预测先理解现在,再推演接下来会发生什么这样说吧,以前很多自动驾驶,说白了就是看2D视频学开车,跟我们对着屏幕学开车再上路一样,容易出错。而MindVLA-o1的核心就是3D ViT+多模态思考,既能还原真实的3D空间,知道哪里有东西、能不能撞,还能预测未来路况,相当于给车装了个“人类大脑”,会“思考了”!它不光能看,还会想、预判。当然这背后离不开算力支撑,理想马赫100芯片算力暴涨,才能扛住3D模型的高计算量。马赫 100 在标准矩阵乘算力上较上一代居然提升约 3 倍!最让我惊讶的是这套模型不只是用来开车的!同一套VLA模型、数据系统,既能控制汽车,还能控制机器人,可以用来训练不同形态的物理智能体。自动驾驶居然只是个起点!这次也透露出了理想的目标很明确:打造“硅基人”!让AI像人类一样有感知、会行动、能思考。现在这套AI框架已经成型,从数据采集到模型训练,再到仿真测试,一套打通,未来还能用到各种物理设备上。现在看来,我终于明白厂长之前为什么说即将到来的全新理想L9是具身智能机器人的开山之作了!#李想称机器人也用VLA##理想全能辅助驾驶来了##理想发布下一代自动驾驶基础模型#
新浪微博 2026-03-18 00:00:00
4. 击败谷歌、英伟达!清华陈建宇×斯坦福Chelsea团队世界模型Ctrl-World具身能力登顶全球
微信公众号 2026-02-26 00:00:00
5. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能
抖音 2026-01-24 00:00:00
6. 理想亮牌:VLA,是物理AI时代的入场券
微信公众号 2026-03-21 00:00:00
7. 一模双擎三端破局:灵境引擎3.0开启具身智能的「物理真实」训练新范式
知乎 2026-05-28 00:00:00
8. 具身智能产业成为大国博弈新赛道
微信公众号 2026-02-06 00:00:00
9. 黄仁勋最新访谈(3/3):3-5年后,机器人会到处都是,中国的优势非常明显#黄仁勋 #英伟达 #Ai #机器人 #自动驾驶
抖音 2026-03-26 00:00:00
10. 当机器人学会「看」和「说」之后,如何让它们真正拥有「手感」?
微信公众号 2026-05-07 00:00:00
11. 李想在B站新一期的发布视频里称:“MindVLA-o1具备3D ViT+多模态思考能力,让车真正具备理解3D空间的能力。同一套VLA模型,既可以控制车辆,也可以控制机器人,自动驾驶只是物理AI的起点。长远看,物理世界AI的终局是构建一个“硅基人”,让系统像人类一样具备完整的感知和行动能力。”物理AI?物理世界AI?美滋滋…很高兴看到理想汽车也切换到世界模型。#李想称机器人也用VLA##理想发布下一代自动驾驶基础模型##李想回应AI时代的焦虑
新浪微博 2026-03-18 00:00:00
12. 对话曹旭东:把智驾带进物理AI时代
知乎 2026-04-27 00:00:00
13. 用英伟达方案的1/10成本,造出一只接近“生命体”的机器狗
哔哩哔哩 2026-05-18 00:00:00
14. 当AI开始懂物理世界这才叫真智能Momenta R7强化学习世界模型正式发布,各位,物理AI量产上车啦!智能辅助驾驶终于从“看见世界”迈入“理解世界”的全新阶段!!!#MomentaR7强化学习世界模型##MomentaR7物理AI##Momenta##北京车展# 一雪的微博视频
新浪微博 2026-04-27 00:00:00
15. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与
微信公众号 2026-03-08 00:00:00
16. 机器人模型R1时刻!不只学动作更学会物理推理,LIBERO 99.9%
知乎 2026-05-11 00:00:00
17. 阿里这次出招具身智能,剑指深度环境理解力
知乎 2026-02-10 00:00:00
18. #雷军公布小米机器人最新进展##小米发布机器人基座模型#就在刚刚,我米技术对外发布开源VLA模型Xiaomi-Robotics-0,该模型有47亿参数,兼具视觉语言理解与高性能实时执行能力,刷新多项SOTA。采用MoT架构,大脑VLM理解人类指令、捕捉空间关系,小脑Action Expert生成平滑动作,训练上采用两阶段法,先跨模态预训练,再后训练,解决真机动作断层等问题。在测试中,在仿真测试和现实真机任务中表现优异,保持了VLM多模态理解能力,将模型开源,有望推动机器人在工业、服务业、家庭等场景的应用,加速具身智能落地,相信很快就会运用在更多的生态产品上。 而Xiaomi-Robotics-0机器人基座模型,Benchmark全面超越OpenVLA和Pi,跻身行业第一梯队,结合近期Mimo等成果,我米AI成长迅猛,且开源VLA与触觉模型,构建完整手脑技术栈,务实推进,为机器人商用铺路。
新浪微博 2026-02-12 00:00:00
19. 击败主场霸主英伟达与PI!千寻智能登上具身智能「奥林匹克」最高领奖台
微信公众号 2026-06-03 00:00:00
20. 光轮智能与谷歌、英伟达共同定义物理AI仿真标准
微信公众号 2026-05-12 00:00:00
21. 詹锟在GTC上分享了理想目前智能驾驶方面的进展,最关键的一点就是最新的VLA模型——MindVLA-o1,基于统一 Vision Language-Action 的 Omni 架构,在单一Transformer 中联合建模感知、推理与控制。主流 VLA 方案的三大局限性(图二):①3D 视觉 / 语言与动作对齐慢,延迟高②长尾场景数据无法规模化,真实世界长尾场景数据采集成本高、覆盖不全,模型泛化差③VLA 模型参数量大、推理重,车端算力无法支撑那么理想的VLA是怎么解决这些的呢?(图三)多模态输入——MindVLA-o1-MoE(快慢思考)——Action Output(输出轨迹)※多模态输入采用了3D 视觉基座,让其自主学习 3D 空间语义,减少了大量的人工标注数据,模态在同一表示空间获得更高效率和更强泛化能力※新增了一个Latent World Model(潜在的世界模型),将输入图像编码为潜在 Token再重构,去模拟未来一下秒的关键画面,比如这一帧进去的图片是“右侧车辆偏压线”(To),模型预判 “右侧车辆会强行加塞”,并推理两种动作:直接行驶 → 碰撞(To+1)。立即左避 → 安全(T'o+1),去提前选择安全动作,解决长尾场景下的决策难题(图五)※多模态输入进模型以后,会将语言指令会通过3.2B的MOE模型,做 CoT(思维链)推理,同时将其他视觉特征则生成动作 Token,最后生成稳定轨迹,减少了推理时间※构建强化学习框架让模型在真实和模拟环境中学习探索,反补世界模型做技术升级,优化驾驶策略(图七)。※面向端侧大模型的软硬件框架,提升端侧 VLA 模型设计和部署效率,换句话说Orin和Thor还会有一定的升级(图八)自动驾驶系统逐渐演化成通用物理世界基础模型,可控制车辆、机器人和机械臂,还能生成具身智能训练数据,未来将驱动各种物理系统,具身 AI 将走进人们生活。#懒博小课堂##微博新知##理想L9#
新浪微博 2026-03-17 00:00:00
22. 商汤SenseNova U1:原生多模态统一模型的范式革命
知乎 2026-05-05 00:00:00
23. 在昨天的NVIDIA GTC 2026上,詹锟代表理想发布了下一代自动驾驶基座模型MindVLA-o1。我们在底层实现了一个核心突破:原生3D ViT——真正的三维视觉编码器。我们在尝试解答一个问题:人类开车看上去没那么难,每个普通人都能把车开得又快又稳,但全世界最顶尖的企业砸了几千亿进去,自动驾驶仍然进展缓慢。问题到底出在哪?我们一直在教AI做成年人的事,但从来没让它当过小孩。人类在0到6岁的阶段学会了走路,学会了扔球、接球。看起来只是简单的动作,但实际上已经帮助孩子建立了对三维物理空间的理解。这就是为什么我们能精准测距、稳定驾驶,因为“3D预训练”6岁前就完成了。但今天所有的端到端系统本质上都是“看2D视频学开车”,更像是一个人坐在电脑前看了十万小时行车记录仪,然后直接上路。它有了智能,但离人类的智能程度差得远。过去我们和行业使用的BEV把世界从俯视角拍扁,丢失了高度信息;OCC确实是3D的,但缺失了语义信息。物理AI缺的不是更大的模型、更多的数据,而是一个能真正理解3D世界的视觉基础。3D ViT解决了这个问题。不再是从2D“还原”3D,而是让模型一开始就工作在真实的三维世界里。以高分辨率多视角视觉为核心,在编码阶段直接完成对3D空间几何和语义的统一理解——空间结构、位置关系、语义信息,一次完成。模型不只是看见画面,而是理解世界,既知道它在哪,也知道它是什么。在这个体系下,激光雷达的角色变了。它不再是感知的核心,而更像一把高精度的尺子,为视觉提供几何标定和近场空间约束。真正决定感知上限的,不是传感器的物理线数,而是模型的表征能力。在统一建模下,3D ViT可以稳定感知并推理到500米以上的空间范围。这件事以前不是没人想做,是做不到,因为3D ViT对车端推理算力提出了极高的要求。我们自研的马赫芯片,单颗有效算力是上一代的3倍,能把这套架构真正放进车里。有了3D ViT打底,MindVLA-o1把空间理解、思考推理、驾驶行为统一在一个模型里。不光看见世界,还能在隐空间里模拟未来几秒的场景变化,想清楚再开。我们把这种能力称之为多模态思考。我们也已经进行了验证,这套基座模型不只是为自动驾驶设计的。同一套VLA基座模型,能开车,也能控制机器人,它正在逐渐演化成一个通用的物理世界智能体。自动驾驶,只是物理AI的一个起点。
新浪微博 2026-03-18 00:00:00
24. #科技先锋官# AI 界又出现掀桌子的新突破了!英伟达联手斯坦福搞出大动作,让 AI 彻底告别只会画饼,可以直接搭建能触摸的物理世界!更颠覆的是,传统机器人训练靠真机试错,成本高、周期长还易翻车,这个模型却能打造超真实虚拟训练场,让机器人在虚拟世界反复练,一天抵人类几百年训练时长,还能精准理解视觉与指令关联。以往 AI 不过是生成平面画面的画家,而 3D 通才世界模型仅凭一段文本,就能造出带真实材质、光影的高保真 3D 交互环境,还能补全自动驾驶极端场景数据、助力医疗个性化治疗、降低元宇宙创作成本,跨行业颠覆玩法!想知道这个模型如何打通虚拟与现实,解锁未来科技新可能吗?#微博超有用视频大赛##上微博涨知识##AI生活指南# 种斌Marco的微博视频
新浪微博 2026-01-26 00:00:00
25. 深度|2026具身智能的关键分水岭:谁将重新定义“通往物理世界的模型层”?
微信公众号 2026-03-27 00:00:00
26. SenseNova U1开源:8B参数原生统一多模态模型
知乎 2026-05-07 00:00:00
27. 小鹏押注“物理AI”
知乎 2026-02-04 00:00:00
28. 三巨头罕见同投一家具身智能
知乎 2026-01-13 00:00:00
29. #何小鹏说机器人靠模仿人才能学会走路# 不断跳出语言桎梏!#2025腾讯ConTech大会# 上何小鹏强调,语言框住大模型,物理模型重感知触觉!机器人习得行走能力,不能依赖纯数据,通过模仿人类多模态体验,才能真正掌握技能,未来的机器人将通过不断的学习模仿更加智能化!#智变之时# 苏汶涛的微博视频
新浪微博 2025-12-18 00:00:00
30. #科技先锋官# 当AI从数字空间走向实体世界,物理AI正成为科技巨头的竞逐核心。这种融合物理规律与智能算法的技术,让机器具备理解重力、摩擦等现实法则的能力,在机器人、自动驾驶等领域掀起革命。海内外巨头们的技术突破与落地案例,正勾勒出物理AI的普及路径。英伟达以平台化优势领跑,推出Cosmos世界基础模型平台,通过生成式AI产出高逼真合成数据,大幅降低物理AI训练成本。该平台可模拟雪天路况、仓库拥堵等复杂场景,已被Uber、小鹏汽车等企业采用,助力自动驾驶与机器人开发。其研发的可视化令牌器,将视频处理速度提升12倍,为物理AI的高效运算提供核心支撑。特斯拉将物理AI深度融入Optimus机器人,通过端到端神经网络与压力反馈机制,把动作精度提升50倍,焊接误差控制在0.1毫米内,已在电池分拣环节试用。国内阵营中,优必选推出热插拔自主换电系统,让机器人实现7×24小时连续作业,获比亚迪等企业订单,年交付量超500台。宇树科技、智元机器人等则在运动控制领域突破,完成人形机器人前空翻、跨省行走等极限挑战。2025年物理AI加速集中在三大方向仿真训练平台构建、高精度运动控制、多场景环境适配。2026年随着技术成熟,物理AI正从实验室走向工厂、家庭,开启智能实体赋能现实的新时代。#AI创造营##AI创作热点##一分钟视频创作季# 种斌Marco的微博视频
新浪微博 2026-01-04 00:00:00
31. 智驾龙头鏖战物理AI,基座模型成了“银子弹”
微信公众号 2026-05-06 00:00:00
32. 【#理想全能辅助驾驶来了# 】3月17日,理想汽车基座模型负责人詹锟在2026GTC大会发布下一代自动驾驶基础模型MindVLA-o1。该模型具备3D ViT+多模态思考能力,能够让车真正具备理解3D空间的能力。据了解,传统的BEV(鸟瞰图)只有2D信息,OCC(占用网络)虽然是3D的,但缺少语义信息,都缺乏对三维空间的理解和与语言的深度对齐。此次理想汽车的方案则是通过视频流,直接还原3D的空间、位置、点云、语义和像素。李想通俗地比喻道,“人类在很小的时候,通过反复训练,形成了对空间的准确把握。比如很小的时候接不住球,但一次次扔,通过大脑训练,眼睛还是那个眼睛,但对球速、距离的判断就越来越准,也不再摔跤了。” 浪涨科技的微博视频
新浪微博 2026-03-18 00:00:00
33. 万亿具身智能赛道,被数据卡住了
微信公众号 2026-04-09 00:00:00
34. 对话戴盟机器人王煜:做好人形机器人的灵巧操作,要先「对齐」触觉数据 | ICRA 2026
微信公众号 2026-06-05 00:00:00
35. 理想汽车的MindVLA模型不止于自动驾驶!在英伟达GTC大会上,理想展示了用同一套模型控制机械臂倒饮料的画面,真正实现了视觉、语言、行动的统一。这或许就是通往通用物理世界基础模型的起点,未来可期!#理想汽车##具身智能##自动驾驶# 大D有态度的微博视频
新浪微博 2026-03-17 00:00:00
36. CES 2026前瞻:英伟达或重塑物理AI,中美韩机器人齐“秀肌肉”
知乎 2026-01-04 00:00:00
37. #科技先锋官# 机器人与实时视觉正成为全球AI技术竞争的核心赛道,各大巨头纷纷加码布局,通过多模态融合、本地智能升级、感知体系革新等创新方向。这一突破重构了机器人的环境交互能力,更拓宽了AI在工业、服务、创意等多场景的应用边界。谷歌DeepMind的创新极具颠覆性,其发布的Gemini Robotics On-Device实现关键突破,成为首个可在机器人本地独立运行的视觉-语言-动作模型。该模型摆脱云端依赖,通过多模态Transformer架构深度融合视觉感知、语言理解与动作规划,响应延迟降至毫秒级,弱网环境下任务完成率超95%,仅需50-100次演示即可让机器人掌握新技能,大幅降低部署成本。OpenAI则通过o3/o4-mini多模态模型强化视觉推理能力,实现带图思考的全新范式,能将图像融入思维链,在医学影像分析、图表解析等场景展现出精准的视觉理解与决策能力。腾讯鸿元发布HY-Motion 1.0模型,聚焦高质量3D动作生成,为机器人实时动画、虚拟人交互提供核心技术支撑;智谱与华为联合推出的GLM-Image多模态模型,在图像生成与编辑领域实现突破,适配国产算力底座。行业层面,DA3通用三维视觉模型、OpenTau开源训练平台等技术的涌现,正推动机器人视觉从多模型适配走向统一化、轻量化,为产业规模化落地奠定基础。#AI生活指南##一条vlog回顾2025##AI创造营# 种斌Marco的微博视频
新浪微博 2026-01-16 00:00:00
38. 最近能够和人隔网对拉网球的机器人,据说也要出现了。隔着球网要通过传感器感知,并判断对面人类打过来的球,它的速度,位置,旋转,甚至增加温度和风速的信息,判断弹跳,进行回球的决策。这很难,因为它非常考验机器人对于真实物理世界的理解。3 月 17 日 2026GTC 大会上,理想汽车基座模型负责人詹锟发布下一代自动驾驶基础模型 MindVLA-o1,这款模型的亮相直接打破了自动驾驶与物理世界 AI 的技术边界,也让理想对物理 AI 的布局清晰落地 —— 自动驾驶只是起点,同一套 VLA 模型未来将打通车辆与机器人的控制体系,真正实现物理世界 AI 的通用化。MindVLA-o1 的核心突破在于搭载 3D ViT + 多模态思考能力,尝试解决AI对3D空间理解的核心痛点。此前绝大多数视觉训练基于二维图像,AI 仅能识别语义却无法感知真实物理空间的结构,如同靠视频学开车。MindVLA-o1 让车具备理解三维空间的能力,通过激光雷达点云结合 3D ViT 编码,拆分静态背景与动态物体分别建模,还能通过预测式隐世界模型,在行动前推演未来几秒场景演化,像人类一样提前 “预判” 路况,有点类似于打网球的机器人。这背后是理想对物理世界 AI 的深层思考:物理 AI 的终局是构建具备完整感知与行动能力的 “硅基人”,其融合视觉、语言、行动的 VLA 架构,不仅能精准控制车辆,还能直接跨界应用于机器人控制,比如机械臂操作等场景,毕竟理想马上也要进入具身智能领域了。#李想称机器人也用VLA##理想全能辅助驾驶来了##理想发布下一代自动驾驶基础模型#
新浪微博 2026-03-18 00:00:00
39. 中国具身屠榜全球!10万小时数据炸场,PI、英伟达集体破防
知乎 2026-04-12 00:00:00
40. SemiAnalysis GTC深度解读:三款新系统背后,英伟达正在重新定义AI基础设施的边界
知乎 2026-03-24 00:00:00
41. AI+CV博士论文 | UCLA 2026 | 利用空间智能构建世界模型 150页
微信公众号 2026-05-24 00:00:00
42. 清华腾讯最新突破
微信公众号 2026-04-09 00:00:00
43. 突破 2D 限制!Think3D 开源,将 3D 重建接入视觉大模型思维链,VLM 空间推理性能显著提升
知乎 2026-01-26 00:00:00
44. Perceptio
知乎 2026-05-06 00:00:00
45. 外挂3D引擎也救不了LLM空间推理?研究揭示前沿大模型视觉感知盲区,准确率仅62.5%
知乎 2026-04-01 00:00:00
46. 【多模态大模型】清华&字节重磅突破!视觉生成解锁“类人空间推理”,彻底补齐大模型物理短板!
微信公众号 2026-05-20 00:00:00
47. VL模型的视觉推理能力 还不如 三岁小孩 ?
小红书 2026-01-15 00:00:00
48. DeepSeek开源多模态模型 视觉原语重构AI推理逻辑
今日头条 2026-06-05 00:00:00
49. 重塑VLM空间推理!新加坡国立、微软提出“蓝图思维”,统一架构解决“左右”难题!
微信公众号 2026-01-08 00:00:00
50. NeurIPS 2025 | 阿里云领衔提出 SD-VLM
微信公众号 2026-04-10 00:00:00
51. 中科院
小红书 2026-05-05 00:00:00
52. CAMCUE
知乎 2026-02-07 00:00:00
53. 生成辅助推理,世界模型视角的答案
小红书 2026-01-28 00:00:00
54. 视觉模型只会识别不会推理?ICLR 2026 三种方案让 AI 看懂场景结构逻辑
微信公众号 2026-04-21 00:00:00
55. 万字长文拆解
微信公众号 2026-04-20 00:00:00
56. The Dual Mechanisms
小红书 2026-03-24 00:00:00
57. VLM技术趋势简述
知乎 2026-04-05 00:00:00
58. 一文看懂VLM
今日头条 2026-05-21 00:00:00
59. 让多模态模型拥有“方向感”
知乎 2026-04-30 00:00:00
60. 大连理工开源 Think3D
哔哩哔哩 2026-01-26 00:00:00
61. DeepSeek新模型技术曝光!用「视觉原语」思考的AI来了
微信公众号 2026-05-02 00:00:00
62. 如何看待空间计算的未来 - 哔哩哔哩
哔哩哔哩 2026-04-09 00:00:00
63. 人形机器人视觉之眼
微信公众号 2026-05-08 00:00:00
64. 物理AI
微信公众号 2026-05-22 00:00:00
65. 当AI开始"理解"物理世界
微信公众号 2026-05-11 00:00:00
66. 从“数字交互”到 物理协同”AI世界模型真的能连接虚拟与现实吗?
今日头条 2025-12-29 00:00:00
67. 什么是物理AI(Physical AI )?
微信公众号 2026-05-17 00:00:00
68. “物理AI”究竟是什么
今日头条 2026-05-18 00:00:00
69. 物理ai.很多人现在看到的“机器人”,其实还只是高级遥控玩具。能翻跟头、能跳舞、能做固定动作,但真正的物理AI,不是“遥控”,而是让AI真正理解现实世界。它需要知道眼前是什么、空间在哪里、物体会怎么运动、动作会产生什么结果,甚至还要学会自主决策、实时反馈、持续学习。所以物理AI真正难的,从来不仅仅是“机器人能不能动”,而是AI能不能像人一样,真正理解物理世界。而想让AI理解世界,就需要边缘计算芯片、视觉传感器、力觉传感器、世界模型这些底层能力。这才是物理AI真正的核心。
抖音 2026-05-24 00:00:00
70. 一句话定义物理AI=让AI懂物理、在真实世界里感知 —推理—行动—反馈的闭环智能,也叫实体AI / 具身AI 。
抖音 2026-05-16 00:00:00
71. 从虚拟到现实
微信公众号 2026-04-21 00:00:00
72. 读懂“物理AI”
微信公众号 2026-02-04 00:00:00
73. 全面拆解物理AI
微信公众号 2026-05-24 00:00:00
74. 物理AI
微信公众号 2025-12-11 00:00:00
75. 物理AI 下一场工业革命的钥匙
微信公众号 2026-04-27 00:00:00
76. 生成式物理 AI
微信公众号 2026-05-20 00:00:00
77. 【具身智能】物理AI驱动
微信公众号 2026-03-16 00:00:00
78. 【一篇文教会你在社交场合装杯】具身智能是什么?
微信公众号 2026-02-11 00:00:00
79. 2026物理 AI 落地五大趋势 | 具身智能产业月度观察
知乎 2026-05-13 00:00:00
80. #ai未来趋势 视触觉感知世界模型
抖音 2026-02-11 00:00:00
81. 让机器人“触摸并理解世界” ,千觉机器人展现硬科技创业力量
今日头条 2026-05-13 00:00:00
82. 刚刚,全球最大含触觉全模态数据开源,1万小时卷起来了!
微信公众号 2026-04-15 00:00:00
83. 光学触觉感知一统!操纵更强的触觉基础模型AnyTouch 的第二代来了
知乎 2026-02-12 00:00:00
84. 懂3D的语言模型来了!UCLA、上交、MIT等联合提出3D-LLM:性能大涨9%
85. 当 LLMs 步入3D世界,通过多模态大语言模型对3D任务的调查和元分析 !
86. 3DLLM-Mem:为具身3D大语言模型设计的长时期时空内存系统
微信公众号 2025-12-29 00:00:00
87. 仿生多模态触觉感知实现类人机器人感知
哔哩哔哩 2026-01-21 00:00:00
88. 【AI论文解读】解决多模态大模型空间失明!从视频生成模型挖 implicit 3D先验 | 即插即用VEGA-3D框架
哔哩哔哩 2026-04-06 00:00:00
89. CVPR'26 Oral满分论文 | 精度与速度双双SOTA 当前开放世界提示式3D语义分割,高度依赖传感器原始坐标系,极易受物体姿态变化干扰,普遍存在识别不稳定、泛化能力薄弱的问题。借鉴人类的标准化空间认知思路,本文提出CoSMo3D模型。 CoSMo3D通过大模型引导对齐、模型内置标准参考系,让AI摆脱拍摄坐标限制。统一物体标准形态,强化三维语义理解,高效解决姿态扰动难题,登顶开放世界3D分割SOTA。 论文标题:CoSMo3D: Open-World Promptable 3D Semantic Part Segmentation through LLM-Guided Canonical Spatial Modeling #3D视觉 #语义分割 #大模型 #LLM #计算机视觉 #空间感知 #具身智能 #人工智能
抖音 2026-04-28 00:00:00
90. VEGA-3D:挖掘视频生成模型的隐式 3D 先验以增强 VLM 场景理解
微信公众号 2026-03-21 00:00:00
91. 12.26-1|VLM4D动态空间推理;建筑年代预测偏差,记忆与推理偏差量化,多模态序数回归
微信公众号 2025-12-26 00:00:00
92. 视觉AI只会看图不会思考?ICLR 2026三种多模态推理方案让它脑中有图
知乎 2026-04-26 00:00:00
93. CVPR2026 | 清华等团队提出 Proxy3D:3D-VLM 新路线,让大模型真正“看懂空间”
知乎 2026-05-11 00:00:00
94. 港大&腾讯ARC:在4D空间中学习动态空间推理
小红书 2025-12-26 00:00:00
95. 多模态大模型与3D空间理解(5)-N3D-VLM:
知乎 2025-12-23 00:00:00
96. CVPR 2026 | 清华 & UC 伯克利提出 Proxy3D:用“代理标记”开启 3D 场景理解的高效时代
微信公众号 2026-05-12 00:00:00
97. 视觉大模型与多模态理解:从技术原理到行业落地
微信公众号 2026-03-30 00:00:00
98. 多模态模型详解2 - Qwen VL系列
知乎 2026-05-13 00:00:00
99. 12.25-2|长视频多智能体多轮推理;MLLM四个层级的空间能力评估;sam audio
微信公众号 2025-12-25 00:00:00
100. VLM多模态大模型2025-2026:从爆发到深水区
微信公众号 2026-04-19 00:00:00
101. Spa3R Predictive Spatial Field Modeling for 3D Visual Reasoning
知乎 2026-02-25 00:00:00
102. 论文分享|语言到空间编程,实现免培训 3D 视觉基础
微信公众号 2026-05-13 00:00:00
103. 如何使用前沿视觉 LLMs:Qwen3-VL
知乎 2026-03-18 00:00:00
104. CVPR 2026|突破3D空间推理瓶颈:北大联合南科大提出QuatRoPE,让大模型精准理解三维物体关系
知乎 2026-04-21 00:00:00
105. CVPR 2026|突破3D空间推理瓶颈!北大提出QuatRoPE:让大模型精准理解三维物体关系
微信公众号 2026-04-24 00:00:00
106. Insight-V++:多模态LLMs视觉推理新突破
小红书 2026-03-22 00:00:00
107. 苹果开源新模型!一秒钟让照片变3D世界
今日头条 2025-12-19 00:00:00
108. VLM架构梳理
知乎 2026-05-11 00:00:00
109. 物理人工智能——AI 从虚拟走向现实的第四波浪潮
微信公众号 2026-02-26 00:00:00
110. 从 DepthPro 到 SHARP:苹果开源秒级 3D 渲染,单图重建终于进入“工业级”时代
知乎 2026-05-19 00:00:00
111. 让大模型自己当裁判:Vision-SR1登场
小红书 2026-03-07 00:00:00
112. 打破CLIP黑盒!慕尼黑工大提出VLM嵌入空间语义层级解释与对齐框架,横测13个模型
知乎 2026-03-31 00:00:00
113. 万字深度丨具身智能爆发前夜:技术栈全景与落地图景
微信公众号 2026-03-16 00:00:00
114. 不只做传感器,千觉要做的是具身智能时代的“触觉底座”
微信公众号 2026-06-09 00:00:00
115. 机器人是如何实现"空间感知"的?从技术原理到落地应用
知乎 2026-05-27 00:00:00
116. 【AI+CAE】物理AI到底在说什么,跟具身智能、数字孪生、世界模型、AI CAE啥关系?
微信公众号 2026-01-30 00:00:00
117. 之前VLM空间推理评测全错了?ReVSI重构更准确的VLM三维空间智能评测 【计算机视觉】【大模型评测】
哔哩哔哩 2026-04-29 00:00:00
118. 【和达洞见】具身智能产业全景分析
微信公众号 2026-02-11 00:00:00
119. 行业资讯一文吃透具身智能的现状、挑战和未来
微信公众号 2026-01-03 00:00:00
120. 物理AI是什么? 什么是物理 AI?它是继感知 AI、生成式 AI、Agent 之后的第四阶段 AI 形态,核心是把重力、摩擦、惯性这些真实世界的物理规律内嵌进 AI 系统,让它能在现实中完成 "感知 — 理解 — 决策 — 执行" 的完整闭环。#物理AI #财经知识 #财经成长计划 #上热门🔥 #投资有风险理财需谨慎
抖音 2026-05-19 00:00:00
121. 展厅科普|物理AI到底是什么
微信公众号 2026-04-22 00:00:00
122. 物理AI的连接骨干?
微信公众号 2025-12-22 00:00:00
123. 物理人工智能模型:AI大脑神经元
小红书 2026-01-23 00:00:00
124. 会说话迈向会做事,物理ai行业一页纸 物理ai(Physical AI)是将人工智能的感知、决策与学习能力深度嵌入机器人、智能物理AI(设备、自动化系统等物理实体,使其能够在真实物理环境中理解并遵守物理规律(如重力、摩擦力、碰撞),进而自主完成复杂任务的技术体系。与专注于文本图像生成的大语言模型不同,物理AI的核心是"行动"从"知道"到"做到"的跨越#物理ai #智能化 #产业链 #ifind复盘
抖音 2026-05-18 00:00:00
已收藏
去我的收藏夹