视觉AI能分清“看见”和“知道”吗?
06-07 10:43
精选参考来源
精选参考来源
1. AI 智能体协作的瓶颈为何是“语义”?阿里云开源 UModel 对企业数字化意味着什么?
知乎 2026-05-25 00:00:00
2. 「被动感知」到「理解接触」!它石智航重磅发布OmniVTA视触觉世界模型
知乎 2026-03-26 00:00:00
3. 华科&小米开源UniDriveVLA :统一理解、感知与规划的全新VLA框架,构建智驾认知闭环
知乎 2026-04-17 00:00:00
4. Zimage模型深度评测:当东方美学遇上AI创造力
知乎 2026-02-18 00:00:00
5. 最新!AI再迎「十字路口」,林达华演讲曝光多模态底层路线图
知乎 2025-12-25 00:00:00
6. #小米新SU7XLA大模型揭秘# 新一代 SU7 搭载的XLA 认知大模型,依托小米自研MiMo-Embodied 具身智能基座,实现行业重大突破:首次彻底打通辅助驾驶与具身机器人两大核心任务,完成知识双向迁移那区别于传统 VLA 架构,XLA 升级多模态感知,融合视觉、雷达、声音及机器人交互数据,结合世界建模、潜空间推理技术,兼顾端到端快速响应与语义理解能力。厘米级环境感知、毫秒级极速决策,不再机械识别路况,而是真正理解真实世界、预判风险、自主规划路径小米用 2 年走完同行 5-10 年技术路XLA 大模型以统一具身架构领跑行业,让汽车成为最先落地的民用具身智能载体,重新定义高阶辅助驾驶新范式#车是最先落地的具身智能 #
新浪微博 2026-04-21 00:00:00
7. ICLR'26开源 | NUS新作SEAL:首个面向语义感知的分割一切事件
知乎 2026-02-06 00:00:00
8. 如何看待「不会用AI的家庭将是新寒门」的观点,AI改变教育模式的当下,该如何在学习中合理使用AI?
知乎 2026-01-22 00:00:00
9. 挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2
微信公众号 2026-04-13 00:00:00
10. 自动驾驶大一统!HERMES++:集成3D场景理解和未来几何预测,统一驾驶世界模型
知乎 2026-05-15 00:00:00
11. 纯视觉vs激光雷达:被光影欺骗的智驾,如何做到物理兜底?
哔哩哔哩 2026-04-12 00:00:00
12. Google 放大招!Gemini 3.1 Pro 正式发布,推理能力翻倍!免费使用方法来了 | 零度解说
哔哩哔哩 2026-02-21 00:00:00
13. DeepSeek 2026年4 月30 日发布几小时后删除的视觉模型技术报告,透露出哪些信息?
知乎 2026-05-01 00:00:00
14. 科学追求确定性,而量子力学证明世界本质是概率性的,这是否意味着人类认知存在根本性局限?
知乎 2026-02-19 00:00:00
15. 体育行业Top10 AI应用场景
微信公众号 2026-04-19 00:00:00
16. 高斯减30%仍霸榜!LangGS‑SLAM:15FPS实时输出,几何语义双场均达SOTA
知乎 2026-02-13 00:00:00
17. AI时代保命符 我们该教孩子什么 OpenAI掌门人山姆奥特曼对自己孩子未来的规划,AI时代到底学什么才不会被淘汰 #ai #教育 #认知
抖音 2026-03-02 00:00:00
18. 港大领衔DrivePI:统一自动驾驶理解、感知、预测和规划的空间智能4D MLLM
微信公众号 2025-12-22 00:00:00
19. 小鹏推出的第二代 VLA 物理 AI 大模型:✅ 自动驾驶问题本质上也就是物理 AI 问题,L4能力=模型x算力x数据x本体✅ 以物理 AI 为核心,打造原生多模态基座大模型,深度理解物理世界✅ 实现看、听、读一体化融合,视觉思维链推理效率飙升 32 倍✅ 支持语音、视觉、动作多模态输出,自主推演最优驾驶策略,筑牢舱驾联动底层#小鹏第二代VLA发布##小鹏智驾负责人称拉开差距的时刻到了#
新浪微博 2026-03-02 00:00:00
20. 跟我逛发布会 奇瑞AI之夜 看AI在智驾 底盘和制造等领域的应用
哔哩哔哩 2026-01-19 00:00:00
21. #海尔AI科技真的懂生活#海尔用一场发布会告诉我们,好AI从不是冰冷的技术,而是藏在细节里的人情味。AI之眼看见食材、看见习惯,更看见家人的日常,懒人冰箱不只是省事,更是把操心的事都替你想到。周云杰所言,创新的初心不是被看见,而是去看见。从海尔兄弟陪伴一代成长,到今天AI科技守护千万家庭,海尔这些细碎的温暖,正是科技最动人的模样。海尔的AI,懂功能更懂人心,让家始终有温度、有安全感
新浪微博 2026-03-14 00:00:00
22. #DeepSeekV4发布# DeepSeek V4预览版终于来了!这次更新主要有三大亮点:产品分层:网页端上线了“快速模式”和“专家模式”。日常聊天用快速版,写代码、搞科研等复杂任务就切到专家版,虽然可能要排队,但逻辑和精度强很多。超长上下文:支持100万Token上下文,相当于能一次性吃透75万字的内容,处理整本小说或大型代码库毫无压力。原生多模态:虽然“视觉模式”还在灰度测试,但V4已经具备了原生看图、理解视频的能力,不再只是简单的“看图识字”,跨模态理解能力有了质的飞跃。今年大模型的进步绝对是突飞猛进,AI能力会呈现指数级提升。
新浪微博 2026-04-24 00:00:00
23. AI智力天花板崩了!GPT-5.5 Pro视觉智商145,撞倒门萨俱乐部门槛
知乎 2026-04-27 00:00:00
24. 华科&小米SparseOccVLA:统一的4D场景理解预测和规划,nuScenes新SOTA......
微信公众号 2026-01-19 00:00:00
25. CVPR 2026 三维视觉趋势梳理:从 RGB 感知,到真实世界建模
微信公众号 2026-05-27 00:00:00
26. AI4S回归白盒符号主义,清华等联合发布SR-LLM:自主发现科学知识
知乎 2025-12-29 00:00:00
27. 显微镜让人类第一次看见细胞,望远镜让人类第一次看见宇宙。 而AI,第一次让我们系统性地看见自己思考里的盲区。#大咖观察 #红衣聊AI #AI时代 #AI工具
抖音 2026-02-21 00:00:00
28. #科技先锋官# 机器人与实时视觉正成为全球AI技术竞争的核心赛道,各大巨头纷纷加码布局,通过多模态融合、本地智能升级、感知体系革新等创新方向。这一突破重构了机器人的环境交互能力,更拓宽了AI在工业、服务、创意等多场景的应用边界。谷歌DeepMind的创新极具颠覆性,其发布的Gemini Robotics On-Device实现关键突破,成为首个可在机器人本地独立运行的视觉-语言-动作模型。该模型摆脱云端依赖,通过多模态Transformer架构深度融合视觉感知、语言理解与动作规划,响应延迟降至毫秒级,弱网环境下任务完成率超95%,仅需50-100次演示即可让机器人掌握新技能,大幅降低部署成本。OpenAI则通过o3/o4-mini多模态模型强化视觉推理能力,实现带图思考的全新范式,能将图像融入思维链,在医学影像分析、图表解析等场景展现出精准的视觉理解与决策能力。腾讯鸿元发布HY-Motion 1.0模型,聚焦高质量3D动作生成,为机器人实时动画、虚拟人交互提供核心技术支撑;智谱与华为联合推出的GLM-Image多模态模型,在图像生成与编辑领域实现突破,适配国产算力底座。行业层面,DA3通用三维视觉模型、OpenTau开源训练平台等技术的涌现,正推动机器人视觉从多模型适配走向统一化、轻量化,为产业规模化落地奠定基础。#AI生活指南##一条vlog回顾2025##AI创造营# 种斌Marco的微博视频
新浪微博 2026-01-16 00:00:00
29. 昨天上市的魏牌全新蓝山智能进阶版,是全球首款搭载元戎启行VLA(视觉-语言-动作)模型的量产车型!VLA模型是元戎启行于2025年8月发布的核心技术,融合了视觉感知、语言理解与动作决策能力。其优势在于引入了语言模型的思维链,提升了决策的可解释性,并集成了海量知识库,从而具备更强的泛化能力,能更好地应对复杂多变的真实城市路况。该模型具备空间语义理解、异形障碍物识别等四大功能,旨在为用户提供更稳定、可控的“防御性驾驶”体验。就像元戎启行CEO周光强调的,VLA模型的目标是让辅助驾驶具备类似人类“老司机”的思考判断能力。元戎目前已累计交付20万辆搭载城市NOA的车辆,并在2025年10月取得城市NOA第三方供应商市场单月市占率近40%的成绩。展望未来,元戎启行计划在2026年实现累计交付百万辆的目标,并同步推进Robotaxi和RoadAGI业务!
新浪微博 2025-12-23 00:00:00
30. 字节豆包2.0发布:推理成本降一个数量级,正面对标GPT-5和Gemini 3
知乎 2026-02-14 00:00:00
31. 商汤SenseNova U1:原生多模态统一模型的范式革命
知乎 2026-05-05 00:00:00
32. RTX 4090实测7.23fps!SceneVGGT:低内存在线 3D 语义 SLAM,解决长序列建图难题!
知乎 2026-04-07 00:00:00
33. 黄仁勋2026年达沃斯震撼发言,未来这三类人能抓住巨大的机会 #ai #黄仁勋 #达沃斯论坛
抖音 2026-01-29 00:00:00
34. 魏牌全新蓝山智能进阶版近日正式上市,成为全球首款搭载元戎启行VLA(Vision-Language-Action)模型的量产车型,标志着该技术实现从研发到上车的闭环突破。VLA模型融合视觉、语言与决策能力,具备思维链推理与海量知识库,可提升复杂城市场景下的语义理解、异形障碍物识别等能力,实现更稳定、安全的“防御性驾驶”体验。元戎启行目前已交付20万辆城市NOA车型,2025年10月市占率接近40%。未来,公司将持续扩大合作车型与客户体系,目标在2026年累计交付突破一百万辆,并同步推进Robotaxi与RoadAGI业务发展。
新浪微博 2025-12-23 00:00:00
35. Gemini 3 Flash 来了!谷歌说这波升级幅度挺大 #AI前沿速递# 模型主打一个轻快,适合那些不需要长链条思考、追求效率的对话场景。Gemini 3 Flash 的亮点还在于多模态能力,它能更快地处理视觉、音频等输入,把「看见、听见、理解」串成一条相对顺滑的链路,适合需要即时反馈的交互场景。
新浪微博 2025-12-18 00:00:00
36. 中文多模态视觉语言模型12月测评报告,12月29日发布!
微信公众号 2025-12-21 00:00:00
37. 滴滴最近在加速了!ColaVLA:潜在认知推理的分层并行VLA框架(清华&港中文&滴滴)
微信公众号 2025-12-30 00:00:00
38. #米兰冬奥首次引入AI裁判辅助#花滑长期因跳跃欠周、用刃等肉眼难辨细节判罚争议不断。2026米兰冬奥,国际滑联首次试点AI+计算机视觉辅助判罚。冰场布14台高速相机,AI实时捕捉毫米级动作数据,给裁判提供客观参考。AI只辅助不取代,最终判罚仍由人类裁判决定,只为减少误判、让比赛更公平。中国冰壶女队vs意大利比赛好精彩,谷爱凌大跳台预赛也非常让人期待啊#体育AI过大年##全民聊冬奥# 体圈领路人的微博视频
新浪微博 2026-02-14 00:00:00
39. 全家大事小事,小艺管家一句话的事!#更懂家的华为AI小艺管家来了#,在小艺AI大模型加持下实现深度语义理解,理解力更强。3D方位控灯轻松实现“说哪儿亮哪儿就亮”。场景大师功能一句话即可创建并修改场景。新增“定向降噪”和“悄悄话”功能,做到嘈杂环境中精准拾音,与小艺对话“轻问轻答”。
新浪微博 2025-12-22 00:00:00
40. 林俊旸发文:从“推理”思考到“智能体”思考
知乎 2026-03-26 00:00:00
41. 《英雄联盟》的底层机制,在认知科学层面获得了正面印证中国电子科技大学的科研团队在一份为期30周的纵向追踪报告中确认,相较于慢节奏的卡牌交互,受测者在长期进行《英雄联盟》的对局后,其空间注意、工作记忆及执行功能均出现了显著的量化提升。报告将这一结果归因于该游戏所特有的高强度视觉注意力分配与复杂决策机制数据显示,这种基于《英雄联盟》高频动态反馈所衍生的“认知训练”效果,具有高度的时间延展性。即便在受测者完全停止接触该游戏10周后,上述认知指标的改善态势依然得以稳定维持
新浪微博 2026-04-29 00:00:00
42. 【#科学家提出新型神经网络框架#!】近日,中国科学院自动化研究所团队等,提出了新型神经网络框架CATS Net,实现了类人的概念形成、理解和交流。CATS Net包含概念抽象(CA)模块与任务求解(TS)模块。在处理视觉任务时,CA模块能够自发地将高维视觉输入压缩成低维“概念向量”。这些概念向量会通过分层门控机制产生一系列“开关”信号,动态调节TS模块的神经网络活动,指导系统完成特定的视觉感知任务。系统可以根据与环境的互动自主生成大量新概念,形成自己的概念空间。当不同的神经网络所生成的概念空间对齐后,可直接通过概念向量在网络间传递知识,再现了人脑的概念生成、理解和交流。团队进一步将CATS Net自发形成的概念表征与人类的概念空间和神经活动数据进行对比。分析显示,CATS Net生成的概念空间与心理学上的人类认知语义模型一致,其表征模式还与人类大脑中负责视觉语义表征的腹侧枕颞皮层活动模式相关。同时,CA模块的动态门控机制与脑中负责概念提取与操控的语义控制网络活动模式吻合。这表明CATS Net在功能层面模拟了人类的概念认知,并在机制层面揭示了人脑概念形成与理解的计算原理。相关成果已发表于《自然-计算科学》。#中国科普博览#
新浪微博 2026-03-06 00:00:00
43. 压缩之外,Visual Tokenizer 也要理解世界?
微信公众号 2025-12-28 00:00:00
44. 重塑三维场景探索!GaussExplorer:3DGS+VLM完美结合语义理解和几何重建
知乎 2026-03-01 00:00:00
45. AI行业的8个基础前沿认知
微信公众号 2025-12-27 00:00:00
46. 人类VS算法
今日头条 2026-05-08 00:00:00
47. 斯坦福发现AI并没有"看见"图像
今日头条 2026-04-14 00:00:00
48. 高维需要的是理解,而不是看到
今日头条 2026-04-01 00:00:00
49. 在计算机学术界怎么区分Vision和Perception这两个单词?
知乎 2025-12-12 00:00:00
50. Perceptio
知乎 2026-05-06 00:00:00
51. 人形机器人视觉之眼
微信公众号 2026-05-08 00:00:00
52. 为何现代人工智能(AI)不基于认知科学原理构建?
微信公众号 2025-12-17 00:00:00
53. 人工智能的边界
百度 2026-05-27 00:00:00
54. 顺德讲学点 | 别被AI骗了!这堂课带你探秘AI的“能”与“不能”
微信公众号 2026-04-24 00:00:00
55. 第三篇
微信公众号 2026-01-01 00:00:00
56. 解决VLM推理失效的根源
哔哩哔哩 2026-05-26 00:00:00
57. 🔬 AI做理科题,感知才是真瓶颈
小红书 2026-03-12 00:00:00
58. Phi-4-reasoning-vision-15B 技术解读
微信公众号 2026-04-11 00:00:00
59. CVPR 2026 多模态视觉智能全景梳理
微信公众号 2026-05-22 00:00:00
60. 感理分化说丨大语言模型为什么不能用于科学推理?
微信公众号 2026-02-05 00:00:00
61. AAAI 2026 | 港科大开源Robust-R1
微信公众号 2025-12-25 00:00:00
62. 从数值感知到语义推理
微信公众号 2026-04-24 00:00:00
63. YOLO 精度到头了?DINOv3 正在重新定义工业缺陷检测
知乎 2026-05-12 00:00:00
64. 是视觉还是幻觉?斯坦福
小红书 2026-03-25 00:00:00
65. Mirage
小红书 2026-03-27 00:00:00
66. 视觉AI只会看图不会思考?ICLR 2026三种多模态推理方案让它脑中有图
知乎 2026-04-26 00:00:00
67. 改3%的训练数据,多模态AI看图推理明显变
小红书 2026-04-18 00:00:00
68. VLM在假装看图?揭秘多模态反思幻觉
小红书 2026-05-19 00:00:00
69. 从谷歌到字节,现阶段所有主流多模态模型,统统不及格
微信公众号 2026-02-05 00:00:00
70. 颠覆多模态评测
哔哩哔哩 2026-05-26 00:00:00
71. 告急?多模态AI的"视觉理解"可能是假的
微信公众号 2026-05-28 00:00:00
72. 突破多模态推理瓶颈!DeepSeek全新范式
微信公众号 2026-05-01 00:00:00
73. 机器视觉和AI有什么区别吗?
搜狐
74. 人工智能视觉检测是什么,它有哪些应用优势
搜狐
75. 人工智能视觉识别技术的研究与应用.pdf
76. 从人类视觉到AI世界模型的演进逻辑
微信公众号 2026-01-06 00:00:00
77. 代码驱动的视觉感知:为什么说「看得懂代码」才是大模型攻克理科题的真正钥匙 |CVPR 2026
知乎 2026-05-15 00:00:00
78. CLIP 模型解析
微信公众号 2025-12-13 00:00:00
79. 市场探索 | AI视觉能力2026:从感知到决策的跃迁时代
微信公众号 2026-01-12 00:00:00
80. 视力好,却“看不明白”?这个被忽视的视觉警报,可能正在影响你的生活
微信公众号 2025-12-12 00:00:00
81. Deep Research发布可核验评测新标准
微信公众号 2026-02-14 00:00:00
82. 大模型应用:循序渐进掌握CLIP:领悟训练推理过程的进阶特性.17
知乎 2026-02-17 00:00:00
83. DeepSeek用“视觉原语”破解多模态推理核心瓶颈 #全网热点早知道 #创作者中心 #创作灵感 2026年4月30日,DeepSeek正式发布其多模态大模型并公开技术报告,标志着其在视觉理解领域取得关键突破。 AI能“看见”却“想不清”?DeepSeek用“视觉原语”破解多模态推理核心瓶颈。#视觉原语 #多模态推理
抖音 2026-05-02 00:00:00
84. CLIP 原理详解:图文对齐如何连接理解与生成
知乎 2026-05-06 00:00:00
85. 中文多模态视觉语言模型6月测评报告,6月29日发布!
微信公众号 2026-06-02 00:00:00
86. 大模型应用:CLIP 模型全维度解析:理解理论基础强化基础范例.16
知乎 2026-02-16 00:00:00
87. Nature 预测:符号主义 AI 联姻神经网络,拯救大模型逻辑短板引革命
今日头条 2025-12-16 00:00:00
88. 在不确定中做最好的猜测:认知科学如何揭示人类心智的优雅算法
知乎 2026-01-04 00:00:00
89. 简介CLIP:从自然语言监督中学习可转移视觉模型
微信公众号 2026-02-03 00:00:00
90. 心理学×AI:从认知科学到智能革命,这对黄金搭档如何重塑未来?
微信公众号 2025-12-19 00:00:00
91. 多模态理论基础一:CLIP
微信公众号 2026-03-30 00:00:00
92. 现在的多模态大模型判断人格:是真感知还是刻板偏见?【AI认知科学】【多模态大模型】
哔哩哔哩 2026-05-23 00:00:00
93. AAAI 26 | ViCToR: 让LLM更“懂”视觉信息的多模态预训练范式
微信公众号 2026-01-19 00:00:00
94. VLSU探索AI安全中的多模态理解极限
微信公众号 2026-01-30 00:00:00
95. Alpamayo与Latent-CoT-Drive:让自动驾驶从“感知”走向“推理”
今日头条 2026-05-21 00:00:00
96. 中国信通院“方升-全模态“大模型基准测试最新结果发布
微信公众号 2026-04-29 00:00:00
97. 什么是CLIP模型?它如何让AI“看懂”你的提示词?
百度 2026-05-22 00:00:00
98. 认知驱动视觉搜索框架 CVSearch:专家定位 × 语义扫描自适应切换,实现高分细粒度感知 | ICML 2026
微信公众号 2026-05-26 00:00:00
99. 「2026版」别把AI视觉当成“二郎神”:这些典型工业应用场景你踩雷了吗?
百度 2026-05-24 00:00:00
100. CLIP模型在医学影像中的应用
微信公众号 2026-03-14 00:00:00
101. 看见的形状:AI视觉新论
哔哩哔哩 2025-12-31 00:00:00
102. 地球信息科学学报 | 大语言模型驱动的街道空间感知评价与语义挖掘方法研究
微信公众号 2026-03-21 00:00:00
103. ICLR 2026 | 多模态可解释性 | MICLIP:基于对比学习的内部表征与概念对齐!实现机制可解释性!
微信公众号 2026-04-22 00:00:00
104. (2)CLIP:让AI同时理解图像与语言
知乎 2026-05-08 00:00:00
105. 感知与认知的关系
今日头条 2026-04-12 00:00:00
106. 从“知道”到“看见”:研学的认知跃迁
微信公众号 2026-04-13 00:00:00
107. DINO 论文深度解析:从自监督 ViT 里程碑到 7B 参数视觉基座
知乎 2026-05-22 00:00:00
108. 视觉能力全面SOTA!智谱GLM-4.6V系列开源, 视觉理解精度超Qwen3-VL, 开启多模态AI技术新篇章。
微信公众号 2025-12-16 00:00:00
109. ACL 2026 | 多模态关系型知识的结构化推理
微信公众号 2026-05-08 00:00:00
110. 全球首创HVS融合视觉传感器,这家公司让AI长出了眼睛
知乎 2026-03-19 00:00:00
111. 人工智能——计算机视觉:让机器"看见"世界
微信公众号 2026-04-13 00:00:00
112. 让AI看见「世界的变化」,锐思智芯完成数亿元B+轮融资
微信公众号 2026-03-18 00:00:00
113. 智源TALK345期|AAAI 2026 Outstanding Paper Award ,多模态表征模型能力边界LLM2CLIP
知乎 2026-01-28 00:00:00
114. 实测 20 款多模态模型,情感理解能力仍有巨大短板
微信公众号 2026-04-17 00:00:00
115. 蜃楼幻想第二期:什么是强AI?
小红书 2026-03-13 00:00:00
116. 2026年,视觉传感器如何发展?
今日头条 2026-02-20 00:00:00
117. CLIP: Connecting text and images—— 多模态对齐的起点
微信公众号 2026-05-14 00:00:00
118. 视频理解:从几何与语义表征到统一模型架构
微信公众号 2026-03-22 00:00:00
119. 语言先验👉大模型Mental Visual Reasoning
小红书 2025-12-19 00:00:00
120. clip 模型思维逻辑深解
今日头条 2026-04-03 00:00:00
121. MLLM从"被动看图"到"主动回看"
小红书 2026-04-07 00:00:00
122. 从“看见”到“预见”:AI视觉大模型重塑苏州地铁安全范式
今日头条 2025-12-12 00:00:00
123. AAAI 2026 杰出论文 | 多模态表征模型能力边界 LLM2CLIP
哔哩哔哩 2026-02-06 00:00:00
124. AI与人是竞争关系吗?(一):认知科学视角——AI是人类认知的"外骨骼"
微信公众号 2026-04-13 00:00:00
125. 论文介绍:DINO Soars:DINOv3 用于遥感影像的开放词汇语义分割
知乎 2026-05-10 00:00:00
126. 无需训练,吊打 SOTA!TF-SSD:让 SAM 与 DINO 联手,开启协同分割新范式 | CVPR 2026
微信公众号 2026-04-02 00:00:00
已收藏
去我的收藏夹