多模态大模型真有类人视觉吗?388题测试暴露AI致命短板
02-10 18:42
精选参考来源
精选参考来源
1. 多模态大模型真有类人视觉吗?388题测试暴露AI致命短板
什么值得买
2. 多模态大模型,输给三岁宝宝?BabyVision 最新评测
什么值得买
3. 多模态模型藏致命短板,BabyVision测试顶尖AI视觉能力不及3岁娃
今日头条
4. 多模态大模型真有视觉理解能力吗?全网观点大PK
什么值得买
5. 多模态大模型能实现人类级视觉推理吗?全网观点大PK
什么值得买
6. 难以置信!几乎所有多模态大模型,视觉水平连3岁小孩都不如!
微信公众号
7. 2026技术风向,多模态视觉成突破口 全新评测集倒逼大模型补基础
今日头条
8. CV被大模型解决了?腾讯开源VLM识别新范式
微信公众号
9. 让Qwen-VL的检测能力像YOLO一样强,VLM-FO1如何打通大模型的视觉任督二脉
微信公众号
10. 为什么这么多开源大模型,我们不直接使用到工业视觉项目里?
知乎
11. 港科
小红书
12. 中科院&百度
小红书
13. 用代码生成提升 MLLM 视觉推理能力
小红书
14. 代码即工具,显著提升多模态模型鲁棒性
小红书
15. 多模态AI的"减肥革命"
今日头条
16. 视觉思维链架构,加州大学让多模态大模型添灵性,性能提5.3%
今日头条
17. 多模态大模型能真正融合编程与视觉推理吗?全网观点大PK
什么值得买
18. 多模态大模型能兼顾编程与视觉理解吗?全网观点大PK
什么值得买
19. 多模态大模型
微信公众号
20. 精|微软 CVPR'25 权威教程
知乎
21. 多模态大模型能否突破复杂任务瓶颈?全网观点大PK
什么值得买
22. 一文读懂多模态大模型(MLLM),ICJV 2025
小红书
23. 当模型开始“看图回答”
微信公众号
24. 从谷歌到字节,现阶段所有主流多模态模型,统统不及格
微信公众号
25. BabyVision评测集揭示多模态大模型视觉基础能力不足,GPT-5.2准确率34.8%
今日头条
26. 编辑推荐丨北大彭宇新团队撰写首篇细粒度多模态大模型综述
什么值得买
27. 斯坦福
知乎
28. 【科研播报】CJE 2026 | CSIG副理事长彭宇新教授团队发布首篇细粒度多模态大模型综述
微信公众号
29. 多模态模型竟然学会了“动态对话”视觉层次
小红书
30. MLLM论文| 融合CLIP和DINO特征提高感知性能
小红书
31. [Nat. Comt. Sci.,25,多模态LLM|测评]视觉语言模型精于感知却拙于科学推理
知乎
32. 斯坦福
小红书
33. 视觉漏斗
小红书
34. 腾讯优图
小红书
35. AI玩拼图游戏暴涨视觉理解力,告别文本中心训练,无需标注的多模态大模型后训练范式
微信公众号
36. 2026年多模态对齐创新思路
小红书
37. ICCV 2025 | 目标检测新路径!LMM-Det 让大模态模型摆脱 specialist 依赖,COCO 数据集表现亮眼
微信公众号
38. 多模态大模型技术创新研究方向、创新点
小红书
39. 多模态视觉Token压缩方法
小红书
40. 2025年多模态对齐有哪些好的idea?
小红书
41. 训练多模态模型有哪些trick?
小红书
42. 阿里NeurIPS'25语言中枢全模态表示学习
知乎
43. Glance2Gaze-多模态大模型视觉增强&视觉Token压缩-美团Nips2025 poster
知乎
44. ICCV'25 LLaVA-SP
哔哩哔哩
45. 阶跃星辰(StepFun)正式开源 Step3-VL-10B 多模态模型,重塑多模态效率边界,成为轻量化模型性能标杆
微信公众号
46. 视觉拼图提升模型的感知和理解能力
小红书
47. 多模态理解与生成通用奖励模型
小红书
48. 多模态交互注意力融合结构
什么值得买
49. 多模态大模型输给三岁宝宝?xbench x UniPat联合发布新评测集BabyVision|甲子发现
微信公众号
50. 六大顶流开源多模态大模型,13大场景横向测评实例!
什么值得买
51. 视觉生成通过多模态世界模型实现类人类推理
小红书
52. 生成辅助推理,世界模型视角的答案
什么值得买
53. 视觉生成解锁类人推理
微信公众号
54. 当视觉语言模型接收到相互矛盾的信息时,它会相信哪个信号?
微信公众号
55. NeurIPS25|评估大视觉-语言模型在遥感领域
小红书
56. 多模态大模型落地总结
知乎
57. AI算法面试
微信公众号
58. 不再靠「猜坐标」!颜水成团队等联合发布PaDT多模态大模型
微信公众号
59. 打破文本记忆局限!ViLoMem要记视觉关注点
小红书
60. ViLoMem
微信公众号
61. 9.17-4|视觉与语言映射的跨模态信息损失,结构保持和局部重构双重评价;LLM幻觉拒绝回答基准,认知谦逊
微信公众号
62. CVPR 2025|文字还是视觉
什么值得买
63. VLSU
小红书
64. Google: 模态无关隐空间思考token
小红书
65. 增强多模态大模型定位能力的一些方法
知乎
66. PerPO
小红书
67. VLM-Think with images必读论文
小红书
68. 靠AI赚钱的讨论依旧持续 想多一份收入,AI也许是个不错的选择。#大咖观察 #红衣聊AI #赚钱思维
抖音
69. 用模型排行榜论输赢?AI竞赛到底在比什么? #大咖观察 #红衣聊AI #AI #大模型
抖音
70. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能
抖音
71. 期货,为什么总是拉爆债市、股市、油价?资本世界的多空大战有多 凶残...#dou来守护钱袋子#期货
抖音
72. 与其追求成为一个从不犯错的人, 不如打造一个就算犯错也能被纠正的流程。#大咖观察 #红衣聊AI #人工智能 #大模型
抖音
73. 天玑9500首发评测:Find X9 Pro性能有多强?
哔哩哔哩
74. 激光雷达真的没有未来吗?!为何越来越多车企转向“纯视觉”?技术细节深度剖析!
哔哩哔哩
75. 在极果新车评的AEB极限横评中,华为乾崑智驾ADS Pro交出了一份堪称“降维打击”的成绩单,舱内激光视觉Limera方案的实力,直接让其在一众辅助驾驶系统里拉开了代际差距。 这四项测试里,华为乾崑智驾ADS Pro不仅全维度通过,还在速度上限上实现了对竞品的碾压。究其原因,舱内激光视觉Limera方案是关键。这套系统打破了传统视觉方案在夜间逆光、复杂路况下的感知瓶颈,就像给智驾系统装上了“夜神之眼”,哪怕是极端的逆光异型物体场景,也能精准识别并做出反应。对比之下,特斯拉FSD、小米HAD等系统要么在中高速场景失效,要么直接无法通过基础测试,足以见得华为在感知硬件和算法融合上的技术积淀。 华为乾崑智驾ADS Pro用舱内激光的技术优势,把AEB的性能上限拉到了新高度,也让行业看到了智驾安全技术的全新可能——当其他玩家还在打磨视觉算法时,华为已经用激光+视觉的融合方案,走出了一条独属于自己的技术赛道。#华为乾崑智驾ADSpro ##ADSPro舱内激光上限高到离谱 ##舱内激光视觉Limera化身夜神 ##舱内激光视觉Limera“一挑五”胜算几成?#
新浪微博
76. 科幻电影史视觉先锋,如今赛博世界照进现实! #蔚来 #蔚来ET5T #最适合改装的纯电车 #TRON创战神
抖音
77. #小米17系列首发评测# 多一面,更精彩!高端无短板!小米17 Pro Max详细评测请看视频 科技新一的微博视频
新浪微博
78. DeepSeek新模型爆火,硅谷玩疯了 #DeepSeek团队开源新模型 DeepSeek新模型爆火,硅谷玩疯了!把文字变成图像,让AI一目十行读完一本书!这次,它真的在教AI们,怎么省算力、怎么学会“遗忘” #AI #DeepSeek
抖音
79. 多模态大模型这条赛道,阿里云开始拉速度了
微信公众号
80. 14年抗日战争,到底有多艰辛,一条视频带你了解抗战全过程!#历史 #抗日战争 #918勿忘国耻 #918 #正能量 @秀才说~小泥鳅🐟
抖音
81. 网上热卖的针孔摄像头检测仪器,真的靠谱吗? #偷拍 #监控摄像头 #老爸评测十周年 #内容启发搜索 #老爸评测
抖音
82. 大模型更像人的大脑,智能体是大模型的手和脚。 #大咖观察 #红衣聊AI #智能体 #大模型
抖音
83. 让AI真正理解世界,360是如何做到的? #大咖观察 #红衣聊AI #国产模型 #人工智能 #编程
抖音
84. 当今改进cnn,transformer还有出路吗?
知乎
85. 大语言模型是不是发展到头了?
知乎
86. 危急时刻 谁能刹的住 ?!2025主流辅助驾驶方案四大极限场景AEB横评挑战
哔哩哔哩
87. 综合能力比肩GPT5,万亿参数思考模型Ring-1T来了!#AI #国产大模型 #蚂蚁百灵 #AIGC
抖音
88. 为什么vivo的三摄方案,是Ultra影像困境的最优解?【批浅析评】
哔哩哔哩
89. 盘点一周AI大事(2月1日)|AI乌托邦魔幻开局 Google上线世界模型Project Genie 阿里开源实时世界模型LingBot-World AI乌托邦社区Moltbook爆火 Chrome升级为AI浏览器 月之暗面发布最强开源大模型Kimi K2.5 Gemini 3 Flash升级视觉能力 腾讯发布最强开源图像模型HunyuanImage 3.0-Instruct 阿里开源Z image Base满血版 OpenMOSS发布最强开源视频模型MOVA MIniMax上线顶级音乐模型MiniMax Music 2.5 英伟达开源天气预测模型Earth-2 #AI新星计划 #前沿科技趋势发布月 #抖音知识年终大赏 #AI #AIGC
抖音
90. VLA模型(Vision-Language-Action)是一种融合视觉感知、语言理解与动作控制的多模态人工智能框架。本次#试驾#的车型还未上市,所以外观不能发出来。在元戎启行VLA模型防御型辅助驾驶加持下,这车简直比老司机还要老司机!#大v聊车# 蜗牛同学LX的微博视频
新浪微博
91. #微博声浪计划##听见微博# 华为乾崑ADS Pro以藏式设计引发热议,首创舱内激光视觉方案,将激光雷达藏于前挡风玻璃后方,告别车顶小犄角。技术上采用一镜双模架构,激光与视觉共用镜头,实现物理级零时差融合。2026年将覆盖20余款新车型,起售价下探至15万级,ADSPro不是显眼包胜似显眼包。 搞车学长的微博音频
新浪微博
92. 合资车要重新崛起了?体验了新发布的大众Pro家族,油车真能有不错的辅助驾驶?有一个小问题,如果燃油车们都补齐了座舱体验和辅助驾驶的短板,你们还会选电车吗?#油车高速领航全国都好开##聪明油车就选上汽大众##途昂Pro##途观LPro##帕萨特Pro# 小晴Kiwa的微博视频
新浪微博
93. 达摩院EMNLP'25|先学会看,再学会想:新框架突破多模态模型几何视觉瓶颈
微信公众号
94. DUST:双流扩散模型如何革新世界模型增强的VLA,实现机器人策略学习新突破
知乎
95. 视觉对齐的力量:VIRAL如何让多模态大模型看得更清、数得更准?
知乎
96. 【354论文泛读】Second: 通过选择性和对比解码减轻视觉-语言模型中的感知幻觉
知乎
97. 论文精读:Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints(AAAI2025)
知乎
98. 3B参数的视觉全能王!IDEA最新开源:一个模型支持十多种视觉任务!零样本检测、OCR、关键点全拿下
知乎
99. 一个模型支持十多种视觉任务!零样本检测、OCR、关键点全拿下
今日头条
100. 仅125M的轻量化多模态模型,Jetson 等边缘设备上可部署!新颖的图像描述修正框架,让AI学会看细节!
知乎
101. BabyVision:多模态模型视觉推理新基准
什么值得买
102. 交叉注意力机制再度“大力”,狠狠拿捏CCF-A!简单好学易上手!
微信公众号
103. 一个模型搞定九大任务!腾讯开源像素级视觉推理模型:基于Qwen2.5-VL实现指代/推理/交互分割等
知乎
104. 【重建对齐】提升Unified多模态大模型
小红书
105. 多模态大模型的特征对齐
小红书
106. 视觉版 Gym!UC 伯克利VisGym 开源:全方位诊断多模态智能体缺陷
什么值得买
107. MLLM跨模态组合新瓶颈
小红书
108. EMNLP 2025 | “看图说话”变“看图越狱”?聚焦视觉上下文对多模态模型的隐蔽攻击
知乎
109. 多模态大模型基础感知能力评估
小红书
110. 南开大学&腾讯提出MODA:双路注意力机制革新多模态认知与情感理解
微信公众号
111. 中科院自动化研究所团队破解多模态大模型的"夜视"难题
今日头条
112. 别盲目剪Token:守护VLM的「全局视野」
小红书
113. 🚀多模态AI居然在视觉交互中表现这么差?
什么值得买
114. MME-Survey深度精读:南京大学、中科院联合出品,多模态大模型评测的“百科全书”
微信公众号
115. ICCV25|清华SparseMM:优化多模态模型推理
微信公众号
116. MLLM视觉能力新突破!🚀💡
小红书
117. [论文速读](ACL Finding 2024)Mitigating Hallucinations in LVLMs with Instruction Contrastive Decoding
知乎
118. 多模态视觉token压缩方法
小红书
119. 10分钟论文(第26期)多粒度视觉语言预训练_ X-VLM【中配+中字】
哔哩哔哩
120. 多模态视角下的视觉模型演进与未来图像智能趋势
知乎
121. 10 Qwen2-VL论文解读
知乎
-
亲密炒菜中途疲软、核心不稳?七个凯格尔运动,让你找回自信108 44 -
在闲鱼12万卖掉特斯拉!当天手牵手过户,比贱卖给车商爽多了106 129 -
洁柔艺术油画抽纸测评|美的不像话!颜值能打,更扛得住娃!230 43
已收藏
去我的收藏夹