AI视觉的“自知之明”:为何它总在未知面前过度自信?

源自131位全网作者

06-09 20:28

精选参考来源

1
坏蛋如何用3句话让大模型破防?当一名遵纪守法的“好AI”有多难?【柴知道】
2
#科技先锋官# 机器人与实时视觉正成为全球AI技术竞争的核心赛道,各大巨头纷纷加码布局,通过多模态融合、本地智能升级、感知体系革新等创新方向。这一突破重构了机器人的环境交互能力,更拓宽了AI在工业、服务、创意等多场景的应用边界。谷歌DeepMind的创新极具颠覆性,其发布的Gemini Robotics On-Device实现关键突破,成为首个可在机器人本地独立运行的视觉-语言-动作模型。该模型摆脱云端依赖,通过多模态Transformer架构深度融合视觉感知、语言理解与动作规划,响应延迟降至毫秒级,弱网环境下任务完成率超95%,仅需50-100次演示即可让机器人掌握新技能,大幅降低部署成本。OpenAI则通过o3/o4-mini多模态模型强化视觉推理能力,实现带图思考的全新范式,能将图像融入思维链,在医学影像分析、图表解析等场景展现出精准的视觉理解与决策能力。腾讯鸿元发布HY-Motion 1.0模型,聚焦高质量3D动作生成,为机器人实时动画、虚拟人交互提供核心技术支撑;智谱与华为联合推出的GLM-Image多模态模型,在图像生成与编辑领域实现突破,适配国产算力底座。行业层面,DA3通用三维视觉模型、OpenTau开源训练平台等技术的涌现,正推动机器人视觉从多模型适配走向统一化、轻量化,为产业规模化落地奠定基础。#AI生活指南##一条vlog回顾2025##AI创造营# 种斌Marco的微博视频
全部
来源
内容由AI生成

精选参考来源

1. 坏蛋如何用3句话让大模型破防?当一名遵纪守法的“好AI”有多难?【柴知道】

2. #科技先锋官# 机器人与实时视觉正成为全球AI技术竞争的核心赛道,各大巨头纷纷加码布局,通过多模态融合、本地智能升级、感知体系革新等创新方向。这一突破重构了机器人的环境交互能力,更拓宽了AI在工业、服务、创意等多场景的应用边界。谷歌DeepMind的创新极具颠覆性,其发布的Gemini Robotics On-Device实现关键突破,成为首个可在机器人本地独立运行的视觉-语言-动作模型。该模型摆脱云端依赖,通过多模态Transformer架构深度融合视觉感知、语言理解与动作规划,响应延迟降至毫秒级,弱网环境下任务完成率超95%,仅需50-100次演示即可让机器人掌握新技能,大幅降低部署成本。OpenAI则通过o3/o4-mini多模态模型强化视觉推理能力,实现带图思考的全新范式,能将图像融入思维链,在医学影像分析、图表解析等场景展现出精准的视觉理解与决策能力。腾讯鸿元发布HY-Motion 1.0模型,聚焦高质量3D动作生成,为机器人实时动画、虚拟人交互提供核心技术支撑;智谱与华为联合推出的GLM-Image多模态模型,在图像生成与编辑领域实现突破,适配国产算力底座。行业层面,DA3通用三维视觉模型、OpenTau开源训练平台等技术的涌现,正推动机器人视觉从多模型适配走向统一化、轻量化,为产业规模化落地奠定基础。#AI生活指南##一条vlog回顾2025##AI创造营# 种斌Marco的微博视频

3. AI正在偷你的能力,人类该如何应对? #大咖观察 #红衣聊AI #AI时代

4. 3分钟带你实车体验L3自动驾驶#L3级自动驾驶#行车安全#辅助驾驶

5. 先别急“养龙虾”,这些AI安全问题你可能还不知道!附安全解决方案...

6. 2026年50+款新车,轻舟智航城市NOA量产爆发

7. 人工智能通识课:多模态大模型

8. [LG]《Understanding Reasoning in LLMs through Strategic Information Allocation under Uncertainty》J Kim, X Luo, M Kim, S Lee… [Microsoft Research] (2026) 在最小包容球问题中,LLM 的逐步推理一旦锁定错误方向(如把"最大化"误作"最小化"),后续的步骤计算再精确也无法自救,推理在局部自洽、整体错误的轨道上僵死。本文的核心洞见是:把 Chain-of-Thought 中的"Wait""Hmm"等表达重新看作不确定性外化(epistemic verbalization)的载体,而非触发自我修正的魔法词。由此,将推理状态分解为程序性信息与认识性外化两个正交维度,使模型能在程序推理信息停滞时,仍通过语言化自我质疑持续获取信息增益,最终突破局部错误轨迹。这项工作真正留下的遗产是:为"Aha moment"提供了信息论意义上的因果机制,将零散的实验现象(蒸馏失败、小模型更爱反思、高熵token的作用)统一进同一框架。它为后来者打开的新门是:针对程序能力与不确定性外化能力分别设计训练目标,实现更精准的后训练策略。但尚未跨过的门槛是:如何在保留有效不确定性信号的同时,量化裁剪冗余推理链,避免以过度自我质疑换取低效的超长响应。arxiv.org/abs/2603.15500 #机器学习# #人工智能# #论文# #AI创造营#

9. 英伟达这一步,砸开了自动驾驶“黑盒”。 #大咖观察 #红衣聊AI #英伟达 #自动驾驶

10. 陈龙博士的访谈的关键点就是:小米把“辅助驾驶”和“具身机器人”在底层打通了。#小米新SU7XLA大模型揭秘#他们正在研究的MiMo-Embodied基座,等于是给车换了个脑回路。以前辅助驾驶靠死记硬背去识别线和障碍物,现在上了XLA认知大模型,车子开始有了跟人一样的常识。比如碰到临时改道或者复杂的混行路口,普通的智驾基本处理不了,但有了机器人的空间感知后,系统就能去理解场景提前做预判,避开生硬的急刹。两年推了三个大版本,直接把车当成有认知能力的机器人来做,让原本刻板的代码拥有随机应变的生活经验。在把大模型转化为实际体验这块,小米是找对门道了。#车是最先落地的具身智能#

11. 如果AI的终极形态不是在屏幕里,而是在现实世界里替人类干活。 你觉得下一个爆发点会先出现在机器人,自动驾驶,还是医疗?#大咖观察 #红衣聊AI #科技 #人工智能 #黄仁勋

12. Clawdbot 实现突破,AI的致命缺陷不再是无解难题。 #大咖观察 #红衣聊AI #医疗 #科研

13. #小米新SU7XLA大模型揭秘# 新一代 SU7 搭载的XLA 认知大模型,依托小米自研MiMo-Embodied 具身智能基座,实现行业重大突破:首次彻底打通辅助驾驶与具身机器人两大核心任务,完成知识双向迁移那区别于传统 VLA 架构,XLA 升级多模态感知,融合视觉、雷达、声音及机器人交互数据,结合世界建模、潜空间推理技术,兼顾端到端快速响应与语义理解能力。厘米级环境感知、毫秒级极速决策,不再机械识别路况,而是真正理解真实世界、预判风险、自主规划路径小米用 2 年走完同行 5-10 年技术路XLA 大模型以统一具身架构领跑行业,让汽车成为最先落地的民用具身智能载体,重新定义高阶辅助驾驶新范式#车是最先落地的具身智能 #

14. #吉利英伟达GTC2026# 全域AI2.0 迎来全新升级,核心搭载WAM 世界行为模型,相较传统 VLA 模型实现三大维度突破,让AI真正从执行指令走向理解世界。它不再只拟合动作,而是学习物理规律、掌握物体恒存等底层逻辑,训练上跳出单一驾驶数据,融合互联网视频、驾驶轨迹等多元异构信息,决策也从被动选选项,变为连续模态建模,面对不确定性会先观察再决策,更聪明、更贴近真实世界的智能逻辑。

15. 写日记复盘被AI坑的过程,背景信息不足一直是影响AI产出的主要原因,所以记忆对于AI的工作效率有直接影响,其次是100万上下文支持,最后AI有时候也不知道自己不知道。复盘的过程中也想出了解决方案,明天试试能不能行。

16. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代

17. Anthropic警告人类:停止研究AI! #大有学问 #红衣聊AI #anthropic #网络安全 #AI时代

18. 小米HAD引入Xiaomi XLA认知大模型,不只是升级,是底层技术重构。作为行业主流VLA的扩展版,它加入具身智能与多模态感知,让系统真正拥有认知能力,能啃下最难的长尾场景,越用越聪明、越开越拟人。 在我看来两年追三代、技术栈直接追平头部,小米用1800人团队、108位博士的重投入,跑出了行业独一份的速度。AI大模型密集落地,现在开始全面反哺造车,智驾拼的就是认知,小米这条路走对了。 其次,小米的智能辅助驾驶免费、进步快、越用越好,这三点全占。XLA架构方向正确,全场景稳定还需打磨,但小米已经拿到智驾决赛圈门票。所以未来小米的发展空间会非常大,一起拭目以待吧!#小米新SU7辅助驾驶升级XLA大模型#

19. 张文宏拒绝将 AI 引入医院病历系统,称会影响医生的诊断思维,如何评价? 医疗诊断中应该怎么用 AI?

20. AI汽车正式进入车载具身智能时代

21. 既然都激光雷达了,还要纯视觉干嘛?

22. 马斯克10年梦成真!特斯拉全球首次自动驾驶横穿美国,人类0接管

23. 【世界模型不会取代LLM,它是LLM缺失的那一层】快速阅读: 世界模型正从学术概念走向主流讨论,但“取代LLM”是个假命题。更准确的描述是:LLM处理语言和推理,世界模型负责物理仿真和因果接地,两者将形成分层协作的架构。目前的应用重心集中在机器人领域,非物理领域的潜力仍被严重低估。---在Nvidia的GTC大会上,世界模型(world model)突然成了每个严肃对话的收尾词。这种感觉像2021年所有人突然“懂了”transformer的那个时刻。世界模型不预测下一个词。它在内部构建一个关于世界如何运转的表示,能模拟环境、向前规划、推演因果链条。这和LLM做的事情在结构上不是同一回事——LLM理解的是语言,它“知道”猪不会飞,是因为文本里这么写;世界模型则要直接编码重力、质量、无翼这些约束本身。一个是通过描述世界来理解世界,一个是直接对世界的规律建模。但说“再见,LLM”是彻底搞错了方向。有观点认为,两者根本不互斥。更接近现实的架构是:LLM作为语言接口和意图解析层,世界模型作为物理仿真和因果推理层,专用代码处理确定性执行。世界模型填的是LLM一直缺的那个空——当LLM生成一个计划,它没有内部物理引擎来验证这个计划是否在现实中成立。六年前特斯拉的车开进卡车,不是因为模型不聪明,是因为它没有“卡车几乎总是拖着挂车”这种世界级别的先验约束。目前几乎所有的世界模型应用都流向了机器人、自动驾驶和物理操控。这让人有点不安。商业管理、药物发现、金融决策——这些领域同样需要因果推理,同样需要“如果这样做,接下来会发生什么”的模拟能力。但资源和研究还没怎么往这里走。Yann LeCun是这个方向最值得追踪的声音。他对JEPA架构的执念和对LLM局限的批判,提供了比大多数会议演讲更诚实的坐标。有个问题没人认真回答:在药物发现或业务仿真这类高价值非物理场景里,你怎么知道世界模型的因果信念是真实校准过的?机器人领域有sim-to-real gap研究来逼出误差,其他领域的等价检验是什么?LLM的置信度和正确性脱钩这件事,我们花了好几年才学会和它相处。世界模型面临同样的清算,而赌注会更高。这不是反对世界模型,是说“它理解因果”和“它能生成连贯的因果仿真”是两个不同的声明。第一个没法从外部观测,第二个可以。混淆这两者,是AI每一代新技术都会重蹈的错误。在这个问题被解决之前,真正有价值的工程工作可能不在模型本身,而在路由层——哪类任务交给LLM,哪类交给世界模型,哪类用确定性代码,怎么在它们之间传递状态。这部分目前几乎没有人在认真做。ref: www.reddit.com/r/artificial/comments/1s828dj/world_models_will_be_the_next_big_thing_byebye

24. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?

25. 今早北京,中国机器人再次震撼世界! #大有学问 #机器人马拉松 #亦庄机器人马拉松 #红衣聊AI #机器人

26. 当AI学会了创造世界,科幻电影中的机器人时代开始全面加速! #AI新星计划 #科技改变生活 #玩个很新的东西 #世界模型 #具身智能

27. 从避免撞别人到避免被别人撞,ADS 5要进化成这样了?【X.PIN】

28. 小米辅助驾驶的进化速度真的太离谱了!短短两年时间,小米HAD辅助驾驶更新了三个大版本,直接跑完别家车企五到十年的发展路程,这个成长速度让你不得不佩服。#小米新SU7XLA大模型揭秘##车是最先落地的具身智能# 这次新SU7搭载的XLA大模型,融合VLA、世界建模、端到端全新架构,彻底改变传统智驾逻辑。犹如陈龙所说,汽车就是具身智能最好的试验场和落地场景。小米跳出常规思路,不靠堆砌硬件,靠自研大模型提升认知能力,面对复杂路况、突发路况处理更灵活。 从算法到模型全面自研,一步一步夯实技术壁垒,不玩虚的噱头,只做实打实的体验升级。小米汽车凭借超强的研发实力,硬生生在智驾赛道实现弯道超车,也让我们看到国产新能源真正的技术硬实力,越来越强~

29. #华为云助推医疗AI规模化应用# 我觉得医疗AI最大的意义,不是替代医生,而是让更多人享受到优质医疗资源,智慧病理从试点走向规模化落地,把三甲医院的AI能力带到基层医院,有助于缓解病理医生短缺、医疗资源分布不均等问题。技术只有真正落地、解决实际需求,才能体现价值,这样的发展方向值得关注。

30. Agent时代,为什么多模态数据湖是必选项?

31. 独家 | Humanify 获数千万元首轮融资打造 AI OS,97 年创始人不卷 AI 智商、押注 “类人认知”

32. 独家实拍|苏昊旗下机器人全球首次亮相,苏度科技惊艳 ICRA 2026

33. 在线模型推理部署经常遇到多模态模型支持复杂,性能难以优化的问题。vLLM-Omni 基于高效的 KV cache 管理和流水线执行,专为支持包括文本、图像、音频、视频等多模态输入的模型设计,轻松实现异构模型推理和服务。它不仅兼容主流 Hugging Face 开源模型,还支持分布式推理、多阶段流水线调度、流式输出和 OpenAI 兼容接口,极大提升多模态模型在线推理的效率和灵活性。GitHub: github.com/vllm-project/vllm-omni主要功能:- 支持多模态数据(文本、音频、图像、视频)处理与生成;- 支持非自回归架构如扩散模型,实现高效的并行生成;- 基于 KV cache 优化自回归模型推理性能;- 异构流水线抽象,管理复杂多阶段模型工作流;- 分布式推理支持,涵盖张量并行、数据并行和专家并行;- 开箱即用的 OpenAI 兼容 API 服务器,方便集成;- 支持主流平台(CUDA/ROCm/NPU/XPU),广泛适配多硬件环境。适合AI开发者、研究人员和企业级应用场景的多模态AI模型推理部署。#AI开发# #多模态模型# #机器学习#

34. AI 术语通俗词典:置信度

35. 中国AI王炸!具身智能把欧美甩到身后! #大咖观察 #红衣聊AI #人工智能 #具身智能#ai新星计划

36. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与

37. DeepSeek首次有了视觉能力,技术论文却被它连夜删掉了

38. 如何看待工信部许可两款 L3 级自动驾驶车型产品?这意味着中国自动驾驶进入什么阶段?

39. 天大 × 小米新作!VGGDrive:让自动驾驶大模型拥有3D几何感知能力

40. 小米汽车发布并全面开源自动驾驶模型 Xiaomi OneVL ——一步式潜空间语言视觉推理框架。根据官方介绍,上述模型实现 VLA、世界模型、潜空间推理等多个技术路线的统一,在具备 XLA 模型推理能力的基础上,大幅提升推理的速度和精度,在精度上超越显式 CoT、在速度上对齐「仅答案」预测的潜空间 CoT 方案。更重要的是,小米还宣布将 Xiaomi OneVL 的模型权重和训练、推理代码全面开源,与全球开发者共同推动自动驾驶的进步和迭代。小米方面称,这不只是一次对 XLA 的功能补充,而是对 XLA 技术路线中「潜空间推理」能力的一次深度探索。#小米汽车##人工智能##自动驾驶模型##42how#

41. AI时代医生的痛点,不知道大家怎么看待AI看病是否能代替医生这个问题#卢骁的急诊日记

42. 日美机器人,为啥被中国超越了?

43. #谷歌IO2026# Google I/O 2026 开发者大会完整中英文双语视频Google I/O 2026:Gemini 3.5 Flash、Spark、Omni 三剑齐发Gemini 3.5 Flash升级为:行动大脑Gemini Spark:远端个人 AIAgent 入口Gemini Omni:多模态世界模型雏形 互联网的那点事的微博视频

44. 「具身原生」元年!专访原力灵机汪天才,解析具身智能的「PyTorch时刻」

45. 毛孩子干饭也能AI视觉托管了!!米家智能宠物喂食器2可视版 [有没有用 127]

46. 北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026

47. ICLR'26高分开源 | Depth Anything 3:新一代3D视觉模型,位姿精度超VGGT 35.7%!

48. 400 tokens/s 的多模态模型? Step 3.7 Flash 实测。

49. 从技术落地到资本认可,它石智航一步到位! 4.55 亿美金融资,财务 / 战投 / 产业 / 国资四大资本维度齐聚,具身智能从此只看真能力。#具身智能史上最大单轮融资 #全球首个能干活的具身智能大模型AWE #它石具身数据引擎 #它石智航 #它石智航丁文超

50. 纯视觉vs激光雷达:被光影欺骗的智驾,如何做到物理兜底?

51. 小鹏发布了第二代 VLA 物理 AI 大模型提出了几个概念:- L4能力=模型x算力x数据x本体- 实现看、听、读一体化融合,视觉思维链推理效率飙升 32 倍目前小鹏第二代VLA-全栈自研图灵芯片,算力利用率高达 82.5%,模型推理仅需 80ms- 日消耗 token 达 58.8 万亿,是全国数字 AI 调用量的 80 倍第二代VLA敲定2026重要里程碑- 平均接管里程提 25 倍、安全接管里程提 50 倍,模型参数 220 亿媲美 FSD- 年内实现 VLA+VLM 驾舱合流- 基于第二代 VLA 的 Robotaxi 年内正式运营小鹏目前的优势在于自研芯片➕仿真测试,大量的模型推理提高模型能力,为L4做准备#小鹏第二代VLA发布##小鹏智驾负责人称拉开差距的时刻到了#

52. DeepSeek 2026年4 月30 日发布几小时后删除的视觉模型技术报告,透露出哪些信息?

53. 【具身智能领域首个行业标准正式发布】财联社3月26日电,中国信息通信研究院联合40余家单位共同起草的具身智能领域首个行业标准今天(3月26日)正式发布,该标准为具身智能领域构建了统一基准测试框架,标志着具身智能评测迈入“有标可依”的新阶段。据了解,这项标准聚焦人工智能关键基础技术和具身智能基准测试方法,同时明确了具身智能系统框架和能力要求,将于2026年6月1日正式实施。标准规范了在仿真环境和真实环境下,面向具身智能系统的基准测试框架、方法和指标。标准提出的评测体系支持基础能力、认知推理能力以及全链路闭环能力的测试,覆盖静态仿真测试、动态仿真测试、真实环境测试和组合式测试四种测试方法。专家指出,为确保标准的可操作性,在标准编制过程中,同步建设了配套测试任务库、测试工具和标准测试环境。目前已建设1万多条测试任务库,覆盖工业、家庭、零售、物流等300种任务类型。构建了数据采集和管理、仿真任务生成和指标自动化计算等测试工具。 (央视新闻)

54. DeepMind 提出「拼图式 AGI」,如何设计机制保障其安全?

55. AI 操作多台 3D 打印机制作模型|方法分享 智谱GLM5.1测试

56. AI智力天花板崩了!GPT-5.5 Pro视觉智商145,撞倒门萨俱乐部门槛

57. 张文宏拒绝将 AI 引入医院病历系统,称会影响医生的诊断思维,如何评价? 医疗诊断中应该怎么用 AI?

58. #文远知行CEO称特斯拉不是纯视觉# 5月17日,在#2026轩辕汽车蓝皮书论坛#上,文远知行创始人兼 CEO韩旭在回答主持人提问时表示,特斯拉并不是纯视觉方案,这是人云亦云,实际上特斯拉的世界模型中的输入端有“听觉”的参与,是多模态。 电动扒士的微博视频

59. 苹果发了Studio Display XDR 的技术白皮书,链接:网页链接其中一个值得关注的部分苹果也自己琢磨了个 CMF。校准空间Apple 显示器采用先进的校准流程,确保亮度、白点和色域等视觉特性与标准目标精确对齐。然而,随着 KSF LED 背光、量子点转换片和 OLED 等新显示技术的出现,即使使用当前标准校准到相同目标的显示器也可能呈现出显著不同的外观。这揭示了基于 CIE 1931 配色函数(CMF)的标准色度系统的局限性,该系统广泛应用于传统显示器校准行业。配色函数是人眼对可见光敏感度的数学表示,表征人类如何感知颜色。Apple 开发了 Apple CMF 2026 以解决 CIE 1931 CMF 的局限性,Studio Display XDR 是首款支持该标准的 Apple 显示器。Apple CMF 2026 代表了显示器测量和校准方式的根本性改进,解决了行业中长期存在的系统性外观不匹配问题。Apple 正通过国际照明委员会(CIE)参与标准化工作,以开发并定义行业通用标准,无论客户使用哪家制造商的显示器,都能获得更好的视觉一致性。每台 Studio Display XDR 均使用 Apple CMF 2026 进行单独校准,开箱即可获得最佳体验。参考预设中仍继续支持 CIE 1931。要准确测量显示器,测量仪器必须支持并设置为所测量预设的 CMF。Apple 已与校准仪器和软件供应商合作,增加对 Apple CMF 2026 的支持。

60. 让AI具备"自我反思"能力

61. 视觉语言模型不确定性量化。📚arXiv: 2602.21054

62. 视觉语言模型不确定性量化

63. 《可解释的智能体AI框架

64. 浙大

65. ACL 26 | 浙大VL-Calibration

66. 当大模型学会说“我不太确定”——不确定性量化(UQ)

67. 你信任的AI视觉理解,可能全是自我幻觉

68. 为啥AI宁可瞎编,也不直接说“我不会,不知道”呢?它到底咋想的

69. 5.9.8、AI没有自我显意识,所以也缺乏自我反省意识 - 哔哩哔哩

70. 科学家发现AI的视觉与人类不同,这导致它对物体分类时造成问题

71. ACL 2026|多模态大模型是“看错”还是“想错”?浙大 VL-Calibration 让模型学会校准自信

72. 4B模型幻觉抑制能力超越GPT-5,CMU等提出行为校准强化学习新方法

73. 浙大团队破解多模态模型「盲目自信」

74. 模型校准是什么?让AI学会“知道自己不知道”

75. [CVPR 2026]Linking Perception, Confidence and Accuracy in MLLMs

76. 论文分享 | COREA

77. 认知边界

78. AI机器人“看见”不等于“知道”:北卡罗来纳大学团队揭示视觉AI在空间判断上的致命盲区

79. 人类秒懂,AI却懵圈:VLM2-Bench揭示视觉语言模型「视觉关联」能力短板

80. 法国Valeo.ai和索邦大学联手:只需加入一点点“视觉训练题”,AI看图能力大幅提升

81. 【Nature子刊】深度学习不确定性校准颠覆性研究!

82. 打破确定性魔咒!北航团队提出VBF++:用“不确定性建模”刷新多模态视频推荐 SOTA

83. 《认知觉醒》第三章元认知——人类的终极能力 第二节自控力

84. 姜胡说直播提到的元认知是什么?

85. 三分钟论文速递 | 大语言模型如何“反思”自己的内部状态?

86. LLM跨阶段知识迁移:基准有效性、置信度校准与缩放动力学

87. CVPR2026 | 多模态推理不再“瞎编”

88. 为什么AI能看到世界,却不懂世界?

89. 面向自然科学的人工智能建模方法:从数据预处理、不确定性量化、可解释性分析,到时空建模

90. 【2026025】什么是元认知能力

91. 《认知觉醒》+元认知能力(如何获取元认知)

92. 视觉情感模型能说“不确定”了:EmoCaliber

93. 《认知觉醒》第6集|元认知。元认知——人类的终极能力 1.元认知,就是人类最高级别的认知,它能对自身的“思考过程”进行认知和理解。实际上,元认知能力就是自我察觉和反思的能力。 2.元认知最终可归为两类:被动元认知和主动元认知。 从被动到主动,这是一个转折点。当一个人能主动开启第三视角、开始持续反观自己的思维和行为时,就意味着他真正开始觉醒了。 3.反观,是元认知的起点。当你意识到自己在想什么,进而意识到这些想法是否明智,再进一步纠正那些不明智的想法,最终做出更好的选择。而人生恰恰是由无数个选择组成,不同选择的累加造就了不同的人生。 4.如何获取元认知能力 (1)提升元认知的工具需要从“过去”端获取,包括学习前人的智慧和反思自身的经历。 (2)自身的经历更是一种独特的财富。反思复盘自身的经历,可以获取经验,汲取教训,下次面临同样的问题可以做出更好的选择。 (3)启用你的“灵魂伴侣”。这里的所谓“灵魂伴侣”你可以想象一个监控一样的第三方视角,启用全局视角和未来视角,时刻提醒和纠正你该做什么不该做什么,聚焦于更重要的事情上。 (4)冥想。这种把注意力完全集中到呼吸和感觉的活动,可以带来极度专注,从而帮助大脑做健身操。大脑会更好聚焦于需要关注的地方上。 5.元认知能力,就是利用反馈机制帮助我们不断进化,进入快速进化的通道。 想拥有和掌握元认知能力并不容易,这需要不断的练习、练习、再练习。#认知觉醒 #读书成长#读书#好书推荐 #好书分享

94. 预测即真理:当贝叶斯遇见历史与世界模型

95. HaloProbe:贝叶斯框架破解视觉语言模型的物体幻觉

96. 世界模型112:三体框架-感知体-主动感知机制

97. 自博弈自进化视觉语言智能体。📚arXiv: 2511.15661 ✏️标题: VisPlay: Self-Evolving Vision-Language Models from Images 📄一句话介绍:利用无标注图像数据实现视觉语言模型自主演化 ✅个人观点:在具备可验证奖励的任务中,RLVR 是当前最可靠的方法;而在缺乏外部监督的开放场景中,Self-Evolving 提供了通向通用多模态智能的必要路径。 🎯动机 当前视觉语言模型(VLM)在强化学习后训练中普遍依赖人工标注数据或任务特定的启发式规则来定义可验证奖励。然而,高质量多模态标注成本高昂、难以规模化,且严重制约了模型在复杂、开放场景中的泛化能力。尽管自演化(self-evolving)机制已在纯文本大语言模型(LLM)中取得显著进展,其在VLM领域的探索仍处于起步阶段。本文旨在突破对人类监督信号的依赖,构建一个仅从海量无标注图像中自主生成挑战性任务并持续提升推理能力的自进化框架。 💡方法与创新 VisPlay将单个基础VLM分配为两个协同演化的角色:(1) 图像条件提问者(Questioner):根据输入图像生成具有挑战性且可回答的视觉问题;(2) 多模态推理者(Reasoner):基于图像和问题生成回答。两者通过GRPO联合训练。 核心创新在于奖励设计:提问者使用不确定性奖励(鼓励生成置信度接近0.5的问题)和多样性正则化(基于BLEU相似度聚类惩罚重复问题);推理者通过多数投票生成伪标签,过滤中等难度样本(置信度在0.25-0.75之间)用于训练。两个角色通过迭代训练相互强化,问题难度逐步提升的同时推理准确率持续提高 📊实验设计 VisPlay在Qwen2.5-VL和MiMo-VL两个模型系列上验证,评测涵盖MM-Vet、MMMU、RealWorldQA、MathVerse、HallusionBench等8个基准。Qwen2.5-VL-3B经过3轮迭代后平均得分从30.61提升至47.27;幻觉检测得分从32.81升至90.54。值得注意的是,VisPlay的性能(47.3)与人工监督GRPO训练(47.1)相当,证明自生成监督信号的可行性 #智能体 #AI #多模态 #大模型 #知识前沿

98. 物理AI“世界模型”落地:从视觉推理到工业仿真的产业链拆解

99. 港科:为什么你的多模态模型没在看图?

100. 解决大模型幻觉无需外部强模型!利用模型自身能力完成在线自校准 【多模态论文解读】

101. 元认知能力:人人都有,但程度不同 简单来说:每个人天生都具备元认知能力,但它像肌肉一样,需要刻意练习才能变强。 元认知就是对自己思考过程的认知与监控,比如: 发现自己刚才的想法太情绪化了 意识到“我现在有点钻牛角尖” 复盘“我为什么会做出这个决定” 调整学习方法:“这个记忆方式效率太低,换一个” 懂得观察和审视自己的思维,通过写日记、自我复盘来不断调整想法。人的大脑在25岁前可塑性很强,只要愿意练习觉察与内省,每个人都能更好地掌控自己的思想,成为更认可的自己。#积极心理学

102. 【Lumina Talk 第26期】BayesVLA:贝叶斯因式分解,破解语言泛化难题

103. PaLMR:通过过程对齐解决MLLM推理幻觉!

104. 海市蜃楼:视觉大模型的幻象与真相

105. 【浙大】当 Mamba 遇上不确定性建模:眼科 AI 的一次系统升级

106. 元认知能力

107. LLM信心校准新突破:正交分离

108. #ai未来趋势 视触觉感知世界模型 Visuo-Tactile World Models 这项研究介绍了一种名为 VT-WM 的多任务视觉-触觉世界模型,旨在提升机器人处理触觉密集型任务的能力。通过将传统的视觉观察与触觉传感数据相结合,该模型克服了仅依赖视觉时常见的物体消失或物理逻辑错误等缺陷。实验数据表明,由于整合了触觉反馈,该系统在维持物体恒久性和遵循物理运动规律方面分别提升了 33% 和 29%。这种对接触动力学的深刻理解使得机器人在真实环境中的零样本规划成功率最高提升了 35%。此外,VT-WM 展示了极高的迁移能力,即便只有极少量的演示样本,也能快速适应全新的操作任务。综上所述,该研究证明了多模态感知对于构建更精确、更可靠的机器人物理世界模型至关重要。#人工智能 #人工智能机器人 #机器人触觉 #流量扶持

109. 西北大学:视觉大模型任务进展估计

110. 让大模型自己当裁判:Vision-SR1登场

111. 改3%的训练数据,多模态AI看图推理明显变

112. [论文速读](CVPR 2024)Mitigating Object Hallucinations in Large VLMs through Visual Contrastive Decoding

113. AAAI 2026 | MEDALIGN:对齐蒸馏革新医疗大视觉语言模型,告别幻觉输出

114. 多模态大模型引领:计算机视觉的下一个爆发点

115. 自省式检索Self-RAG,让AI学会知之为知之,构建可信赖的问答闭环

116. 自蒸馏让大模型变"自信"了,推理能力却崩了——不确定性才是推理的命脉

117. 置信度的原理、AI安全中的作用以及挑战

118. CVPR 26 爆款方向!多模态幻觉检测,POPE评测让VLM不再"瞎编"!

119. 北大最新NC:大脑如何学习新概念?神经贝叶斯模型揭示皮层结构先验的关键作用

120. 可解释人工智能 (XAI):6 不确定性量化

121. USC:多模态大模型的视觉反思幻觉

122. 通过多模态世界模型实现视觉语言推理与导航

123. LLM推理中的不确定性

124. 论文速览 | 深度模型不确定性校准:方法、挑战与大模型前沿

125. TGRS|北航团队结合不确定性估计优化提出遥感图像可靠超分新方法

126. 面向自然科学领域机器学习与深度学习技术【高维数据预处理—可解释ML/DL—时空建模—不确定性量化-全程AI+Python场景】

127. AAAI 2026 | 用 3.5M 参数,把 DINOv2 的深伪检测泛化能力拉满

128. 图神经网络拓扑感知PAC-贝叶斯泛化分析

129. 从哈佛“元认知”研究到AI Harness——真正的高手都在练这一种能力

130. DeepSeek自己知道自己不知道意味着什么

131. 这是一个关于AI安全机制、认知局限与知识生产的元研究主题 - 哔哩哔哩

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章