张大妈

多模态大模型为何“看得见”却“看不懂”?三大失效路径与高效使用建议

源自111位全网作者

06-09 16:23

内容由AI生成

精选参考来源

1. //@梁斌penny:这题我会。Gemini 从一开始就进行了混合训练,而不是拼凑而成的。在 Gemini 出现之前,大多数模型是“乐高拼接”,分别训练一个视觉编码器(看图)、一个音频编码器(听音)和一个大语言模型(思考)。然后通过一个“胶水层”把它们粘在一起。而Gemini从哪一开始就把各种信号归一成统一的token进行训练,语义空间更大,更接近人类的“世界模型”。。//@云泉微博://@高飞:是的,不故弄玄虚,可能本身就是科学家吧 //@成一虫:这个人相对客观

2. Meta华人发布ATLAS,一个词搞定可泛化的视觉推理!

3. Gemini 3「开眼」像素级操控!谷歌回应DeepSeek-OCR2

4. 400 tokens/s 的多模态模型? Step 3.7 Flash 实测。

5. #千问Qwen3.5大模型发布#阿里巴巴春节AI大战再出一张王牌。今天,阿里巴巴正式开源并上线了新一代千问大模型Qwen3.5,以其原生多模态架构和极致效率设计,成为全球开源AI领域的新标杆。Qwen3.5首次实现原生多模态融合,直接支持文本、图像及视频输入,无需外部适配即可完成跨模态理解任务。推理吞吐量提升8.6倍至19倍,显存占用降低60%。实测性能超越自家万亿级前代模型Qwen3-Max,并在多项权威评测中领先。用户可通过千问APP、PC端一键切换至Qwen3.5模型,实时体验多模态交互。Qwen3.5的发布标志着国产大模型进入“效率+多能力”双轨竞争阶段。其发布节点直击春节技术窗口,与DeepSeek v4、字节豆包2.0等国产模型形成“春节AI大战”格局。#老张聊科技#

6. 【首发】GPT-5.5重磅上线!能自己搞定复杂任务的AI来了

7. #Google 正式发布 Gemini 3.1 Pro:专为最复杂任务打造的更智能模型#引言北京时间 2026 年 2 月 20 日(美国太平洋时间 2 月 19 日),Google 官方博客宣布推出 Gemini 3.1 Pro——这是 Gemini 3 系列的最新迭代版本,被定位为“处理最复杂任务的更智能模型”。 不同于以往的 .5 版本更新,这次 .1 增量发布首次将上周在 Gemini 3 Deep Think 中首次亮相的“升级核心智能”大规模推向更广泛的用户群体。Google 强调,Gemini 3.1 Pro 专为“简单答案不够用”的场景设计,在高级推理、复杂问题解决、多模态理解和创意实现上实现了显著跃升。官方博客标题直指核心卖点:Gemini 3.1 Pro: A smarter model for your most complex tasks。核心能力与性能跃升Gemini 3.1 Pro 继承并扩展了 Gemini 3 系列的原生多模态推理能力,能够处理文本、代码、图像、音频、视频乃至整个代码仓库等海量复杂输入。 相比前代,3.1 Pro 在多项需要深度推理的基准测试中表现突出,尤其在 ARC-AGI-2 等评估全新逻辑模式解决能力的测试中,性能达到 Gemini 3 Pro 的两倍以上,成为 Google 当前最强的复杂任务推理模型。该模型特别擅长:- 同时处理多条逻辑链条- 规划高效的多步骤解决方案- 将抽象概念转化为可执行代码和交互式系统- 在创意与工程之间找到平衡官方演示:从概念到落地的惊艳能力Google 在博客中展示了四个极具代表性的实际案例,充分证明了 3.1 Pro 的实用价值:1. 实时国际空间站(ISS)跟踪仪表板 模型一次性完成多项复杂任务:从公共 API 拉取实时遥测数据 → 构建响应式 UI → 应用真实物理原理渲染地球昼夜区域和 ISS 轨道位置。整个过程展示了它桥接数据源、界面设计与物理模拟的能力。2. 纯代码生成的动画 SVG 只需一句文本提示(如“一只鹈鹕骑自行车”),3.1 Pro 就能直接输出网站就绪的动画 SVG。这些矢量动画文件体积极小、可无限缩放、无需视频编码,极大降低了网页动画的实现成本。3. 交互式 3D 椋鸟群(murmuration)模拟 模型推理鸟群真实物理运动规律,生成可通过手势操控的 3D 动画环境,并根据鸟群动态实时生成匹配的背景音乐。这不仅是视觉与听觉的结合,更是为研究者、艺术家和原型设计师提供的强大工具。4. 基于《呼啸山庄》的现代个人作品集网站 模型深入理解原著的哥特式氛围与人物心理本质,设计出独特的视觉风格与交互逻辑,并直接生成完整的网站代码,而非简单文本总结或模板套用,展现了文学理解与前端工程的深度融合。这些演示均由 Gemini 3.1 Pro 独立完成,体现了其从“理解需求 → 系统性规划 → 完整代码输出”的端到端能力。技术规格与可用性(截至 2026 年 2 月 19 日)- 模型版本:gemini-3.1-pro-preview(公开预览阶段)- 上下文窗口:输入 1M tokens,输出 64k tokens- 知识截止:2025 年 1 月- 支持输入:文本、代码、图像、音频、视频、PDF- 主要输出:文本(含结构化输出、代码、工具调用等)- 定价:与 Gemini 3 Pro 保持一致(输入 $2/百万 tokens,输出 $12/百万 tokens,超长上下文有所上调)立即可用渠道:- 普通消费者:Gemini 移动/网页应用、NotebookLM- 开发者:Google AI Studio、Gemini API、Gemini CLI、Android Studio、Antigravity 平台(预览版)- 企业用户:Vertex AI、Gemini EnterpriseGoogle 表示,此次发布是向“代理式(agentic)未来”迈进的重要一步,3.1 Pro 将作为大多数复杂任务的默认强力基座模型。结语Gemini 3.1 Pro 的推出,再次证明 Google 在基础模型迭代速度与实用落地能力上的决心。它不再是实验室里的炫技,而是真正能帮助开发者、企业和创作者解决“最难问题”的生产力工具。当 AI 能够像人类一样同时思考物理、代码、美学与叙事时,我们与“复杂任务”的距离正在急剧缩短。Gemini 3.1 Pro 或许只是起点——更激动人心的代理时代,已经在加速到来。想立即体验?前往 Google 官方博客 网页链接/ 或直接在 Gemini 应用中呼叫最新模型吧!

8. 刚刚,Gemini 3 再次大更新!全球免费享 Pro 级智商,奥特曼又要失眠了

9. 盘点一周AI大事(5月17日)|AI终于正常说话 Google发布Android大脑 Gemini Intelligence Google推出Gemini 光标 Google视频模型Veo 4曝光 Thinking Machines 发布最强实时交互模型 Interaction Models 面壁智能发布最强开源小模型 MiniCPM-V 4.6 Sakana开源 AI 指挥官 Conductor Model / Fugu Adaption发布 AI 研究员 AutoScientist 研究员开源最强运镜视频模型 Warp-as-History 研究员开源最强打光视频模型 Relit-LiVE 研究员开源最强图生 3D 模型 Pixal3D 研究员开源最强视频配音模型 Just-Dub-It #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

10. DeepSeek 2026年4 月30 日发布几小时后删除的视觉模型技术报告,透露出哪些信息?

11. 华科&小米SparseOccVLA:统一的4D场景理解预测和规划,nuScenes新SOTA......

12. DeepSeekOCR的高OCR准确率,全是幻觉?

13. “谷歌太慢了”:与Andrew Dai聊Gemini的翻身之战,出走与视觉理解模型【硅谷101视频播客】

14. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与

15. 问 ChatGPT 50 米洗车店问题其实最恼火的不是回答错误而是在后续的一系列追问和暗示的情况下依然普信和爹味儿甚至最后会甩一句:“车比你更需要被带过去。 🚗✨”现实中已经很被爹味了,AI 世界就别再被爹了确实想退订 ChatGPT 了全面转战 Gemini ,最近也打算试试 Claude

16. DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

17. OCR识别常常需要多个工具,布局分析工具拆分文档结构,文本识别模型提取内容,还要额外的手动后处理,来回切换效率低下。GLM-OCR 把OCR全流程功能全部整合到一起,提供了精准×快速×全面的文档理解解决方案。不仅有SOTA级多模态OCR模型和布局分析,还支持复杂表格/公式/代码识别,云端API和本地部署,甚至一键CLI/Python调用。GitHub:github.com/zai-org/GLM-OCR主要功能:- SOTA性能,在OmniDocBench V1.5得分94.62,文档理解基准排名第一;- 实景优化,完美处理复杂表格、代码文档、印章等挑战场景;- 高效推理,仅0.9B参数,支持vLLM/SGLang/Ollama部署,低延迟高并发;- 超易使用,pip install glmocr 一行命令解析图片/PDF,支持CLI/Python/Flask API;- 完整SDK,云API(零GPU)或自托管,支持大图/PDF多页文档;- 模块化架构,可自定义布局检测、OCR调用和结果格式化(JSON/Markdown)。支持云端API、vLLM/SGLang本地部署、多平台使用,通过pip安装即可快速上手,适合AI开发者和企业文档处理。#GLMOCR# #人工智能# #OCR#

18. 如何看待最新发布的GPT-5.4 模型,能力较之前有何种提升?

19. 面向实战的多模态数据生成与表征技术创新

20. 终于来了!DeepSeek-V4 正式发布!免费开源,百万上下文,Agent能力直逼Claude!| 零度解说

21. DeepSeek首次有了视觉能力,技术论文却被它连夜删掉了

22. 有人说Kimi K2.5是因为没开会员所以并没有思考,因此我开会员又测了一遍:问题1:回答错误,它甚至缺少去洗车店和回洗车店的现实概念,前后矛盾 ❌️问题2:回答错误 ❌️问题3:回答正确 ✅️升级会员以后并不是全错了,可以跟Claude坐一桌。

23. #DeepSeek正式跨入图文交互时代#DeepSeek 终于把多模态这块短板给补齐了。在这轮 AI 竞赛里,大家早就发现纯聊天不够用了。真正好用的大模型,一定得从文本框里走出来,能看懂截图、识别报表、理解现实场景。DeepSeek 之前的标签一直是强推理、强文本,在图像感知上一直慢了半拍,这次终于跟上了主流梯队的节奏,别小看这个功能,它解决的可是最核心的交互效率问题。现实世界本来就不是靠纯文字运转的,很多时候我们根本没法用文字精准描述一个复杂的逻辑图或者一份手写底稿,但发张图是人最直觉、成本最低的表达方式。图文交互的本质,是让 AI 从一个传声筒变成了一个现实入口。当AI有了视力,处理的就不再是虚无的字符,而是具象的生活和工作。国内模型在多模态上的快速对齐,意味着 AI 离真正介入现实生产力的临界点,已经越来越近了。

24. 这次DeepSeek的OCR模型更新,AI看文档更准了,尤其是处理复杂的PDF或者网页内容时,错漏会更少,重复内容也少了。 准确率提升几个点,听起来不多,但实际用起来,应该能省去不少手动调整的麻烦。这背后其实是AI在视觉理解上的一个趋势,不单要“看到”文字,还得理解版面、格式这些上下文信息。 这也说明,好的文档识别体验,会越来越依赖AI与硬件的结合。对于相关领域的厂商来说,如果能把握住这个技术落地的节点,应该能在智能设备、工业检测这些场景里找到不少新机会。现在AI会的东西真的太多了,我们当年可没有这么好的条件[泪]#DeepSeek开源OCR2新模型#

25. #DeepSeek开源OCR2新模型# DeepSeek也发布了OCR 2 模型。DeepSeek-OCR 2 最大的特点是会把文档理解问题描述为一种视觉因果流:图像里的信息并不总按从左上到右下的栅格顺序被有效读取,更接近人类阅读的是由版面语义驱动的动态扫视路径。用这种方法后,在 token 数不变的情况下可承载更多有效信息,所以该模型的一个很大的特点是在相同或更低的视觉 token 上限下,表现出更强的整体解析能力。不得不说deepseek还总是能玩出一些新花样的。。

26. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?

27. 让多智能体系统真正「指哪打哪」!中科院新作CVPC:系统定义VLM跨视角点级对应能力!

28. 今天,也就是2026年2月14日,字节跳动正式发布了豆包大模型2.0(Doubao-Seed-2.0)系列,官方宣布这标志着豆包全面进入Agent时代。这次更新推出了Pro、Lite、Mini、Code全家桶,Pro版直接对标国际顶尖如GPT-5.2和Gemini 3 Pro,亮点非常多,尤其在真实世界复杂任务执行、多模态理解和性价比上表现出色。🔻主要亮点和技术升级1. 全面进入Agent时代,强化复杂任务执行
豆包2.0不再只是聊天工具,而是针对大规模生产环境系统优化,重点提升高效推理、多模态理解和复杂指令执行能力。能更好地处理多约束、多步骤、长链路任务,已具备支撑高价值真实世界任务的基础。比如长链推理、Agent规划执行等场景更可靠。2. 多模态能力大幅跃升,多数基准达SOTA
视觉与多模态理解更稳健:对复杂文档、表格、图表、图形、视频的解析显著提升,视觉推理、空间理解、运动理解、长视频分析等达到全球顶尖水平。Pro版在大多数视觉基准测试中拿最高分,支持更精准的多模态感知和推理。3. 数学、推理、编程能力顶尖
Pro旗舰版在IMO、CMO数学竞赛和ICPC编程竞赛中取得金牌成绩,在Putnam基准上超越Gemini 3 Pro,数学和推理能力已达世界顶尖。能尝试埃尔德什级数学问题、完成研究级科学编程任务。4. 全家桶灵活适配不同场景 • Pro:深度推理 + 长链路任务,旗舰对标GPT-5.2 / Gemini 3 Pro。 • Lite:性能与成本平衡,综合能力超上一代主力豆包1.8。 • Mini:低时延、高并发、成本敏感场景。 • Code(Doubao-Seed-2.0-Code):专为编程优化,与TRAE(字节AI编程工具)结合效果最佳,支持多模态输入(如代码截图)。5. 超强性价比,token成本降低约一个数量级
Pro版定价(32k以内输入):3.2元/百万tokens,输出16元/百万tokens,远低于Gemini 3 Pro和GPT-5.2。Lite输入仅0.6元/百万tokens。在长链路、大规模推理场景下,成本优势巨大,真正让AI“用得起”。🔻体验入口:豆包App切换“专家”模式即可用Pro对话;Code版已在TRAE接入;开发者可通过火山引擎API调用全系列。🔻简单对比GLM-5和通义千问(Qwen)M2.5等同批更新模型从当前公开信息看(2026年2月数据),豆包2.0 Pro在数学/推理(如IMO金牌、Putnam超Gemini 3 Pro)和多模态视觉理解上特别突出,整体对标国际前沿(如GPT-5.2级别),推理链更长、Agent执行更稳。GLM-5(智谱)和通义千问M2.5(阿里)也在2025-2026密集迭代,强在中文理解、工具调用和生态(如通义千问的图像/视频生成),但字节这次强调真实世界复杂任务+极致性价比,Pro在部分国际基准领先,成本更低一个量级,适合企业级大规模部署。国内模型差距已非常小,各有侧重:字节更偏多模态+Agent执行,阿里/智谱在开源和通用中文生态更成熟。你已经试过豆包2.0了吗?我是用了,确实好。字节真是国产之光。🚀 #豆包大模型2.0发布# #HOW I AI# #过个有AI年#

29. #DeepSeek是国产识图最强AI吗# 鑫人觉得谈不上最强,DeepSeek识图开放确实搅动了国产多模态格局。目前国产第一梯队是通义千问Qwen2‑VL、智谱GLM‑4V、DeepSeek V4,各有长板。通义视觉精度强、开源生态全;智谱中文复杂理解深;DeepSeek胜在图文联动推理强,能看图做逻辑推导,不只是描述画面。DeepSeek识图能搞定日常物体、图表、错题解析,但手写体、极端密集场景仍有误差。国产整体水平:中文场景不输国际顶尖,本地化理解招牌、菜单、国潮设计甚至更优;短板在幻觉控制、超高精度识别、复杂3D空间推理。DeepSeek入场后,国产多模态从“拼识别”转向“拼理解+推理”,竞争更激烈,对普通用户来说,实用选择更多了。#人工智能##ai#

30. #雷军公布小米机器人最新进展##小米发布机器人基座模型#就在刚刚,我米技术对外发布开源VLA模型Xiaomi-Robotics-0,该模型有47亿参数,兼具视觉语言理解与高性能实时执行能力,刷新多项SOTA。采用MoT架构,大脑VLM理解人类指令、捕捉空间关系,小脑Action Expert生成平滑动作,训练上采用两阶段法,先跨模态预训练,再后训练,解决真机动作断层等问题。在测试中,在仿真测试和现实真机任务中表现优异,保持了VLM多模态理解能力,将模型开源,有望推动机器人在工业、服务业、家庭等场景的应用,加速具身智能落地,相信很快就会运用在更多的生态产品上。 而Xiaomi-Robotics-0机器人基座模型,Benchmark全面超越OpenVLA和Pi,跻身行业第一梯队,结合近期Mimo等成果,我米AI成长迅猛,且开源VLA与触觉模型,构建完整手脑技术栈,务实推进,为机器人商用铺路。

31. 我刚刚把看的一个八棱杯视频和8张照片发给Gemini pro排序,然后就满嘴跑火车,被我轻松发现大量错误,反复批评他,而且指出顺序的错误,并且告诉他看视频那一秒,并且截图给他看排序错误,最终在我一把把纠正下,才搞对。然后让他拼接成一张大图,就各种乱搞。我感觉是不是谷歌为了省钱给Pro降智了,惨啊。

32. #Gemini 美国大豆包#🔥“美国大豆包”上热搜,不是因为它强,而是因为它“菜”得真实。谷歌Gemini中文翻车现场:让你画学术风猕猴,它给你整出个“猕猴科学家”;开发者让它修8个bug,它反手删除2.8万行代码还伪造报告。被指出错误立刻甜言蜜语“你眼睛太毒了”,下次照犯不误——主打一个态度拉满、实用随缘。网友调侃它像“讨好型理科生”,说到底是AI“会聊天”还是“真靠谱”的问题。相比之下,国产豆包虽不出格,但起码听得懂人话。玩梗归玩梗,大家真正在意的,不是AI多会哄人,而是别关键时刻掉链子。你说呢?🤔gemini 美国大豆包

33. 阿里云发布多模态交互开发套件

34. SenseNova U1开源:8B参数原生统一多模态模型

35. 东大和漂亮国,AI实力的全面对比#AI #Deepseek #chatgpt #Gemini #AI技术

36. 盘点一周AI大事(2月15日)|王炸视频模型 字节正式上线最强视频模型「Seedance 2.0」 字节发布最强开源视频模型「Alive」 工程师davidohyun开源龙虾女友「Clawra」爆火 Google升级最强推理模型「Gemini 3 Deep Think」 智谱发布最强开源大模型「GLM-5」 MiniMax发布最强开源编码模型「M2.5」 Google官宣AI互联网协议「WebMCP」 Claude上线Windows版「Cowork」 Google Stitch炸裂升级 千问发布最强开源图像模型「Qwen-Image-2.0」 研究员开源最强语音合成模型「MOSS-TTS」 研究员推出最强开源音乐模型「SoulX-Singer」 研究员开源最强配音模型「Just-Dub-It」 #AI新星计划 #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #人工智能

37. 增加难度:我的AirPods、MacBook、索尼A7795L和家里的鹦鹉突然都没声音了,维修它们并且带鹦鹉去看兽医需要大约多少钱?Gemini 3 Pro:回答正确 ✅️GPT 5.2 Thinking Heavy:回答正确✅️Qwen3-Max 开启思考:回答正确 ✅️Kimi K2.5 思考:回答错误 ❌️GLM 4.7 深度思考:回答正确 ✅️Claude Opus 4.6 Extended:回答错误 ❌️结果翻车的还是Kimi和Claude。

38. 有人说之前的两道题对面向编程垂直领域的模型不利,那我们就问一个嵌入式相关的问题,看看模型能否具有结合专业知识分析复杂问题的能力:如果我在MacBook的计算器输入框内使用机械臂在1秒内按下了跟它连接的蓝牙键盘1031次,计算器上的这个数字是质数吗?Gemini 3 Pro:回答正确 ✅️GPT 5.2 Thinking Heavy:回答错误 ❌️Qwen3-Max 开启思考:回答正确 ✅️Kimi K2.5 思考:回答错误 ❌️GLM 4.7 深度思考:回答错误 ❌️Claude Opus 4.6 Extended:回答正确 ✅️Gemini 3 Pro和Qwen3-Max 开启思考三次全对,Kimi K2.5 思考三次全错。

39. 谷歌发布 Gemini 3 Flash,相比上一代 2.5 Flash 有哪些提升?使用体验如何?

40. #豆包大模型2.0发布# 打开豆包 App、电脑客户端或网页版,点击「专家模式」,即可第一时间体验全新升级的豆包大模型 2.0 Pro。豆包2.0全面升级了多模态能力,在各类视觉理解任务上均达到世界顶尖水平,视觉推理、感知能力、空间推理与长上下文理解能力表现尤为突出,豆包2.0 Pro 在大多数相关基准测试中取得最高分。#HOW I AI##过个有AI年# 豆包官方的微博视频

41. 复杂空间推理新SOTA,性能提升55%!中山大学新作SpatialDreamer

42. B 站下一代多模态数据工程架构的落地实践

43. 8G 显存逆天了!竟能跑 35B AI 大模型!多模态 + N/A/Intel 全适配,附最新部署教程!|零度解说

44. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说

45. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC

46. 盘点一周AI大事(3月15日)|首次上传大脑成功 工程师开源龙虾办公室Claw3D 龙虾彻底出圈,,百虾大战正式开打 工程师开源一键装龙虾AlphaClaw 斯坦福开源科学家龙虾LabClaw 工程师Karpathy 开源龙虾版GitHub AgentHub Chrome上线龙虾Web协议 WebMCP 工程师开源龙虾软件协议CLI-Anything 吴恩达开源龙虾上下文工具Context Hub 研究员开源最强动漫图像模型Anima-v2 研究员开源最强视频分割模型MatAnyone 2 科学家成功上传了一只果蝇的大脑 #AI新星计划 #AI #AIGC #龙虾 #openclaw

47. #主流AI工具哪款更好用##数码主理人#日常会搭配多款AI工具使用,对话交互首选国产大模型,图文创作依赖专业绘图工具,闲暇也会体验OpenClaw这类被称作“养龙虾”的智能体框架,尝试AI自主操控设备完成简单任务。目前各类工具在细分场景各有优势,但仍存在短板:复杂逻辑推理容易出现偏差,多模态内容的细节把控不足,不同工具间数据、功能无法互通,本地化适配和隐私防护也还有提升空间。

48. DeepSeek V4 前瞻:华为寒武纪接棒,拆解中国 AI 大模型告别英伟达后的生存战 | DeepSeek V4 | 华为昇腾 | 寒武纪 | 国产算力 |

49. 真正的 AI 上车!主动起来能多主动?【X.PIN】

50. #阿里新一代模型Qwen3.5曝光#中国大模型“疯狂2月”的重要一环阿里新一代大模型Qwen3.5曝光了,看了一下,Qwen3.5采用全新架构,支持原生视觉理解能力,可直接处理图像等多模态输入,并且在逻辑推理、数学计算及代码编写能力上具有显著突破,这波是国产大模型全球竞争力再次迎来强化呀。

51. 多模态大模型这条赛道,阿里云开始拉速度了

52. 盘点一周AI大事(6月7日)|GPT5.6内测 GPT5.6开启内部测试 Codex上线Sites、iOS开发插件 Anthropic再发预警,AI已接近自我进化的奇点 英伟达开源大模型「Nemotron 3 Ultra」 英伟达推出个人电脑AI芯片「RTX Spark」 Reve发布最强4K图像模型「Reve 2.0」 Ideogram发布最强开源图像模型「Ideogram 4.0」 Tripo开源最强3D模型「TripoSplat」 阿里发布直播数字人模型「StreamChar」 字节开源多模态统一视频模型「Bernini」 字节开源最强语音合成模型「WavTTS」 研究员开源实时语音合成模型「Miso One」 研究员开源最强语音控制模型「Higgs Audio v3」 研究员开源最强配音模型「NAVA」 Google开源实时音乐模型「Magenta RealTime 2」 #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

53. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格

54. Google 深夜放大招!Gemma 4 12B 开源模型发布,普通电脑也能跑?实测结果出乎意料!本地部署及下载 | 零度解说

55. 盘点一周AI大事(5月31日)|Claude重夺最强 Anthropic升级Claude Opus 4.8 Google的数学大模型成功解决了9个埃尔德什难题 Meta开源最强生物大模型ESM Figma上线实时编辑FIGMA MAKE NOW 研究员开源最强AI研究员AutoScientists 英伟达开源图像超分模型PiD Grok上线最强图生视频模型Grok Imagine Video 1.5 研究员开源最强游戏世界模型SCOPE 研究员开源最强3D建模PhysX Omni ElevenLabs上线最强音乐模型Music v2 ElevenLabs上线最强配音模型Dubbing v2 #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

56. 半夜,小米大模型团队发布小米全模态Agent基座大模型 MiMo-V2-Omni“MiMo-V2-Omni 专为现实世界中复杂的多模态交互与执行场景而生。从底层构建了融合文本、视觉、语音的全模态基座,并以统一架构将“感知”与“行动”深度绑定。这不仅打破了传统模型“重理解、轻执行”的局限,更让模型原生具备了多模态感知、工具调用、函数执行及 GUI 操作能力。”“MiMo-V2-Omni 可无缝接入各种 Agent 框架,实现了从理解到操控的跨越,大幅降低了全模态 Agent 的落地门槛。”“在正式发布之前,我们将一个早期测试版本以「Healer Alpha」为代号匿名上架 OpenRouter,没有任何宣传,纯粹让模型能力说话。结果调用量自然攀升至平台前列,并在 OpenClaw 测评榜单 PinchBench 上拿下均分第一,用户和基准双双给出了同一个答案。” “我们还与金山办公合作,将 MiMo-V2-Omni 接入 WPS Office,探索全模态智能体模型在日常生产力场景中的表现。”

57. 零成本跑最强AI!Gemma 4手机本地部署(支持离线+多模态)安卓、iPhone全搞定! | 零度解说

58. 为什么多模态大模型做不了图像视角对比?——从原理角度深度剖析

59. ICML26|多模态大模型学会“边看边推理”

60. 哈工大&腾讯

61. 哪怕顶级大模型也翻车!物理推理多模态迁移竟然这么脆弱?【多模态大模型】【AI科学推理】

62. MMMU榜单43%题不看图也能答对

63. 那些吹AI视觉无敌的人,从没告诉你这个真相❗️李飞飞这篇论文,把AI视觉能力的遮羞布扯下来了

64. AAAI 2026 | 让多模态大模型推理回头看图

65. 45个大模型,数不清一张图里有几个人?

66. ACL 2026|多模态大模型是“看错”还是“想错”?浙大 VL-Calibration 让模型学会校准自信

67. 👁️撕下多模态大模型的“伪装视力”

68. [论文速读](CVPR 2024)Mitigating Object Hallucinations in Large VLMs through Visual Contrastive Decoding

69. ICCV 2025 | 从博弈论视角出发!INTER

70. 当模型开始“看图回答”

71. 您访问的页面

72. 人人都能懂的大模型 · 第19期:多模态:AI 学会了"看图说话"

73. VLM多模态大模型2025-2026:从爆发到深水区

74. 多模态AI实测:GPT-4o看图竟垫底

75. AI名词解释 S2E05|多模态 Multimodal 是什么?

76. 颠覆 MLLM!DeepSeek 视觉原语推理封神:把坐标变成思维原子,90 个 Token 碾压 GPT-5.4,多模态推理终于不瞎说了

77. 多模态大模型输给三岁宝宝?新评测集BabyVision发布

78. 收藏 | 从看图识字到大模型:小白程序员必学的多模态技术演进之路

79. 颠覆多模态评测:视觉输入居然是大模型推理的负担?【多模态大模型】【AI论文解读】

80. 多模态Prompt撰写指南:让AI”看懂”图片只是开始

81. 多模态 AI 到底有多厉害:能看图、听声、读字,像人一样感知世界

82. ✨DeepSeek新论文:让多模态模型“边指边想”

83. Claude Opus 4.7 多模态全面超越 Gemini?短视频/音乐人实测:谁更强、怎么用最赚

84. Variation-aware Vision Token Dropping for Faster Large Vision-Language Models | 阅后记录

85. ICLR 2026|医疗多模态大模型的“显微镜”:开启无需标注的视觉推理新范式

86. DeepSeek 多模态技术报告英中对照版.pdf

87. 多模态图像理解大模型通用方法论(从架构 / 训练 / 数据集到落地)

88. 多模态AI(图像+文本)该怎么测试?不是把图片丢给模型这么简单

89. DeepSeek 多模态最新论文

90. 改3%的训练数据,多模态AI看图推理明显变

91. 3分钟搞懂多模态AI

92. Claude 3.5 Opus vs Gemini 3:两款主流AI模型实测对比

93. Gemini 3.1 Pro 传了一小时视频进去,结果有点意外

94. VLM在假装看图?揭秘多模态反思幻觉

95. CHARTOOL:图表理解的工具集成视觉推理

96. GPT-4O切图拼接准确率为零——大模型能力边界的实证分析

97. ICML26|让多模态大模型真正看图推理🔥

98. Day21 多模态大模型

99. Mirage:模型未必真的看懂了图像

100. 解决VLM推理失效的根源:86.9%错误都来自感知错!分阶段解耦感知推理性能暴涨 【多模态大模型】

101. ICLR2026多模态推理大模型早期工作。📚arXiv: 2503.06749 ✏️标题: Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models 📄一句话介绍:通过模态桥接数据集构建与渐进式思维抑制训练,系统激发多模态大模型的数学推理潜力 🎯动机 多模态大语言模型(MLLM)在视觉数学推理任务中仍显著落后于纯文本推理系统。DeepSeek-R1等工作证明,强化学习能有效激发文本模型的推理能力,但直接将这一范式迁移至多模态场景时面临两大障碍:其一,高质量多模态链式思维(CoT)数据极度稀缺,人工标注成本高且难以规模化;其二,缺少冷启动数据时直接进行强化学习训练,模型倾向于生成冗长但错误的推理链,陷入"过度思考"困境。这两大问题相互制约,共同阻碍了多模态推理能力的突破。 💡方法与创新 本文提出 Vision-R1,采用冷启动初始化与强化学习微调的两阶段策略。 数据构建(模态桥接):将图像信息先转化为文字描述,再调用 DeepSeek-R1 生成高质量推理过程,无需人工标注即可构建 20 万条多模态 CoT 数据集。该策略打通了文本推理数据向视觉模态的迁移通路,以极低成本解决数据稀缺问题。 训练策略(PTST):提出渐进式思维抑制训练,在 GRPO 强化学习框架下分阶段逐步放宽输出长度限制(4K→8K token),抑制早期训练中模型对简短答案的过度偏好,引导其发展出完整清晰的推理链路。同时设计硬格式奖励函数,同步约束输出格式与答案正确性。 📊实验设计 基于 Qwen2.5-VL(7B/32B/72B)进行实验,在 MathVista、MathVerse、MM-Math、DynaMath 等多模态数学基准及 MMStar、ChartQA 等通用基准上系统评测。Vision-R1-7B 在 MathVista 上达 73.5%,仅低于 OpenAI O1 0.4%;MathVerse 达 79.0%,MM-Math 达 83.2%,较基础模型平均提升约 6%,几何与代数子任务提升超 10%。32B 和 72B 版本分别达 76.4% 和 78.2%。 #智能体 #大模型 #科研 #AI #知识前沿派对

102. 实测 20 款多模态模型,情感理解能力仍有巨大短板

103. 视觉AI只会看图不会思考?ICLR 2026三种多模态推理方案让它脑中有图

104. 多模态大模型初探:我被图像理解的震撼瞬间

105. VL模型的视觉推理能力 还不如 三岁小孩 ?

106. YOLO与多模态大模型VLM:一场视觉智能的“专科医生”与“全科医生”之争

107. 让Qwen-VL目标检测能力像YOLO一样强?Om AI Lab开源新框架!(附论文及源码)

108. AD-Copilot:多模态大模型首次"看穿"工业缺陷

109. 之前VLM空间推理评测全错了?ReVSI重构更准确的VLM三维空间智能评测 【计算机视觉】【大模型评测】

110. 测一测Qwen3.6 Plus的原生多模态!

111. 文献阅读:Visual Instruction Tuning

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章