从“能看图”到“能做事”:多模态大模型的能力跃迁与落地实践

源自159位全网作者

05-30 17:23

内容由AI生成

精选参考来源

1. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与

2. 2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】

3. 多模态大模型这条赛道,阿里云开始拉速度了

4. #千问Qwen3.5大模型发布#阿里巴巴春节AI大战再出一张王牌。今天,阿里巴巴正式开源并上线了新一代千问大模型Qwen3.5,以其原生多模态架构和极致效率设计,成为全球开源AI领域的新标杆。Qwen3.5首次实现原生多模态融合,直接支持文本、图像及视频输入,无需外部适配即可完成跨模态理解任务。推理吞吐量提升8.6倍至19倍,显存占用降低60%。实测性能超越自家万亿级前代模型Qwen3-Max,并在多项权威评测中领先。用户可通过千问APP、PC端一键切换至Qwen3.5模型,实时体验多模态交互。Qwen3.5的发布标志着国产大模型进入“效率+多能力”双轨竞争阶段。其发布节点直击春节技术窗口,与DeepSeek v4、字节豆包2.0等国产模型形成“春节AI大战”格局。#老张聊科技#

5. 市值近600亿,大模型公司上市了! #AI #智谱ai

6. #阿里CEO称几场大仗都打得漂亮#2025年,阿里巴巴在人工智能领域多点开花,既实现大模型技术跃迁,又完成规模化商业落地,成为国内AI发展的重要标杆。阿里发布Qwen3混合推理大模型系列,涵盖多款密集型与混合专家模型,支持119种语言,36万亿tokens训练数据量较前代倍增,在数学推理、编程等基准测试中表现顶尖。斯坦福大学《2025年人工智能指数报告》显示,阿里6款通义千问模型入选全球重要AI模型,贡献度位居全球第三、国内第一,中美顶尖模型性能差距缩小至0.3%。其开源生态更是领跑全球,衍生模型超17万个,下载量突破6亿次,超越Llama成为全球最大开源模型族群。阿里大模型无疑代表国内AI第一梯队水平。从技术实力看,它在多模态能力、智能体整合等领域比肩国际巨头,Gartner报告中其语言AI技术位列全球第二。从行业影响看,通义千问服务超百万客户,覆盖金融、科研、制造等多领域,为国内企业提供标准化技术范式,彰显中国AI的研发与转化能力。应用落地成效显著,天猫双11成为AI规模化验证场。基于通义千问的引擎让复杂查询相关性提升20个百分点,商家广告回报率增12%;AI工具包为千万商家生成海量营销素材,虚拟试衣技术实现衣物细节精准还原。通义千问助力研发全球首个太阳大模型金乌,胰腺癌筛查模型入选《财富》榜单,实现从商业到科研的跨域赋能。#秒懂热点就用智搜# 阿里ceo称几场大仗都打得漂亮

7. #小米大模型#啥?小米大半夜发了3个模型~小米放大招,连发三个模型Xiaomi MiMo-V2-Pro & Omni & TTSXiaomi MiMo-V2-Pro 超1T参数,激活参数42B,上下文1M,混合注意力,混合比例7:1,专为agent而生,Claw榜单上,国内模型第一,见图2。MiMo-V2-Omni 全模态模型,对音频理解,图像理解,视频理解有较高的提升,同时具备了多模态感知、工具调用、函数执行及 GUI 操作能力。可直接接入现有agent框架,限时免费使用一周。Xiaomi MiMo-V2-TTS 语音合成模型,经过上亿小时语音数据的预训练与多维度强化学习,可以进行多粒度语音风格控制。

8. 盘点一周AI大事(5月24日)|最强AI同声传译 Codex再进化,电脑息屏也能远程派活 OpenAI新模型数学界80年猜想 Google发布AI科学家 AI Co-Scientist Google推出多模态大模型Gemini Omni Google升级AI画布Stitch Agent 阿里发布国产最强大模型Qwen3.7-Max 阿里开源直播试穿模型FashionChameleon 字节开源多模态模型Lance Odyssey 连发世界模型Starchild-1 Agora-1 研究员开源室内设计世界模型PanoWorld Longcat开源最强数字人模型LongCat-Video-Avatar 1.5 Meta发布最强配音模型WavFlow 研究员开源最强语音识别模型Mega-ASR 阿里发布实时翻译语音模型Qwen3.5 LiveTranslate #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

9. 独家|VUI Labs宇生月伴完成数千万元天使+轮融资,同创伟业领投,打造行业领先的情感语音大模型和多模态Agent

10. Cell Reports Medicine(一区|IF=10.6)|人工智能驱动的多模态成像集成在神经精神疾病精准医疗中的应用

11. 医疗AI拐点来了!这家公司把医生“大脑”装进AI #医疗AI #智诊科技 #WiseDiag#医疗智能体 #好伴AI

12. AI时代,Figma如何重塑设计和编程工作流

13. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代

14. Gemini 3.1 Pro VS千问3,2026年还需要付费制AI吗

15. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格

16. DeepSeek发布多模态论文又连夜删除

17. 李想在B站新一期的发布视频里称:“MindVLA-o1具备3D ViT+多模态思考能力,让车真正具备理解3D空间的能力。同一套VLA模型,既可以控制车辆,也可以控制机器人,自动驾驶只是物理AI的起点。长远看,物理世界AI的终局是构建一个“硅基人”,让系统像人类一样具备完整的感知和行动能力。”物理AI?物理世界AI?美滋滋…很高兴看到理想汽车也切换到世界模型。#李想称机器人也用VLA##理想发布下一代自动驾驶基础模型##李想回应AI时代的焦虑

18. 为什么2026年大模型都在往“理解生成统一”方向发展?去掉VAE和VE到底能带来什么本质性的提升?

19. 商汤SenseNova U1:原生多模态统一模型的范式革命

20. AI真正会深刻影响的,不是某一个职业, 而是人类创造和做事的规则。#大咖观察 #红衣聊AI #奥特曼 #OpenAI

21. #千问Qwen3.5大模型发布# 就在刚刚,千问又发布了新一代大模型Qwen3.5-Plus!别的不说,大过年的发版本,这个团队就是“疯子”,应该加鸡腿~!只为努力把最好的产品带到这个世界,发出中国人自己的声音,就凭这一点,这个团队就真的很棒,产品值得期待!千问3.5已经从纯文本模型“进化”到原生多模态模型!不管是推理能力,还是多模态理解与更高效的运行体验,都变得更加强大,用户现在可以在千问APP、千问PC端体验,点击页面顶部「千问」图标,即可切换模型,直接体验Qwen3.5-Plus。#HOW I AI##过个有AI年# 春节期间吃饱喝足了,赶紧体验一波吧!大模型在卷,咱们也要“卷”起来~哈哈哈

22. 三大模态模型全部登顶后,昆仑万维正式披露了 2026 年 AGI 战略

23. 2025年度AI全景报告:AI变强,人类抽象! 2025年的AI进化史,比科幻电影更疯狂 一、大模型篇:GPT-5.2、Gemini、Claude如何刷爆IQ测试 二、AIGC篇:小香蕉和GPT-Image编辑现实 三、人类怎么用AI:跟“神”谈恋爱 四、AI机器人:伴侣还是终结者 五、AI4S:人类最后的发明 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #机器人

24. 刚刚,智谱开源GLM-4.6V系列模型啦~GLM-4.6V系列型号包括两个版本:GLM-4.6V (106B),一个为云端和高性能集群场景设计的基础模型,以及GLM-4.6V-Flash (9B),一个针对本地部署和低延迟应用优化的轻量化模型。GLM-4.6V在训练中将其上下文窗口扩展到128k个token,并在同类参数规模的模型中实现了视觉理解的最先进性能。最关键的是,我们首次集成了原生的函数调用功能。这有效地弥合了“视觉感知”和“可执行动作”之间的鸿沟,为现实世界商业场景中的多模态智能体提供了统一的技术基础。GLM-4.6V 引入了几个关键特性:🌟原生多模态功能调用:实现了原生的视觉驱动工具使用。图像、截图和文档页面可以直接作为工具输入,而无需文本转换,同时视觉输出(如图表、搜索图像、渲染页面)会被解释并融入推理链条中。这闭环了从感知到理解再到执行的过程。🌟交错图文内容生成:支持从复杂的多模态输入中创建高质量的混合媒体内容。GLM-4.6V 处理多模态上下文—涵盖文档、用户输入和工具检索的图像—并合成与任务相关的连贯交错图文内容。在生成过程中,它可以主动调用搜索和检索工具来收集和策划额外的文本和视觉素材,生成丰富、视觉化的内容。🌟多模态文档理解:GLM-4.6V 能处理最多128K个标记的多文档或长文档输入,直接将富格式页面作为图像进行解读。它可以共同理解文本、布局、图表、表格和图形,从而准确理解复杂、以图像为主的文档,而无需将其先转换为纯文本。🌟前端复刻与视觉编辑:从 UI 截图重建像素级准确的 HTML/CSS,并支持自然语言驱动的编辑。它通过视觉检测布局、组件和样式,生成干净的代码,并通过简单的用户指令应用迭代的视觉修改。#科技先锋官#

25. #微博声浪计划##听见微博# DeepSeek和谷歌Gemini谁更强?二者代表AI大模型不同发展路径。DeepSeek主打技术普惠与开源,中文、数学及代码能力突出,部署成本低;Gemini侧重生态整合与多模态,适合复杂工作流与全球场景。2026年竞争聚焦智能体落地,选择需结合成本、场景需求。 种斌Marco的微博音频

26. 【#Seedance爆火后可灵3.0出圈#】随着字节跳动旗下视频生成模型 Seedance 2.0 在春节前突然爆火,其竞品快手 可灵 3.0 也借势出圈,两者共同掀起了一场关于「AI导演革命」的全民创作浪潮。AI视频竞争已从“单帧画质”升级为“工作流整合”,掌握多模态调度能力者将定义下一代创作标准。http://t.cn/AX5kZQzB

27. AI工作流是否真的能带来十倍效率提升?普通人如何搭建适合自己的AI工作流?

28. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生

29. 今天,也就是2026年2月14日,字节跳动正式发布了豆包大模型2.0(Doubao-Seed-2.0)系列,官方宣布这标志着豆包全面进入Agent时代。这次更新推出了Pro、Lite、Mini、Code全家桶,Pro版直接对标国际顶尖如GPT-5.2和Gemini 3 Pro,亮点非常多,尤其在真实世界复杂任务执行、多模态理解和性价比上表现出色。🔻主要亮点和技术升级1. 全面进入Agent时代,强化复杂任务执行
豆包2.0不再只是聊天工具,而是针对大规模生产环境系统优化,重点提升高效推理、多模态理解和复杂指令执行能力。能更好地处理多约束、多步骤、长链路任务,已具备支撑高价值真实世界任务的基础。比如长链推理、Agent规划执行等场景更可靠。2. 多模态能力大幅跃升,多数基准达SOTA
视觉与多模态理解更稳健:对复杂文档、表格、图表、图形、视频的解析显著提升,视觉推理、空间理解、运动理解、长视频分析等达到全球顶尖水平。Pro版在大多数视觉基准测试中拿最高分,支持更精准的多模态感知和推理。3. 数学、推理、编程能力顶尖
Pro旗舰版在IMO、CMO数学竞赛和ICPC编程竞赛中取得金牌成绩,在Putnam基准上超越Gemini 3 Pro,数学和推理能力已达世界顶尖。能尝试埃尔德什级数学问题、完成研究级科学编程任务。4. 全家桶灵活适配不同场景 • Pro:深度推理 + 长链路任务,旗舰对标GPT-5.2 / Gemini 3 Pro。 • Lite:性能与成本平衡,综合能力超上一代主力豆包1.8。 • Mini:低时延、高并发、成本敏感场景。 • Code(Doubao-Seed-2.0-Code):专为编程优化,与TRAE(字节AI编程工具)结合效果最佳,支持多模态输入(如代码截图)。5. 超强性价比,token成本降低约一个数量级
Pro版定价(32k以内输入):3.2元/百万tokens,输出16元/百万tokens,远低于Gemini 3 Pro和GPT-5.2。Lite输入仅0.6元/百万tokens。在长链路、大规模推理场景下,成本优势巨大,真正让AI“用得起”。🔻体验入口:豆包App切换“专家”模式即可用Pro对话;Code版已在TRAE接入;开发者可通过火山引擎API调用全系列。🔻简单对比GLM-5和通义千问(Qwen)M2.5等同批更新模型从当前公开信息看(2026年2月数据),豆包2.0 Pro在数学/推理(如IMO金牌、Putnam超Gemini 3 Pro)和多模态视觉理解上特别突出,整体对标国际前沿(如GPT-5.2级别),推理链更长、Agent执行更稳。GLM-5(智谱)和通义千问M2.5(阿里)也在2025-2026密集迭代,强在中文理解、工具调用和生态(如通义千问的图像/视频生成),但字节这次强调真实世界复杂任务+极致性价比,Pro在部分国际基准领先,成本更低一个量级,适合企业级大规模部署。国内模型差距已非常小,各有侧重:字节更偏多模态+Agent执行,阿里/智谱在开源和通用中文生态更成熟。你已经试过豆包2.0了吗?我是用了,确实好。字节真是国产之光。🚀 #豆包大模型2.0发布# #HOW I AI# #过个有AI年#

30. Meta的秘密项目居然偷师千问?偷早啦!千问发布旗舰推理模型Qwen3-Max-Thinking#Qwen3 #千问 #科技改变生活 #AI新星计划 #玩个很新的东西

31. 厂长又更新了:“MindVLA-o1具备3D ViT+多模态思考能力,让车真正具备理解3D空间的能力。同一套VLA模型,既可以控制车辆,也可以控制机器人,自动驾驶只是物理AI的起点。长远看,物理世界AI的终局是构建一个“硅基人”,让系统像人类一样具备完整的感知和行动能力。”--越来越期待理想下一代自动驾驶基础模型带来的体验变化。#李想称机器人也用VLA##理想发布下一代自动驾驶基础模型##李想回应AI时代的焦虑

32. 如何看待最新发布的国产统一多模态大模型让P视频像P图一样简单?未来的视频制作产业会发生什么变化?

33. 【AI辅助设计】Google Stitch 这次更新,不是在加功能,而是在抢 AI 设计工作流的入口

34. SenseNova U1开源:8B参数原生统一多模态模型

35. 【阿里千问发布全模态大模型 Qwen3.5-Omni】阿里云正式发布新一代全模态大模型 Qwen3.5-Omni,在音视频理解、识别、交互等 215 项第三方测试任务中取得 SOTA,成为目前全球最强的全模态大模型之一。关键数据 1:支持 113 种语言及方言的语音识别,36 种语言及方言的语音生成;关键数据 2:可处理超 10 小时音频输入,自然涌现“音视频编程”能力(口述需求直接生成代码);时间 / 价格:用户可于 Qwen Chat 免费体验,企业可通过阿里云百炼平台调用 API。从“多模态理解”到“音视频编程”,Qwen3.5-Omni 将 Vibe Coding 推向新阶段,大模型正从“对话工具”进化为“跨模态生产力平台”,加速渗透影视制作、内容审核等高价值场景。#阿里千问 #Qwen3.5 #全模态大模型 #AIGC#

36. 【豆包大模型家族首款全模态理解模型:字节跳动 Doubao-Seed-2.0-lite 升级】字节跳动火山引擎发布豆包大模型家族首款全模态理解模型 Doubao-Seed-2.0-lite,支持视频、图像、音频、文本统一处理,并在 Agent、编程与 GUI 操作能力上全面升级。该模型已在电竞、教育、电商等多个场景实现商业化应用……

37. 怎么看待新加坡政府宣布在东南亚语言大模型项目放弃Meta模型,采用阿里的通义千问(Qwen)开源架构?

38. 凌晨三点,彻底失眠:Seedance2.0告诉我们,AI正在疯狂“压缩”现实世界工作流

39. 用模型排行榜论输赢?AI竞赛到底在比什么? #大咖观察 #红衣聊AI #AI #大模型

40. 千问3.5以小胜大,阿里巴巴的阳谋藏不住了

41. 半夜,小米大模型团队发布小米全模态Agent基座大模型 MiMo-V2-Omni“MiMo-V2-Omni 专为现实世界中复杂的多模态交互与执行场景而生。从底层构建了融合文本、视觉、语音的全模态基座,并以统一架构将“感知”与“行动”深度绑定。这不仅打破了传统模型“重理解、轻执行”的局限,更让模型原生具备了多模态感知、工具调用、函数执行及 GUI 操作能力。”“MiMo-V2-Omni 可无缝接入各种 Agent 框架,实现了从理解到操控的跨越,大幅降低了全模态 Agent 的落地门槛。”“在正式发布之前,我们将一个早期测试版本以「Healer Alpha」为代号匿名上架 OpenRouter,没有任何宣传,纯粹让模型能力说话。结果调用量自然攀升至平台前列,并在 OpenClaw 测评榜单 PinchBench 上拿下均分第一,用户和基准双双给出了同一个答案。” “我们还与金山办公合作,将 MiMo-V2-Omni 接入 WPS Office,探索全模态智能体模型在日常生产力场景中的表现。”

42. #小米新SU7辅助驾驶升级XLA大模型# 小米辅助驾驶的进步也太快了,新SU7的HAD辅助驾驶升级了XLA认知大模型,这就是近2000人团队+首期几十亿预算的恐怖效率…… 升级XLA认知大模型、融入MiMo-Embodied具身基座模型之后,小米辅助驾驶能够实现更深度的多模态信息输入,视觉模态+雷达模态+车身模态会经由自研大模型统一处理、直接决策。车辆还将获得自然语言的理解能力,辅助驾驶变得更聪明了 具体表现怎么样,就等明天发布会上雷总再做详细介绍了[柯基]

43. Lance 把图像与视频的理解、生成和编辑全部融合进一个 3B 活跃参数的原生统一多模态模型,真正做到「一套框架」搞定。不仅支持高质量文生图、文生视频,还能进行图像/视频编辑与多模态理解,性能直逼更大模型。GitHub:github.com/bytedance/Lance Hugging Face:huggingface.co/bytedance-research/Lance主要功能:- 3B 活跃参数,原生统一框架,支持图像/视频理解、生成、编辑- 文生图、文生视频、图像编辑、视频编辑一键完成- 多轮一致性编辑与智能视频生成,效果出色- 支持图像/视频问答、详细描述等理解任务- 提供 Gradio Demo 与完整推理脚本,开箱即用支持本地运行(需 ≥40GB VRAM),同时已有 MLX 社区移植版本可在 Apple Silicon 上运行。

44. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?

45. #豆包大模型2.0将发布#豆包视频生成模型Seedance升级要点:复杂交互和运动生成可用率高,业界最佳级别;多模态能力全面,支持音、视、图全模态输入;可控性强,指令遵循表现好;深度适配影视、广告及营销场景,输出质量对齐工业交付标准。

46. 走出屏幕,多模态智能硬件如何承载最新的 AI?

47. 摩根大通一线调研:中国AI“赚钱时刻”来了,工作流层的价值开始超越基础模型

48. 高盛的判断:Claude Cowork成首个“代理工作流可信案例”,OpenClaw展示未来人机交互方向

49. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】

50. AIGC彻底变天!MiniMax Hub数字员工一键托管! 搞AIGC创作、做电商、做自媒体的同学们注意啦!AI做视频新玩法太炸了! 以前做AIGC视频,要自己找素材、写提示词、反复抽卡、剪辑拼接,一条视频做下来人都麻了。 最近深度体验了 MiniMax Hub,感觉有亿点不一样。 它就像我的专属数字员工,只要告诉它目标,它会自动拆解任务、调用模型,跑完一整套工业化工作流。 从电商海报、小红书种草图,到产品宣传片、短剧脚本、分镜、角色图,甚至本地文件整理,都能按流程往下跑。 #AI #人工智能 #AIGC #MiniMaxHub #海螺AI

51. AI 视频生成的战场如何从「模型秀场」转向「工作流」?

52. 在线模型推理部署经常遇到多模态模型支持复杂,性能难以优化的问题。vLLM-Omni 基于高效的 KV cache 管理和流水线执行,专为支持包括文本、图像、音频、视频等多模态输入的模型设计,轻松实现异构模型推理和服务。它不仅兼容主流 Hugging Face 开源模型,还支持分布式推理、多阶段流水线调度、流式输出和 OpenAI 兼容接口,极大提升多模态模型在线推理的效率和灵活性。GitHub: github.com/vllm-project/vllm-omni主要功能:- 支持多模态数据(文本、音频、图像、视频)处理与生成;- 支持非自回归架构如扩散模型,实现高效的并行生成;- 基于 KV cache 优化自回归模型推理性能;- 异构流水线抽象,管理复杂多阶段模型工作流;- 分布式推理支持,涵盖张量并行、数据并行和专家并行;- 开箱即用的 OpenAI 兼容 API 服务器,方便集成;- 支持主流平台(CUDA/ROCm/NPU/XPU),广泛适配多硬件环境。适合AI开发者、研究人员和企业级应用场景的多模态AI模型推理部署。#AI开发# #多模态模型# #机器学习#

53. 最新!AI再迎「十字路口」,林达华演讲曝光多模态底层路线图

54. 近日,国际数据公司(IDC)发布《中国AI软件市场》报告:2025 年中国视觉 AI 市场,商汤科技再度登顶行业榜首。以史无前例的十连冠战绩,牢牢锁定视觉 AI 市场绝对领导者地位。IDC在报告中指出,计算机视觉市场正经历从“CV 1.0”到“CV 2.0”的深刻变革。随着视觉大模型的崛起,CV 2.0正在重新定义市场——从多模型到统一大模型解决多场景问题,从单模态感知到图文多模态理解,从闭集识别到开集推理,从单纯的“看”到“看懂、会搜、能生成”。#商汤科技# #大模型#发布了头条文章:《蝉联十载,商汤科技再夺中国视觉AI市场份额第一 》 蝉联十载,商汤科技再夺中国视觉AI市场份额第一

55. 讯飞首款 AI 眼镜,用 40 克撬动 AI 工作流

56. 2026年AI主线换了!这5大趋势必须看清。 #大咖观察 #红衣聊AI #趋势风口 #人工智能

57. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

58. 盘点一周AI大事(4月5日)|叫AI老公多干活 OpenAI内测下一代生图模型「GPT-Image-2」 OpenAI工匠计划「Project Stagecraft」曝光 Google发布最强开源小模型「Gemma 4」 Anthropic研究发现Claude有170种情绪向量 阿里发布最强开源多模态大模型「Qwen3.5-Omni」 Sakana AI 发布AI战略官「Marlin」 微软发布最强语音识别模型「MAI-Transcribe-1」 研究员开源最强声音克隆模型「LongCat-AudioDiT」 研究员开源最强语音合成模型「OmniVoice」 工程师开源AI同事「同事.skill」爆火 首个一人独角兽公司「Medvi」诞生 #前沿科技趋势发布月 #AI新星计划 #AI #OpenAI #AIGC

59. 元戎不止智驾,全面探索物理AI全新赛道。北京车展重磅消息,元戎不但迎来前DeepSeek多模态技术核心大牛阮翀,展示基座模型在智能驾驶领域的最新成果。元戎还跳出单一智驾赛道,在后大模型时代全面布局以基座大模型为内核、多模态感知、舱驾一体驱动等物理AI场景,探索未来出行智能。4月25日北京车展,来一起见证元戎交出的答卷。

60. 阿里云发布多模态交互开发套件

61. n8n太复杂?Refly.AI让普通人也能轻松玩转AI工作流|鹿演Vol.006

62. #互联网技术[超话]##个重磅信号!#黄仁勋 #AI #人工智能#机器人 #自动驾驶 #CES2026 #英伟达#新年演讲# 黄仁勋在2026年CES展会上的新年首场演讲,以"物理AI"为核心主题,宣告人工智能正式迈入从理解数字世界到改造物理世界的新阶段。以下是演讲的核心内容整理: 一、时代定调:双重平台转移开启AI新纪元 黄仁勋指出,计算机行业正经历十年一遇的"平台重置",同时发生两大平台转移:一是应用程序全面构建于AI之上,软件开发从"编程"转向"训练",运行载体从CPU迁移至GPU;二是软件的开发与运行逻辑彻底革新,AI应用不再是预编译的固定程序,而是能理解上下文、实时生成内容的智能系统。这一变革正驱动全球价值约十万亿美元的计算机基础设施进行现代化改造。 二、物理AI的ChatGPT时刻已至 物理AI成为演讲的核心焦点。黄仁勋认为,AI的演进可以分为四步:感知AI、生成AI、代理AI、物理AI。当模型能够理解重力、摩擦、惯性、动量守恒等物理定律,AI才能真正走出屏幕,进入物理世界执行任务。 支撑物理AI战略的三大技术支柱已全面成型: Newton物理引擎:实现低于0.01秒的实时物理计算响应 Cosmos基础模型平台:以1000亿参数达成1毫秒级推理延迟,支持多模态物理世界理解 GPU+LPU混合架构:算力效率提升100倍,成本降低90% 三、Rubin计算架构全面量产 英伟达推出新一代Vera Rubin计算架构(简称Rubin架构),该平台已进入全面量产阶段。Rubin架构通过CPU与GPU协同设计,AI训练性能较前代Blackwell提升3.5倍,推理性能提升5倍,token生成成本最高降低10倍。该架构包含六款全新芯片:Vera CPU、Rubin GPU、NVLink 6 Switch、ConnectX-9 SuperNIC、BlueField-4 DPU和Spectrum-X以太网交换机。 四、自动驾驶与机器人突破 自动驾驶领域:英伟达发布全球首个开源端到端AI系统Alpamayo,这是业界首个具备思考推理能力的自动驾驶AI模型。2025款梅赛德斯-奔驰CLA将首发搭载该技术,计划2026年第一季度在美国上路,随后推广至欧洲和亚洲市场。 机器人领域:黄仁勋宣布"机器人领域的ChatGPT时刻已经到来"。英伟达发布了专为人形机器人设计的Isaac GR00T N1.6视觉语言行动模型等开源工具,同时推出Cosmos Reason 2推理型视觉语言模型。特斯拉Optimus人形机器人已通过Omniverse数字孪生平台完成90%以上的训练,自主运行比例达85%,2026年第一季度将实现5万台量产,成本降至2万美元以下。 五、开源生态战略加速 黄仁勋强调,开源模型与前沿闭源模型的差距已缩短至约6个月,且仍在持续缩小。英伟达不仅开源模型,还开源用于训练这些模型的数据,以建立真正的"系统信任"。现场展示的多款开源模型包括三家中国开源模型:Kimi K2、Qwen和DeepSeek V3.2。黄仁勋特别提到,DeepSeek R1的出现意外推动了整个行业的变革进程。 六、全栈AI体系构建 英伟达的角色已从芯片供应商转变为"全栈AI体系"的构建者。通过"三台计算机"的架构——训练(DGX超级计算机)、仿真(Omniverse与RTX)、推理(AGX系列边缘设备),英伟达构建了从云端训练到现实部署的完整闭环系统。同时,通过开源模型、数据及NeMo开发库,英伟达正推动技术民主化,让更多开发者和企业能够参与到物理AI的创新浪潮中。 黄仁勋在演讲结尾强调,物理AI的落地将重塑全球千万家工厂与数十万个仓库的运作逻辑,开启AI与实体经济深度融合的新时代。 http://t.cn/AXb9Z9MM

63. 最强多模态大模型Gemini 3 Pro强在哪里?

64. 【华为鸿蒙座舱HarmonySpace 6发布,小艺升级千亿大模型】4月23日华为乾崑技术大会上,鸿蒙座舱HarmonySpace 6正式亮相。小艺智能体升级为行业首个全场景聊天型AI助理,搭载千亿参数大模型,能边聊天边控车边导航边点餐,随时切换多任务。核心信息:发布行业唯一的舱内AI多模态感知系统AMS,通过多普勒效应捕捉心跳呼吸,实现活体识别与风险预警;搭载双17.2英寸3.4K云晰柔光屏,消除97%眩光,支持智慧分屏;首发百万像素彩色智能车灯,支持全彩投影,雨雾天识别距离提升66%;行业首款车载激光投影仪外加AI调音魔方与无麦K歌3.0。观察:从被动响应到主动陪伴,华为打通舱内感知、交互与影音全链路,试图重新定义“移动第三空间”。#华为鸿蒙座舱 #HarmonySpace6 #小艺智能体 #AI座舱#

65. Nature | 统一的多模态学习模型

66. 市场误判了腾讯?摩根大通:嵌入现有工作流才是中国AI决胜战场

67. 我用 AI 自动化了整个电商工作流,效率翻了 6 倍

68. 完了,我做的这只猫开始监视我了…【AI桌宠开源】

69. #千问又上新了#阿里Qwen3.5-Plus杀疯了!3970亿参数却只激活170亿,显存省60%、速度飙19倍,性能直接超越GPT-5.2。原生多模态+超级Agent,能自主操作设备完成复杂任务,API成本更是低到Gemini 3 Pro的1/18,国产大模型这波直接起飞🚀

70. 【AI辅助设计】用AI复刻“纯欲风”写真:一个ComfyUI工作流,解锁摄影大师级光影与情绪

71. 《扣子开发 AI Agent 智能体应用》010-扣子工作流详解(工作流分类和作用)

72. 图解大模型,第十二章

73. 大模型自学笔记・番外一

74. 多模态大模型

75. 为什么大模型突然能干活了?拆开看,它多了四个部件

76. 多模态大模型学习笔记(四十一)——从 “能看“ 到 “会想“

77. AI技术 08|多模态到底是什么?

78. 代码即工具,显著提升多模态模型鲁棒性

79. 李飞飞新作|主动交互才是空间智能的灵魂

80. 多模态 AI 不只是“会看图”

81. 多模态——当AI长出了眼睛和耳朵

82. 人人都能懂的大模型 · 第19期

83. 每天吃透一个AI知识点|多模态 Agent

84. 2026年,AI正在从"智能体"向"行动体"进化

85. 别再教AI写诗了!Clawdbot爆火

86. 从生成式AI到Agentic AI

87. 2026年,AI从"智能体"转向"行动体"

88. ReAct: Synergizing Reasoning and Acting in Language Models

89. 阿里千问 Qwen3.5-Plus 正式发布!原生多模态大模型开启 AI 新纪元

90. 阿里放大招!千问 3.6-Plus 发布,多模态大模型变天了

91. 你真的会用 AI 吗?MCP、Skill、多模态一文讲透!

92. 多模态AI Agent

93. 破解多模态落地瓶颈,CXOU 大会给出两条可行路径

94. 【完结】多模态与视觉大模型开发实战 - 2026必会\n - 哔哩哔哩

95. 多模态大模型 前沿算法与实战应用教程

96. 豆包大模型2.0+Seedance 2.0

97. 多模态智能融合

98. 2026年大语言模型和AI领域的最新趋势预测

99. 2026年AI新趋势

100. 多模态AI模型最新发展趋势

101. 多模态大模型的感官革命

102. 多模态AI原生架构重构

103. Tool use 到底改变了什么

104. DeepSeek识图模式灰度内测开启!纯文本大模型正式迈入多模态时代

105. 长安天枢的多模态AI大模型能提升什么体验?

106. 多模态应用开发

107. 绝了!一口气测完 Seedance2.0 的多模态案例!

108. 多模态 AI 大模型爆发

109. 3分钟搞懂多模态AI

110. 【完结】多模态与视觉大模型开发实战 - 2026必会

111. 多模态AI实战指南

112. 多模态大模型训练营

113. 干货盘点!2026多模态大模型推荐排行 长视频解析/智能办公/具身智能

114. 多模态与视觉大模型开发实战-2026年必会(完结)

115. 🌟 计算机视觉顶会CVPR 2026论文出炉!今年投稿超1.6万篇,接收约4000篇。6月,学界将聚首美国丹佛。

116. 2026年,多模态模型的研究会走到哪一步?

117. 你在2026年会更关心大模型哪个方向的发展?

118. AI Agent全方位学习第八章:AI Agent 行动层 — 工具调用与计算机使用

119. 从多模态到编码,大模型工业落地正在从 “歪路” 走入正途

120. AI知识科普(10):浅谈多模态大模型

121. GPT-4o之后:2026-2028年AI多模态技术的5个确定性趋势

122. AI学习Day29丨多模态

123. 一篇看懂国内外主流大模型:GPT、Claude、Gemini、DeepSeek、通义千问有什么区别?

124. 2026 多模态交互大模型求职指南:从 VLM 到人机闭环。机器人/人形机器人「多模态交互大模型」方向最全求职攻略

125. 清华智谱推出原生多模态Agent大模型!多项 benchmark 超SOTA,代码能力反超 Claude Opus 【大模型论文解读】

126. 一文看多模态AI产业链

127. 近期AI新闻总结:从千问3.5到格局洗牌(2026年2月–3月)

128. 下一个超级趋势:AI 的能力,正在从“推理中心”走向“三段式系统”

129. 20260309 Bot和Agent的关系

130. 2026最强AI工具全盘点:从智能体到多模态,实用效率工具深度解析

131. 2026年多模态AI创作工具链保姆级教程

132. AI产品一图流:多模态AI全流程搭建怎么做?

133. 【阿里CoPaw】新玩法:多智能体工作流。5个模板创建完成,协作模式能选plan、并行、串行,多个子智能体配合完成任务。还能创建workflow,拖拽编辑节点,建立有向无环图连接,用ifelse设置条件、并行或循环,最后人类介入调整,就能让多个智能体按工作流正常运作。现在代码框架已开发,调试完就分享给大家啦。 #程序员 #人工智能#智能体 #抖音科技风向标 #普通人在ai时代

134. 2026年AI科技突破:多模态AI与推理能力的革命性进展

135. AI 越来越 “像人”?多模态 + 6 大落地场景,通用智能触手可及

136. 多模态与视觉大模型开发实战 - 2026必会

137. 手把手教你搭AI工作流:OpenClaw进阶

138. 多模态应用开发:让AI看懂世界,不再当”文盲”

139. 首个全流程验证的多模态智能体基准!Agentic-MME揭秘智能体能力到底带来了什么 【多模态大模型】

140. 从“跨模态炫技”到“产业实用”多模态大模型真的能落地见效吗?

141. 从“动口”到“动手”,AI如何更负责?

142. 35+程序员从零开始学AI——多模态AI到底是个啥

143. 《阿里千问3.5震撼发布!性能超GPT-5,价格仅1/18》 #阿里云 #通义千问 #大模型 #AI黑科技 #多模态大模型 一、千问3.5模型概述 1. 发布背景:阿里云通义千问团队最新发布的千问3.5系列,是继千问3之后的新一代多模态大模型。 2. 核心技术:将线性注意力机制与稀疏混合专家(MoE)结合,总参数达3970亿,但激活参数仅150亿,大幅降低部署成本,推理吞吐量提升19倍。 3. 多模态能力:支持视觉、语言,通过早期文本视觉融合、多模态旋转位置编码等技术,统一处理文本、图像、视频,语言支持从119种扩展到201种。 4. 性能与性价比:权威评测分数领先,API定价仅0.8元/百万token,为Gemini 3 Pro的1/18,性价比极高。 二、技术架构创新 1. 线性注意力机制:将传统注意力计算复杂度从O(n²)降至线性,引入门控网络,自适应决定信息处理路径,平衡效率与精度。 2. 混合注意力机制:以3:1比例混合门控网络(70%)和softmax注意力(20%),提升长距离效率,增强上下文学习能力。 3. MoE设计:128个专家池,每个token动态选择8个专家,复杂问题激活更多(如12+),简单问题激活更少(4-6),按需分配降低显存开销。 4. 混合推理:在千问3基础上优化,动态切换思考与非思考模式,通过思考预算参数(如token限制)控制推理深度,适应不同复杂度任务。 三、训练与性能表现 1. 数据处理:训练数据来自百度百科、代码仓库、学术论文等多渠道,结合千问2.5生成百万级合成数据,进行多阶段清洗(规则过滤、去重、质量评分)。 2. 多模态能力:支持高清图像理解与生成、语音输入翻译与情感识别、视频剧情理解、代码生成与解释。 3. 基准测试: MMU Pro(多学科选择题):87.8分,超越GPT-5.2的85.6分。 HumanEval(代码生成):超越GPT-4和Claude 4.5。 数学能力:同样领先。 4. 应用场景:智能客服、代码辅助、医疗辅助、金融风控与报告生成等。 四、部署与展望 1. 部署方式:支持Hugging Face下载、本地运行或VM部署,全参数模型需8个A100(约800GB显存),成本较高,但提供蒸馏模型降低门槛。 2. 未来方向:持续优化架构,提升性能与性价比,推动大模型在中小企业的应用。

144. 国产大模型集体爆发!千问通义升级,碾压GPT-4?

145. AI应用产业链最新机构观点(产业链)

146. AI-Agent(2):LLM如何感知并操作环境,以ReAct模式为例(含Python示例代码)

147. 让多模态模型学会主动说话:主动交互从训练到评估的完整方案

148. 面向 AI 的多模态数据开发能力-算子任务 - 哔哩哔哩

149. 2026软件开发新趋势:AI 客服 + 多模态交互,预埋功能抢占红利!

150. AI的多模态能力到底是个什么东西

151. AI架构深度解析:多模态大模型从原理到实践

152. 可信AI丨多模态大模型2026年首批评估正式启动

153. 2026年AI工具终极对决:DeepSeek vs 通义千问 vs GPT-5

154. AI日报:大模型持续进化,多模态应用加速落地

155. 跟踪 | AI应用的胜负手-多模态,从AI视频到机器人

156. 国产AI大模型技术突破:多模态能力达到新高度

157. 豆包 2.5 多模态能力评测:字节的大模型野心

158. 2026年国产大模型对比:DeepSeek/Kimi/豆包/通义千问,谁是最强?

159. 2025多模态大模型:技术革新与应用突破

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章