统一多模态模型的幻觉与突破:理解与生成能否兼得?
05-09 14:01
精选参考来源
精选参考来源
1. 为什么2026年大模型都在往“理解生成统一”方向发展?去掉VAE和VE到底能带来什么本质性的提升?
知乎 2026-05-03 00:00:00
2. 人人免费出大片!豆包Seedance 2.0实测对比+解析!
哔哩哔哩 2026-02-19 00:00:00
3. 能做假钞?超越Banana2!生图新王Image-2玩法大全...
哔哩哔哩 2026-04-18 00:00:00
4. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说
哔哩哔哩 2026-03-03 00:00:00
5. 除夕夜,国产顶流压轴上线,QWEN3.5多模态开源!
微信公众号 2026-02-16 00:00:00
6. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-04-19 00:00:00
7. 以前拍片烧几百万,现在只需说几句话?剪映Seedance 2.0有多逆天?#AI新星计划 #科技改变生活 #Seedream #Seedance2.0#玩个很新的东西
抖音 2026-02-11 00:00:00
8. #千问Qwen3.5大模型发布#阿里巴巴春节AI大战再出一张王牌。今天,阿里巴巴正式开源并上线了新一代千问大模型Qwen3.5,以其原生多模态架构和极致效率设计,成为全球开源AI领域的新标杆。Qwen3.5首次实现原生多模态融合,直接支持文本、图像及视频输入,无需外部适配即可完成跨模态理解任务。推理吞吐量提升8.6倍至19倍,显存占用降低60%。实测性能超越自家万亿级前代模型Qwen3-Max,并在多项权威评测中领先。用户可通过千问APP、PC端一键切换至Qwen3.5模型,实时体验多模态交互。Qwen3.5的发布标志着国产大模型进入“效率+多能力”双轨竞争阶段。其发布节点直击春节技术窗口,与DeepSeek v4、字节豆包2.0等国产模型形成“春节AI大战”格局。#老张聊科技#
新浪微博 2026-02-16 00:00:00
9. 腾讯HY- WU要捅模型天花板:让模型每次任务都生成个新大脑
微信公众号 2026-03-08 00:00:00
10. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?
知乎 2026-02-16 00:00:00
11. Qwen3.6-Plus 太猛了!免费 + 百万上下文 + Agent + 视觉多模态AI能力拉满! 零度解说
哔哩哔哩 2026-04-09 00:00:00
12. 国产AI生图又变强了!表情包、信息图、电影海报...一键生成!
哔哩哔哩 2026-03-06 00:00:00
13. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与
微信公众号 2026-03-08 00:00:00
14. 百度上线文心5.0,模型参数2.4万亿,采用原生全模态统一建模技术,具备全模态理解与生成能力,支持文本、图像、音频、视频等多种信息的输入与输出。这是老罗数字人的表现。文心5.0以1460分位列LMArena文本榜国内第一、全球第八,超过GPT-5.1-High、Gemini-2.5-Pro等多款国内外主流模型。 兔撕鸡大老爷的微博视频
新浪微博 2026-01-22 00:00:00
15. 为什么2026年大模型都在往“理解生成统一”方向发展?去掉VAE和VE到底能带来什么本质性的提升?
知乎 2026-05-03 00:00:00
16. 博世一篇最新的端到端世界模型工作:统一理解、规划和生成
微信公众号 2026-01-12 00:00:00
17. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能
抖音 2026-01-24 00:00:00
18. 开源版的 GPT Image 2,信息图、连续图文、本地部署全拿下|商汤SenseNova U1实测
微信公众号 2026-04-29 00:00:00
19. #豆包大模型2.0发布##HOW I AI##过个有AI年#字节跳动春节AI攻势又起。今天,字节跳动正式发布豆包大模型2.0系列,在多方面取得突破,全面挑战国际顶尖水平。豆包大模型2.0定位为旗舰级通用模型,专注复杂推理与长任务链执行,比如科研分析、跨模态创作。豆包大模型2.0分为Lite、Mini、code、Pro四个版本。其中Pro版本全面对标OpenAI的GPT5.2,数学竞赛成绩达到人类金牌水平。另外,多模态理解达SOTA水平,视觉推理与编程能力超越Gemini 3 Pro,HLE-text测试全球最高分54.2。另外三个版本也各有特色。Lite版均衡性能与成本,企业级任务处理效率提升,成本低于前代1.8。Mini版低延迟响应,支持256K上下文,适配轻量级应用(如移动端)。Code版深度优化编程场景,无缝接入TRAE等开发工具。#老张聊科技#
新浪微博 2026-02-14 00:00:00
20. 2025百度世界大会我来啦在2025百度世界大会上,百度正式发布全球首个原生全模态大模型文心5.0,总参数2.4万亿,采用统一自回归架构进行原生全模态建模,融合文本、图像、音频、视频等多模态数据,实现一体化理解与生成。模型在多模态理解、指令遵循、创意写作、事实性、智能体规划与工具应用等方面全面升级,与Gemini-2.5-Pro、GPT-5-High等持平,图像视频生成达全球领先水平。依托飞桨框架和超稀疏混合专家架构,激活参数低于3%,并通过端到端强化学习提升智能体能力。百度创始人李彦宏强调技术迭代是唯一护城河,将持续推高智能天花板;CTO王海峰称其验证了原生全模态潜力。目前,文心5.0 Preview已上线文心App和千帆平台,在LMArena排名中位列全球并列第二、中国第一。#ai创造营##ai生活指南# 北京·国家会议中心(二期)
新浪微博 2025-11-13 00:00:00
21. 为什么2026年大模型都在往“理解生成统一”方向发展?去掉VAE和VE到底能带来什么本质性的提升?
知乎 2026-05-07 00:00:00
22. GPT5.2亮点解读,OpenAI重夺年度最强 OpenAI甩出王炸GPT5.2,核心基准测试,全面碾压Gemini 3 Pro和Claude Opus4.5,强势夺回地表最强 奥特曼放话GPT5.2不仅是最强通用大模型,还要成为你日常办公的AI合伙人 亮点1、最强视觉能力 亮点2、最强上下文 亮点3、最强办公能力 亮点4、最强编程能力 #AI新星计划 #抖音知识年度大赏 #人工智能 #OpenAI #大模型
抖音 2025-12-12 00:00:00
23. DeepSeek,正如其名,深耕求索 AI 边界。DeepSeek V3.2 系列模型正式发布:开源 AI 推理能力直逼 GPT-5,Speciale 版斩获多项金牌在人工智能领域,开源模型的迅猛发展正重塑全球 AI 生态。今日(2025 年 12 月 1 日),中国 AI 初创公司 DeepSeek 宣布正式发布两款重量级大语言模型:DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale。这一双模型同步上线,不仅标志着 DeepSeek 在参数规模和推理能力上的新突破,更在开源社区引发热议。DeepSeek-V3.2 主打日常应用场景下的 Agent 强化能力,而 V3.2-Speciale 则作为“长思考增强版”,融入先进数学证明机制,在国际竞赛基准中屡获金牌。官方网页端、App 和 API 已全面更新,支持开发者即时接入。这一发布时机恰逢全球 AI 竞争白热化之际。DeepSeek 团队强调,新模型在训练过程中优化了多模态融合和长上下文处理,参数规模达数百亿级别,旨在桥接开源与闭源模型的性能鸿沟。以下,我们将从模型架构、基准评测、与其他顶尖模型的比较以及潜在影响四个维度,进行专业剖析。模型架构与创新亮点DeepSeek-V3.2 系列基于前代 V3.1 的 MoE(Mixture of Experts)架构迭代而来,总参数量超过 600B,其中活跃参数高效分配至 70B 级别。这种设计显著降低了推理延迟,同时提升了在复杂任务下的稳定性。核心创新包括: • Agent 能力强化:V3.2 内置多步规划模块,支持自主工具调用和动态决策链路,适用于自动化工作流场景,如代码生成和数据分析。 • 长思考机制:V3.2-Speciale 引入“思考链”(Chain-of-Thought)增强变体,结合 DeepSeek-Math-V2 的定理证明引擎。该版本在处理逻辑验证任务时,能模拟人类逐步推理过程,避免幻觉输出。 • 开源友好:模型权重已在 Hugging Face 和 GitHub 公开,支持 FP16/INT8 量化部署,适用于边缘设备。这些特性使 V3.2 系列不止于通用对话,更向专业垂直领域倾斜,如数学、编程和科学模拟。基准评测:性能数据详解为评估新模型的实际表现,DeepSeek 团队公布了多项国际标准基准结果,并邀请第三方机构验证。总体而言,V3.2 在推理和数学任务上表现出色,平均得分逼近闭源顶流。数学与逻辑推理基准 • GSM8K(小学数学):V3.2 得分 98.2%,V3.2-Speciale 达 99.5%,接近人类专家水平。Speciale 版在长链推理中优势明显,错误率降至 0.5% 以下。 • MATH(高中数学竞赛):Speciale 版斩获 92.7% 准确率,在 IMO 2025 模拟赛中获金牌,超越谷歌 Gemini Deep Think。该成绩得益于集成定理证明器,能自动验证几何和代数推导。 • AIME(美国数学邀请赛):V3.2 系列平均 85.4%,较前代提升 12%。独立评测显示,Speciale 版在 MLPerf Inference v5.1 推理基准中,处理长序列输出时延迟仅为 GPT-5 的 1.2 倍。编程与多模态任务 • HumanEval(代码生成):V3.2 达 89.6% 通过率,略高于 Claude 3.5 Sonnet,在 Aider 编程测试中得分 71.6%,标志着开源模型在软件工程领域的突破。 • MMLU-Pro(多学科知识):整体得分 87.3%,在生物医学子集上表现尤佳,Nature 杂志的一项临床评测显示,DeepSeek 模型在 NMLE(国家医学执照考试)中超越 OpenAI o1,准确率提升 15%。安全效率评估NIST 的 CAISI 报告指出,V3.2 在安全基准(如红队攻击抵抗)中得分 92/100,优于多数美国参考模型,同时价格仅为闭源竞品的 1/10。量化后,推理速度提升 2.5 倍,支持 128K 上下文窗口。 然而,评测也暴露短板:V3.2 在创意写作(如 GPQA 基准)中得分 78.5%,落后于 Gemini-3.0-Pro 约 5%。此外,独立测试显示其在边缘案例下的幻觉率仍需优化。与顶尖模型的横向比较DeepSeek V3.2 系列的发布,直接挑战了 OpenAI GPT-5 和 Google Gemini 的霸主地位。在综合基准 Arena-Hard 上,V3.2 以 91.2 分逼平 GPT-5(92.1 分),但略逊于 Gemini-3.0-Pro(93.8 分)。 17 Speciale 版在数学子集上逆转胜出,IMO 金牌成绩更胜一筹,终结了“闭源垄断高难度推理”的叙事。与其他开源模型相比,V3.2 碾压 Llama 3.1(MMLU 85.2%)和 Mistral Large(编程 82.4%),其 MoE 架构在能效上领先 30%。这一成绩源于 DeepSeek 的“渐进式蒸馏”训练策略,从 685B 基座模型提炼而出。开源生态影响与未来展望DeepSeek V3.2 的开源策略,将进一步加速 AI 民主化。开发者可通过 API 免费测试,预计短期内涌现大量 Agent 应用,如智能医疗诊断和自动化科研。长期看,这一发布或推动中美 AI 合作,缓解地缘壁垒。模型规模膨胀带来的碳足迹,以及在非英语语料上的泛化问题。DeepSeek 团队已承诺后续迭代,将融入更多多语言支持。DeepSeek V3.2 系列的亮相,不仅是技术跃进,更是开源精神的胜利。它证明,开源模型已能与闭源巨头并驾齐驱,甚至在特定领域领跑。 对于从业者和研究者而言,这是部署高性能 AI 的绝佳时机。未来,随着更多评测数据涌现,我们期待 V3.2 在真实世界中绽放光彩。参考文献: • DeepSeek 官方公告及基准报告。 • 第三方评测:NIST CAISI、Nature 临床基准、MLPerf 等。 (本文基于公开数据撰写)#DeepSeek同时发布2款新模型##ai生活指南##ai创造营#
新浪微博 2025-12-01 00:00:00
24. #科技先锋官# 谷歌 Project Genie 横空出世,文本图片一键生成可交互游戏世界,直接让游戏股集体暴跌,也让它成了科技圈最具争议的焦点! 有人说它是谷歌的王炸,丰富 AI 订阅服务、落地 Gemini 多模态能力,反哺模型迭代还打通生态闭环,让谷歌在 AI 格局中占据绝对优势。也有人骂这是市场过度恐慌,Genie 如今功能受限,既无完整游戏逻辑,也无法替代传统引擎,根本撼动不了 Take-Two、Roblox 的商业模式。 Meta、英伟达也在加紧布局世界模型,AI 造世界到底是颠覆行业的革命,还是徒有噱头的技术试水?看完这条视频,带你看清背后的真相!#微博超有用视频大赛##上微博涨知识##AI生活指南# http://t.cn/AXqrFsNg
新浪微博 2026-02-01 00:00:00
25. #科技先锋官# 机器人与实时视觉正成为全球AI技术竞争的核心赛道,各大巨头纷纷加码布局,通过多模态融合、本地智能升级、感知体系革新等创新方向。这一突破重构了机器人的环境交互能力,更拓宽了AI在工业、服务、创意等多场景的应用边界。谷歌DeepMind的创新极具颠覆性,其发布的Gemini Robotics On-Device实现关键突破,成为首个可在机器人本地独立运行的视觉-语言-动作模型。该模型摆脱云端依赖,通过多模态Transformer架构深度融合视觉感知、语言理解与动作规划,响应延迟降至毫秒级,弱网环境下任务完成率超95%,仅需50-100次演示即可让机器人掌握新技能,大幅降低部署成本。OpenAI则通过o3/o4-mini多模态模型强化视觉推理能力,实现带图思考的全新范式,能将图像融入思维链,在医学影像分析、图表解析等场景展现出精准的视觉理解与决策能力。腾讯鸿元发布HY-Motion 1.0模型,聚焦高质量3D动作生成,为机器人实时动画、虚拟人交互提供核心技术支撑;智谱与华为联合推出的GLM-Image多模态模型,在图像生成与编辑领域实现突破,适配国产算力底座。行业层面,DA3通用三维视觉模型、OpenTau开源训练平台等技术的涌现,正推动机器人视觉从多模型适配走向统一化、轻量化,为产业规模化落地奠定基础。#AI生活指南##一条vlog回顾2025##AI创造营# 种斌Marco的微博视频
新浪微博 2026-01-16 00:00:00
26. 【LMArena最新排名:视觉理解,文心5.0 Preview成最强国产模型】11月22日,备受行业关注的LMArena大模型竞技场公布最新排名结果,其中文心大模型ERNIE-5.0-Preview-1120在视觉理解榜中交出了亮眼答卷,以1206分的成绩位列国内第一,更值得关注的是,其整体水平已与Claude-Sonnet-4、GPT-5-high等国际一线大模型相当,成为国产模型在该领域与国际顶尖力量同台竞技的重要突破。在LMArena众多细分榜单中,视觉理解榜对应的应用场景并非简单的图像识别,而是工业质检、视频解析、医疗影像分析这类对模型精度和可靠性要求极高的核心领域。工业质检的任何误差都可能影响整条生产线的效率,医疗影像分析则关系到诊断的准确性,这类任务更能深度检验其底层能力。此前,国内虽有部分模型在LMArena的其他赛道展现出一定潜力,取得过不错的成绩,但在视觉理解榜这一“硬骨头”赛道上,能真正突破门槛、与国际一线模型同场比拼的却几乎没有。而文心5.0 Preview不仅成功跻身该榜单,更成为目前国内在该榜单中排名最高的模型,1206分的成绩背后,是其在视觉推理与跨模态理解能力上的扎实积累,标志着国产模型已具备在视觉任务中与国际顶尖模型抗衡的实力。文心5.0 Preview的成绩并非偶然,而是源于其独特且扎实的技术路线。作为新一代原生全模态大模型,它摒弃了业界多数多模态模型的后期融合模式,而从训练之初就将语言、图像、视频、音频等多模态数据统一,让多模态特征充分交互、协同优化,从根源上实现了原生的全模态统一理解与生成,而非简单的功能叠加,这也为其在视觉理解任务中的出色表现奠定了基础。除了核心技术路线的优势,文心5.0在架构设计上的创新进一步强化了其性能。依托飞桨深度学习框架,该模型采用超稀疏混合专家架构,总参数量突破2.4万亿,这一庞大的参数规模为模型处理复杂任务提供了充足的算力支撑;同时,其激活参数比例低于3%,这一设计在保证模型强大处理能力的同时,有效降低了推理过程中的资源消耗,大幅提升了实际应用中的效率,让模型在面对大规模视觉数据时既能保持高精度,又能兼顾处理速度。此外,为了进一步提升模型的实用能力,文心5.0还基于大规模工具环境,合成了长程任务轨迹数据。同时,通过基于思维链和行动链的端到端多轮强化学习训练,模型的智能体与工具调用能力得到显著提升,进一步增强了其在实际应用中的适应性。作为目前国内唯一在LMArena视觉理解榜中站稳脚跟的模型,文心5.0 Preview的1206分不仅是一个排名上的突破,更承载着国产大模型在全模态核心技术领域的发展成果。它用实力证明,国产模型已不再局限于中低难度任务,而是具备了在高难度、高价值的视觉理解场景中与国际一线模型竞争的能力,这不仅为国产大模型的技术发展注入了信心,更为后续国产模型在全球大模型竞争格局中提升国际竞争力提供了有力支撑。#百度##Ai##大模型##科技##AI技术##科技先锋官#
新浪微博 2025-11-22 00:00:00
27. 不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?
微信公众号 2026-01-13 00:00:00
28. 海外华人15人团队打造,统一理解与生成的图像模型,超越Nano banana登顶图像编辑
微信公众号 2026-03-06 00:00:00
29. 视频随意改!万相Wan2.7深度评测
哔哩哔哩 2026-04-15 00:00:00
30. 2026开年王炸:Qwen3.5震撼发布,一条视频讲清所有玩法...
哔哩哔哩 2026-02-22 00:00:00
31. #Seedance2.0是世界最强视频模型吗##过个有AI年##HOW I AI# 结合现有信息,Seedance 2.0在“多模态整合与控制”、“生产效率”方面处于世界顶尖水平,被多位权威人士(比如《黑神话:悟空》制作人冯骥)评价为“最强”,但在某些单项上,仍有其他模型表现相当或更优。Seedance 2.0的优势是多模态控制、导演级精度、音画同步、多镜头叙事,但时长最长15秒,部分场景物理模拟略逊于Sora 2。OpenAI Sora 2的优势是复杂物理模拟、超现实主义、更长时长(20秒)、全面的音频生成,但在多模态输入灵活性和对中文场景理解上可能不如Seedance 2.0。Vidu Q3的优势是单视频时长更长(16秒)、音画同步质量高、分镜控制能力强,但多模态输入支持的丰富性和灵活性未及Seedance 2.0突出。Kling的优势是长视频生成(最长可达数分钟)、物理仿真能力突出(如流体、烟雾),但在多模态控制和多镜头叙事等导演级功能上不及Seedance 2.0。Veo 3.1的优势是照片级真实感、光照渲染出色、生成速度快,缺点是视频时长较短(8秒),缺乏原生多镜头叙事能力。综合来看,如果你需要极其精细的控制、希望高效地“复刻”特定风格或动作,并追求从文字到成片的“一站式”高质量输出,那么Seedance 2.0无疑是目前最强大的选择之一。 但如果你追求极致的物理真实感、更长的单视频时长,或者主要在特定领域(如长视频、动画风格)使用,Sora 2、Vidu Q3和Kling也是顶级选项。#老张聊科技#
新浪微博 2026-02-10 00:00:00
32. 三大模态模型全部登顶后,昆仑万维正式披露了 2026 年 AGI 战略
微信公众号 2026-03-30 00:00:00
33. 【百度新设两个大模型研发部 年轻干部领衔】2025年11月25日,百度发布设立技术研发组织相关公告,新设基础模型研发部,负责研发高智能可扩展的通用人工智能大模型,由吴甜负责;新设应用模型研发部,负责业务应用场景需要的专精模型调优和探索,由贾磊负责。王海峰继续担任CTO、TSC主席、百度研究院院长。以上部门均向百度CEO李彦宏汇报。据了解,吴甜和贾磊都是百度培养的技术和管理人才。这体现了百度人才厚度以及公司持续推进干部年轻化。百度此次提升了大模型技术研发部门的管理层级,采取分进合击的打法,进一步建设和加强公司在人工智能方向的核心优势。这也将更好地满足客户和用户在AI应用上的需求。11月13日,百度正式发布原生全模态大模型文心大模型5.0。该模型采用原生全模态统一建模技术并应用超稀疏混合专家架构,支持理解与生成一体化,具备全模态理解与生成能力,支持文本、图像、音频、视频等多种信息的输入与输出。在全球最权威的大模型竞技场LMArena上,文心5.0 Preview模型分别取得了文本榜全球并列第二、国内第一及视觉理解榜国内第一的成绩。
新浪微博 2025-11-25 00:00:00
34. 强到离谱?Gemini 3深度实测【玩法合集】
哔哩哔哩 2025-11-20 00:00:00
35. 火山真的爆发了,这一届春节联欢会的AI技术到底有多牛
抖音 2026-02-17 00:00:00
36. 微表情测谎、极速赔付、AI打败AI,深聊“AI in All”下的保险革命与增长飞轮【硅谷101】
哔哩哔哩 2025-11-28 00:00:00
37. #千问Qwen3.5大模型发布#刚刚阿里正式发布全新一代大模型千问Qwen3.5-Plus。用户可在千问APP、千问PC端体验,点击页面顶部千问图标,即可切换模型,体验Qwen3.5-Plus。Qwen3.5已经从纯文本模型进化到原生多模态模型,不管是推理能力,还是多模态理解与更高效的运行体验#how i ai##过个有ai年#
新浪微博 2026-02-16 00:00:00
38. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格
哔哩哔哩 2026-02-17 00:00:00
39. Qwen3.6-Plus 太猛了!免费+百万上下文+Agent,多模态能力直接拉满!| 零度解说
哔哩哔哩 2026-04-10 00:00:00
40. 盘点一周AI大事(4月5日)|叫AI老公多干活 OpenAI内测下一代生图模型「GPT-Image-2」 OpenAI工匠计划「Project Stagecraft」曝光 Google发布最强开源小模型「Gemma 4」 Anthropic研究发现Claude有170种情绪向量 阿里发布最强开源多模态大模型「Qwen3.5-Omni」 Sakana AI 发布AI战略官「Marlin」 微软发布最强语音识别模型「MAI-Transcribe-1」 研究员开源最强声音克隆模型「LongCat-AudioDiT」 研究员开源最强语音合成模型「OmniVoice」 工程师开源AI同事「同事.skill」爆火 首个一人独角兽公司「Medvi」诞生 #前沿科技趋势发布月 #AI新星计划 #AI #OpenAI #AIGC
抖音 2026-04-05 00:00:00
41. 阿里巴巴旗下高德又搞大事情了!从2025年8月宣布全面AI化之后,9月就推出了高德扫街榜,获得一致好评,而这次是布局世界模型。作为深耕出行领域20余年,高德的大数据库可谓是干货满满。高德的世界模型并非单一技术的突破,而是全链条能力的系统性升级。以“空间智能为基底、世界模型为核心、具身智能为落地”的战略布局,实现多维场景服务落地。目前该模型已在空间智能评测基准WorldScore中取得多项指标第一的成绩,含金量满满。要知道WorldScore可是李飞飞团队提出的,也是首个支持多模态世界生成模型统一评估的开源基准测试,世界模型能拿到第一的成绩,绝对是有硬实力的。此外高德内部已成立具身业务部,并开启对外招聘,像机器人、机器狗等产品形态也在探索业务之内。#高德正式布局世界模型##高德将发布世界模型产品#
新浪微博 2026-01-06 00:00:00
42. DeepSeek发布多模态论文又连夜删除
微信公众号 2026-05-01 00:00:00
43. 为什么2026年大模型都在往“理解生成统一”方向发展?去掉VAE和VE到底能带来什么本质性的提升?
知乎 2026-05-07 00:00:00
44. DeepSeek 2026年4 月30 日发布几小时后删除的视觉模型技术报告,透露出哪些信息?
知乎 2026-05-01 00:00:00
45. Seedance 2.0:说中国话的最强AI视频模型!
哔哩哔哩 2026-02-17 00:00:00
46. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代
抖音 2026-01-09 00:00:00
47. 多模态大模型这条赛道,阿里云开始拉速度了
微信公众号 2025-12-22 00:00:00
48. #2026高校毕业生预计1270万人#2026 年 AI 行业人才需求呈技术导向加全行业渗透特征,应届生需先明确赛道定位。技术岗方面,大模型算法、深度学习等核心岗位人才需求比较大,建议理工科背景学生深耕数学与算法基础。 AI 产品经理、行业解决方案顾问,还是需要多补充 AI 技术通识与垂直领域知识。现在企业对于人才的需求并非过去的专业对口模式,而是更在乎在应用层面的技能和知识。 AI 企业已从学历优先转向实践为王,复合型人才需构建三维能力体系。技术层面,需掌握大模型微调、多模态算法等核心技能,同时跨界整合相关技术,如制造业加 AI 视觉检测、金融加 AI 数据分析。业务层面,紧跟人工智能加政策导向,深耕 1-2 个垂直领域。 在应用落地层面多关注一下医疗 AI 需补充医学影像知识,智能制造需了解工业生产流程。打磨创造力、跨领域整合能力,AI领域现在的竞争趋势已经从专业的技术层面转向应用落地,能够帮助企业实现技术落得人才才是企业渴望的人才,拥有这些技能是 AI 领域内无法替代的核心竞争力,可以利用在学校的时间多参与跨学科项目、行业研讨会提升。 非专业的人员想要进入到这个行业,可深耕 AI 内容策划、多模态创意设计,利用生成式 AI 工具提升产出效率。可聚焦 AI 在能源优化、碳减排中的应用,积累相关行业案例。建议通过兴趣加 AI 技术打造个人标签,可以通过开源社区分享 AI 加教育的实践项目,或运营技术博客输出垂直领域见解。这种兴趣驱动加技术落地的模式,既能提升职业热情,又能契合企业对场景化人才的需求,形成独特竞争力。#秒懂热点就用智搜# 2026高校毕业生预计1270万人
新浪微博 2025-11-20 00:00:00
49. #DeepSeekV4要发布了吗#DeepSeek V4 最新爆出的消息来看,主要的变化就是上下文窗口扩至100 万 token,编程基准 SWE-Bench 达83.7%,原生多模态、创新架构降低显存占用,延续高性价比,API 定价仅为海外竞品的 15%-30%,预计 2 月底至 3 月初正式发布。现在市场比较关注DeepSeek V4 编程与长文本处理能力是否真的跻身全球第一梯队?是否真的能够实现以算法创新打破算力内卷,普惠企业与开发者?DeepSeek作为一款专业大模型覆盖能力是否能够解决开发工具与行业解决方案的生态体系问题。DeepSeek V4会成为2026年的第一炸吗?
新浪微博 2026-02-26 00:00:00
50. 小米开始秀技术了小米开源首代机器人 VLA 大模型,刷新多项 SOTA!Xiaomi-Robotics-0,拥有 47 亿参数、兼具视觉语言理解与高性能实时执行能力的开源 VLA 模型。它不仅在三大主流的仿真测试中获得优异成绩,更在现实真机任务中实现了物理智能的泛化——动作连贯、反应灵敏,且能在消费级显卡上实现实时推理。仿真标杆: 在 LIBERO、CALVIN 和 SimplerEnv 测试中,模型在所有的 Benchmark、30种模型对比中,均取得了当前最优的结果。真实挑战: 我们在双臂机器人平台上部署了模型并与行业标杆进行了横向对比。在积木拆解和叠毛巾这种长周期、高度挑战的任务中,机器人展现出了极高的手眼协调性。无论是刚性的积木还是柔性的织物,都能处理得游刃有余。多模态能力:模型保留了 VLM 本身的多模态理解能力,尤其是在具身更相关的 benchmark 中表现优异,这是之前的 VLA 模型所不具备的。#汽场全开##小米# 小马甲不小的微博视频
新浪微博 2026-02-12 00:00:00
51. 2025设计师必学的AI生图方法,0基础教程来了! AI出图别只磕关键词,1期视频总结超多的AI出图方法,还有图文教程!#设计 #平面设计 #Lovart #ai新星计划 #抖音知识年终大赏
抖音 2026-01-14 00:00:00
52. 小米正式开源首代机器人VLA大模型Xiaomi-Robotics-0,成为国产具身智能领域的重要突破。#小米发布机器人基座模型#这款47亿参数的基座模型,核心采用“大脑+小脑”MoT混合架构,以VLM负责多模态理解、DiT实现平滑动作生成,打造出感知-决策-执行的高效闭环,成功解决传统VLA模型推理延迟、真机动作卡顿的行业痛点,还能在消费级显卡上实现实时推理,大幅降低硬件门槛。模型在LIBERO、CALVIN、SimplerEnv三大主流仿真测试中刷新多项SOTA,真机部署后在积木拆解、叠毛巾等高难度任务中也展现出优异的手眼协调性,兼顾多模态理解与精细动作控制的能力尤为亮眼。此次开源不仅为开发者提供了优质的技术底座,更将加速具身智能技术的落地与行业协同创新,让机器人向物理世界的智能交互又迈进一步。#雷军公布小米机器人最新进展#
新浪微博 2026-02-12 00:00:00
53. #豆包大模型2.0发布# 刚刚看到了这个更新了,[专家模式] 开始啦! 2.0全面升级了多模态能力,在各类视觉理解任务上均达到世界顶尖水平,视觉推理、感知能力、空间推理与长上下文理解能力表现尤为突出,豆包2.0 Pro 在大多数相关基准测试中取得最高分。 提升长程任务执行能力,需要丰富的真实世界知识。通过加强长尾领域知识,豆包2.0 Pro在SuperGPQA 上分数超过 GPT 5.2,并在 HealthBench 上拿到第一名,在科学领域的整体成绩与 Gemini 3 Pro和 GPT 5.2相当。 更专业、深入的分析与创作能力,帮大家高效解决复杂问题,全面提升学习、工作与创作效卒。 #HOW I AI##过个有AI年#
新浪微博 2026-02-14 00:00:00
54. 千问 vs ChatGPT:4大功能实测!到是更好用的AI助手!Qwen3能否战胜GPT-5.1?
哔哩哔哩 2025-11-19 00:00:00
55. 一站式生成大片,声画同步的AI视频模型来了
哔哩哔哩 2025-12-16 00:00:00
56. DeepSeek多模态能力为零这件事,很多人觉得是短板。我反而觉得这是一个极其清醒的战略选择。你看字节、阿里、月之暗面,都在往“什么都能干”的方向堆功能,恨不得一个模型又能写诗又能剪视频又能读PDF。这很合理,因为C端用户确实需要一站式体验,这个逻辑完全可以理解。但DeepSeek选择把所有资源砸在推理深度上,不碰图像,不碰视频,就死磕逻辑链条的纯度。这让我想到一句话:当所有人都在比谁的瑞士军刀功能多的时候,手术刀的价值反而凸显了。 多模态是锦上添花,但推理能力是地基。地基打到全球第一梯队,上面想盖什么楼都来得及。反过来,地基不行的多模态,想要补起来可不那么容易。 #DeepSeek还是最强国产AI吗# deepseek还是最强国产ai吗
新浪微博 2026-04-28 00:00:00
57. FT:DeepSeek V4 下周发布,原生多模态。和华为、寒武纪联合优化,估计是优化了 V4 在对应平台上的推理性能。 现在多模态最强的还是 Gemini,Demis 的表述很有说服力: Gemini 从第一天起就是多模态的,这是有原因的。它是机器人所需要的…这些多模态模型能理解世界的物理学,再加上一点机器人微调,就能处理动作、电机控制以及机器人所需的规划…AGI 必须理解物理环境、周围的物理世界…为了让机器人工作…理解你的物理上下文。 期待 DeepSeek V4 的多模态性能!
新浪微博 2026-02-28 00:00:00
58. Seedance2.0冲击电影行业!导演失业?电影又要亡了?
哔哩哔哩 2026-02-11 00:00:00
59. 万亿赛道!AI生成视频零门槛变现
抖音 2025-11-27 00:00:00
60. 理想近期发布的 MindVLA‑o1 基础模型,将自动驾驶技术路线推向物理 AI与具身智能方向,代表行业对智能驾驶的理解从 “功能实现” 转向 “通用智能” 的思考。该模型以 3D ViT 提升空间理解能力,采用多模态统一架构,可在车辆与机器人场景复用,技术上更贴近真实世界认知逻辑。李想提出 “自动驾驶是物理 AI 起点”,长期指向能感知与行动的通用智能体,路线清晰且具备行业参考性。其对 AI 的定位偏向理性:AI 是能力杠杆而非替代者,专业积累越扎实,放大效应越显著,回应了行业对技术与人的关系的普遍讨论。整体来看,这是一次技术路线升级与长期战略的同步表达,无过度渲染,更偏向产业务实探索。#李想称机器人也用VLA##理想发布下一代自动驾驶基础模型##李想回应AI时代的焦虑#
新浪微博 2026-03-18 00:00:00
61. 解读Nano Banana Pro,AI生图新里程碑 Google年底冲业绩,又甩出一个王炸图像模型Nano Banana Pro 内核由Gemini 2.5 Flash升级到Gemini 3,图像生成和图像编辑实现断层领先。 升级一、最强文字渲染 升级二、最强大脑加持 升级三、最强一致性 升级四、摄影级可控 #AI新星计划 #人工智能 #Google #Gemini #nanobanana
抖音 2025-11-21 00:00:00
62. 【Z-Image 详细测评】超高质感 符合亚洲人审美 最新开源生图模型 6GB显存可用
哔哩哔哩 2025-12-03 00:00:00
63. #DeepSeek新模型有多猛# DeepSeek V3.1发布,6850亿参数量仅激活370亿,计算成本降90%。性能超GPT-4o,中文问答准度89.3%。岚图汽车、江苏银行已应用,未来将突破多模态,推理成本再降50%。#微博声浪计划##听见微博# 凯文思考的微博音频
新浪微博 2025-11-28 00:00:00
64. 北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026
微信公众号 2026-03-07 00:00:00
65. OPPO在MWC 2026上获重要奖项!3月3日,OPPO在MWC 2026上斩获GTI“移动AI应用奖”,该奖项是全球通信行业的重要奖项,这意味着以OPPO为代表的国产智能通信技术获得国际行业的高度认可。3月4日,在MWC 2026举行的联发科技发布会上,OPPO 与联发科技联合研发的技术预研成果——端侧全模态 Omni 模型正式亮相。作为业界首个在手机端侧实现多模态融合理解与交互的 AI 模型,Omni使手机端侧 AI 能够深入感知并理解周遭物理世界,为未来更主动、更自然的人机交互形态,奠定了坚实的技术基础。
新浪微博 2026-03-05 00:00:00
66. 蚂蚁灵光,30秒生成专属程序,普通人也能手搓代码 #蚂蚁灵光 #AI #阿里
抖音 2025-11-22 00:00:00
67. 破解统一多模态模型理解强生成弱
抖音 2026-03-11 00:00:00
68. 统一多模态模型的理解能力,真的被生成能力拖后腿了?
微信公众号 2026-03-06 00:00:00
69. Paper Daily!统一多模态模型理解力大考
微信公众号 2026-03-05 00:00:00
70. 多模态统一模型的“理解”真的能指导“生成”吗?北大推出 UniSandbox,揭示理解-生成鸿沟与进化之路
知乎 2025-12-02 00:00:00
71. 【AI论文解读】颠覆认知!统一多模态模型生成能力竟然通常不涨点?| 全新基准解答生成到底何时帮助理解
哔哩哔哩 2026-04-06 00:00:00
72. 一个模型同时搞定理解和生成
微信公众号 2026-04-25 00:00:00
73. (2026|Meta & 港大,无编码器统一多模态模型,像素空间,表示编码器,图像理解和生成)Tuna-2
知乎 2026-05-03 00:00:00
74. 每日论文--LLaDA2.0-Uni
微信公众号 2026-04-25 00:00:00
75. 锐评 MLLM 交互短板!人大 GeWu-Lab 与上海 AI Lab 发布 MIBench
微信公众号 2026-03-09 00:00:00
76. 桃多多
微信公众号 2026-04-02 00:00:00
77. 看懂+生成+精准编辑!这才是AI该有的样子!
小红书 2026-04-15 00:00:00
78. 多模态AI爆发元年
微信公众号 2026-03-31 00:00:00
79. 多模态大模型的技术难点是什么,业界有什么解决方案?
微信公众号 2026-02-25 00:00:00
80. 多模态原生融合如何实现音视频图文的统一理解与生成?
今日头条 2026-03-17 00:00:00
81. 字节最新力作|用上下文展开统一多模态
小红书 2026-05-02 00:00:00
82. 字节跳动 | Omni
微信公众号 2026-04-27 00:00:00
83. 【ICLR 2026】统一多模态模型的破局之道
微信公众号 2026-03-24 00:00:00
84. 架构解耦是统一多模态模型所必须的吗?全新AIA损失
今日头条 2025-12-02 00:00:00
85. 商汤发布并开源U1系列 单一模型架构能否撬动多模态市场
今日头条 2026-04-29 00:00:00
86. 剑指世界模型!商汤发多模态理解生成一体化架构,无需编码器“玩转”图像
今日头条 2026-03-07 00:00:00
87. 实测 20 款多模态模型,情感理解能力仍有巨大短板
今日头条 2026-04-26 00:00:00
88. 【斯坦福博士论文】多模态基础模型
微信公众号 2025-11-10 00:00:00
89. TPAMI 2026 | 多模态自适应与泛化最新综述: 从传统方法到基础模型
微信公众号 2026-04-02 00:00:00
90. 多模态和编程能力可以兼得吗?Kimi新模型K2.5实测
今日头条 2026-01-29 00:00:00
91. 多模态理解与生成综述(一)
今日头条 2026-01-06 00:00:00
92. 智能一切移动,卓驭科技发布首个原生多模态基础模型
今日头条 2026-04-27 00:00:00
93. 2026北京车展 | 卓驭科技发布首个原生多模态基础模型
今日头条 2026-04-26 00:00:00
94. 【完结】多模态与视觉大模型开发实战 - 2026必会
哔哩哔哩 2026-02-08 00:00:00
95. 图解大模型,第十二章
知乎 2026-04-01 00:00:00
96. 论文笔记-Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
知乎 2025-11-18 00:00:00
97. 文生文、文生图、文生视频模型分别怎么选
微信公众号 2026-04-08 00:00:00
98. Qwen3-VL Technical Report
知乎 2025-12-04 00:00:00
99. Qwen3-vl 技术报告简读
知乎 2025-11-28 00:00:00
100. 开源多模态模型基准新高
哔哩哔哩 2025-12-14 00:00:00
101. Qwen3-VL
微信公众号 2025-12-05 00:00:00
102. Transformer在多模态对齐融合中的应用
知乎 2026-03-10 00:00:00
103. 反转多模态范式!复旦等提出Uni-ViGU
知乎 2026-04-10 00:00:00
104. ICLR 2026|滑铁卢大学联合可灵提出UniVideo
微信公众号 2026-03-08 00:00:00
105. 1.22-3|多模态生成与理解
微信公众号 2026-01-25 00:00:00
106. 【AI论文解读】首个基于掩码扩散的全模态统一大模型!统一文本/图像/语音生成理解+视频理解 | 性能超越现有开源统一模型
哔哩哔哩 2026-04-18 00:00:00
107. 多模态AI原生架构重构
微信公众号 2026-02-14 00:00:00
108. 全面开源!商汤发布日日新SenseNova U1多模态统一模型,迈入理解生成统一时代
今日头条 2026-04-30 00:00:00
109. 商汤8B模型得分50.7分
今日头条 2026-04-30 00:00:00
110. 商汤SenseNova U1
知乎 2026-05-06 00:00:00
111. AI多模态交互避坑指南
今日头条 2025-11-24 00:00:00
112. 每天一个AI小知识
微信公众号 2026-04-10 00:00:00
113. GPT-6倒计时7天
今日头条 2026-04-07 00:00:00
114. 解锁未来:多模态大模型技术的崛起与应用前景
https://cfanz.cn/resource/detail/PWxDYwPnyLvOJ
115. 当模型开始“看图回答”:多模态理解里,人到底在判断什么?
https://www.woshipm.com/ai/6312278.html
116. 当模型开始“看图回答”:多模态理解里,人到底在判断什么?
https://www.woshipm.com/ai/6312278.html
117. 统一多模态理解与生成模型:进展、挑战与机遇
微信公众号 2026-01-07 00:00:00
118. 【754篇论文精华,83页长文综述】迈向通用人工智能的理解与生成统一基础模型
知乎 2025-12-08 00:00:00
119. Qwen3-vl
微信公众号 2025-12-19 00:00:00
120. 北京大学袁粒:多模态统一建模:扩散与自回归之争
哔哩哔哩 2025-12-17 00:00:00
121. 从多模态生成到世界模型:AI架构演进、技术瓶颈与未来路线解析
知乎 2026-04-12 00:00:00
122. 刚刚,DeepSeek全新多模态技术开源!
今日头条 2026-05-01 00:00:00
123. 统一多模态模型理解能力能否指导视觉生成?
小红书 2026-01-25 00:00:00
124. 华盛顿大学等联合突破:视频场景图生成实现人类级复杂故事理解 - 哔哩哔哩
哔哩哔哩 2026-03-05 00:00:00
125. 先猜后验:四个Agent协作理解长视频,VideoMME三基准SOTA
微信公众号 2026-04-09 00:00:00
126. OCR真的被AI解决了吗?OCRBench v2:一场针对大模型的“文本能力大考”
微信公众号 2026-04-01 00:00:00
127. 多模态与视觉大模型开发实战 - 2026必会
知乎 2026-01-19 00:00:00
128. 【AI论文解读】扩散模型颠覆多模态大模型!首个全扩散架构任意模态转换统一模型Omni-Diffusion | 南大+腾讯优图出品
哔哩哔哩 2026-03-17 00:00:00
129. 【AI论文解读】解决真实世界退化图像理解!统一多模态模型解锁生成能力 | 性能暴涨还不损失干净图像精度
哔哩哔哩 2026-04-14 00:00:00
130. NeurIPS 2023|LLaVA:用 GPT-4 造数据,让开源 LLM 一键看图
哔哩哔哩 2026-04-22 00:00:00
131. 多模态到通用感知,第五章 多模态大模型(MLLM):赋予大脑视觉
知乎 2025-11-24 00:00:00
132. 多模态AI:通用智能的必经探索之路
今日头条 2025-12-05 00:00:00
133. OCRBench v2 26 年 3 月最新榜单发布:TeleMM-2.0 与 Gemini 3 Pro Preview 分获中英文榜单冠军
微信公众号 2026-04-05 00:00:00
134. 12.2-3|统一架构跨模态架构解耦,注意力交互对齐; VLA双层数据剪枝和双教师自适应蒸馏
微信公众号 2025-12-02 00:00:00
135. AI算法面试题:Qwen-VL原理
微信公众号 2026-02-01 00:00:00
136. VLM多模态:CLIP、LLaVA与视觉指令微调
小红书 2026-05-04 00:00:00
137. Mobile-O:轻量级生成和理解多模态大模型
小红书 2026-03-07 00:00:00
138. 2026年,多模态模型的研究会走到哪一步?
小红书 2026-01-02 00:00:00
139. 首个统一多模态模型评测工具箱来了!解决现有评测痛点,揭示训练 trade-off 【多模态大模型】
哔哩哔哩 2026-04-23 00:00:00
140. 从任意视角理解和生成世界!和 NTU 博后廖康,一起聊聊统一多模态空间智能大模型 Puffin
微信公众号 2026-04-01 00:00:00
141. DeepSeek终于能“看图”了:识图模式灰测,多模态能力开始补齐
今日头条 2026-04-30 00:00:00
142. 🚀多模态统一模型居然能理解并生成图像
小红书 2026-04-25 00:00:00
143. 多模态大模型-LLAVA
知乎 2026-05-01 00:00:00
144. CHEERS:生成和理解一体多模态大模型
小红书 2026-04-26 00:00:00
145. LLaVA 深度拆解:5个“反常识”设计,揭秘经典多模态AI的极致“连接学”
知乎 2025-12-18 00:00:00
146. 生成和理解一体的多模态大模型的强化后训练
小红书 2026-04-16 00:00:00
147. InternVL-U:生成和理解一体的多模态大模型
小红书 2026-03-15 00:00:00
148. 2025年多模态模型行业深度剖析:现状洞察、前景展望与趋势前瞻
微信公众号 2026-03-01 00:00:00
149. 本地多模态实战:Ollama跑LLaVA/Gemma4,让大模型看图说话
微信公众号 2026-04-28 00:00:00
150. ICLR 2026 poster 多模态内容生成相关论文整理(内附源码)
微信公众号 2026-04-18 00:00:00
151. 谷歌DeepMind重磅开源多模态TIPSv2:实现Patch-Text对齐最优表现
今日头条 2026-04-28 00:00:00
152. Uni-X 缓解模态梯度冲突来做统一理解与生成
小红书 2025-12-23 00:00:00
153. Qwen3-VL-Embedding & Qwen3-VL-Reranker:统一多模态表征与排序
知乎 2026-01-12 00:00:00
154. DeepSeek开眼了,更新多模态,实测过后发现。。。
微信公众号 2026-04-29 00:00:00
155. 一个框架搞定15种视频生成任务!基于扩散先验的统一多模态视频生成框架 【AI生成视频】【计算机视觉】
哔哩哔哩 2026-05-05 00:00:00
-
支付宝省钱合集0 0
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!375 101 -
不听劝自己在卫生间砌了个浴缸!夏天泡着真舒服~成本仅需400243 421 -
40岁再就业,年薪20万有社保还能干到65:房地产估价师(下)131 156
已收藏
去我的收藏夹