原生多模态:让AI真正“看懂”世界的关键跃迁
06-10 10:41
精选参考来源
微信公众号 2025-12-18
抖音 2026-05-04
来源
精选参考来源
1. 谷歌闷声放大招:Gemini 3 Pro 的多模态杀手锏曝光
微信公众号 2025-12-18 00:00:00
2. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-04 00:00:00
3. #DeepSeekV4和GPT6谁更值得期待#GPT-6大概率4月14号就来,DeepSeek V4也箭在弦上最快月内有消息。两边几乎同时亮剑,这波中美大模型的较量正式进入白热化阶段。GPT-6这次据说是奔着AGI去的全新架构,代号“土豆”,性能号称暴涨40%,200万token上下文加上原生多模态,看起来就是冲着“全能旗舰”去的。而DeepSeek V4走的是另一条路——它跟华为昇腾芯片深度绑定,从CUDA迁移到国产架构,极致性价比+百万上下文多模态,明显是想用工程能力打破算力封锁。一个秀天花板,一个卷供应链和成本。不管怎么选,这波最大赢家都是用户。
新浪微博 2026-04-07 00:00:00
4. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与
微信公众号 2026-03-08 00:00:00
5. 阿里云发布多模态交互开发套件
微信公众号 2026-01-09 00:00:00
6. 【#千问上线新模型#】3月30日,阿里千问宣布全模态大模型Qwen3.5-Omni上线。Qwen3.5-Omni系列包含Plus、Flash、Light三种尺寸的Instruct版本,支持256k长上下文,模型支持超过10小时的音频输入及超过400秒的720P(1FPS)音视频输入。模型在海量文本、视觉以及超过1亿小时的音视频数据上进行原生多模态预训练,该模型展现出卓越的全模态感知与生成能力。相比Qwen3-Omni,Qwen3.5-Omni多语言能力大大增强,能够支持113种语种和方言的语音识别和36种语种和方言的语音生成。(财联社)
新浪微博 2026-03-30 00:00:00
7. SenseNova U1开源:8B参数原生统一多模态模型
知乎 2026-05-07 00:00:00
8. 谷歌再次深夜炸场,发布最强原生多模态,Gemini Embedding 2 横空出世!能把文本、图片、音频、视频、PDF 文件全部统一进一个模型里,一次调用就能完成理解和搜索,不再需要复杂的AI流水线,改变AI理解世界的方式!#谷歌##科技##人工智能##ai##agent# 赛博奇的微博视频
新浪微博 2026-03-11 00:00:00
9. 半夜,小米大模型团队发布小米全模态Agent基座大模型 MiMo-V2-Omni“MiMo-V2-Omni 专为现实世界中复杂的多模态交互与执行场景而生。从底层构建了融合文本、视觉、语音的全模态基座,并以统一架构将“感知”与“行动”深度绑定。这不仅打破了传统模型“重理解、轻执行”的局限,更让模型原生具备了多模态感知、工具调用、函数执行及 GUI 操作能力。”“MiMo-V2-Omni 可无缝接入各种 Agent 框架,实现了从理解到操控的跨越,大幅降低了全模态 Agent 的落地门槛。”“在正式发布之前,我们将一个早期测试版本以「Healer Alpha」为代号匿名上架 OpenRouter,没有任何宣传,纯粹让模型能力说话。结果调用量自然攀升至平台前列,并在 OpenClaw 测评榜单 PinchBench 上拿下均分第一,用户和基准双双给出了同一个答案。” “我们还与金山办公合作,将 MiMo-V2-Omni 接入 WPS Office,探索全模态智能体模型在日常生产力场景中的表现。”
新浪微博 2026-03-19 00:00:00
10. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格
哔哩哔哩 2026-02-17 00:00:00
11. 谷歌论文,干崩存储?#谷歌 #存储芯片 #Google #Deepseek #AI推理
抖音 2026-03-27 00:00:00
12. 400 tokens/s 的多模态模型? Step 3.7 Flash 实测。
知乎 2026-06-02 00:00:00
13. 商汤SenseNova U1:原生多模态统一模型的范式革命
知乎 2026-05-05 00:00:00
14. #千问又上新了#阿里Qwen3.5-Plus杀疯了!3970亿参数却只激活170亿,显存省60%、速度飙19倍,性能直接超越GPT-5.2。原生多模态+超级Agent,能自主操作设备完成复杂任务,API成本更是低到Gemini 3 Pro的1/18,国产大模型这波直接起飞🚀
新浪微博 2026-02-21 00:00:00
15. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说
哔哩哔哩 2026-03-03 00:00:00
16. 豆包2.0情人节炸场:不卷coding,字节把筹码全压在了多模态
微信公众号 2026-02-14 00:00:00
17. 盘点一周AI大事(5月17日)|AI终于正常说话 Google发布Android大脑 Gemini Intelligence Google推出Gemini 光标 Google视频模型Veo 4曝光 Thinking Machines 发布最强实时交互模型 Interaction Models 面壁智能发布最强开源小模型 MiniCPM-V 4.6 Sakana开源 AI 指挥官 Conductor Model / Fugu Adaption发布 AI 研究员 AutoScientist 研究员开源最强运镜视频模型 Warp-as-History 研究员开源最强打光视频模型 Relit-LiVE 研究员开源最强图生 3D 模型 Pixal3D 研究员开源最强视频配音模型 Just-Dub-It #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-17 00:00:00
18. #阿里新一代模型Qwen3.5曝光#中国大模型“疯狂2月”的重要一环阿里新一代大模型Qwen3.5曝光了,看了一下,Qwen3.5采用全新架构,支持原生视觉理解能力,可直接处理图像等多模态输入,并且在逻辑推理、数学计算及代码编写能力上具有显著突破,这波是国产大模型全球竞争力再次迎来强化呀。
新浪微博 2026-02-09 00:00:00
19. 关于小鹏的第二代VLA跟大家唠两句。小鹏汽车多次强调第二代VLA确实是底层重构的智驾大动作,不是L2小改,而是直奔L4的原生多模态架构。#何小鹏直播第二代VLA推送#第二代VLA去掉语言转译层,从视觉/多模态直接到动作的端到端架构,推理更快、信息损耗更少。第二代VLA即将大规模推送,找机会替朋友们体验一下。小鹏汽车
新浪微博 2026-03-16 00:00:00
20. FT:DeepSeek V4 下周发布,原生多模态。和华为、寒武纪联合优化,估计是优化了 V4 在对应平台上的推理性能。 现在多模态最强的还是 Gemini,Demis 的表述很有说服力: Gemini 从第一天起就是多模态的,这是有原因的。它是机器人所需要的…这些多模态模型能理解世界的物理学,再加上一点机器人微调,就能处理动作、电机控制以及机器人所需的规划…AGI 必须理解物理环境、周围的物理世界…为了让机器人工作…理解你的物理上下文。 期待 DeepSeek V4 的多模态性能!
新浪微博 2026-02-28 00:00:00
21. 中文多模态视觉语言模型12月测评报告,12月29日发布!
微信公众号 2025-12-21 00:00:00
22. Qwen3.5-Omni 直接掀翻 AI 格局!215 项任务 SOTA 全面碾压 Gemini-3.1 Pro,性能吊打还不够,API 价格仅为竞品 1/10 以下,百万 Token 成本更是低到惊人。它原生融合文本、图片、音频、音视频输入,256k 超长上下文轻松处理 10 小时音频,113 种方言精准识别,更自然涌现 Audio-Visual Vibe Coding,音视频指令直接生成代码。从企业跨国会议、内容创作到教育医疗,全场景覆盖。国产 AI 凭实力逆袭,这波真是硬核提升!#AI生活指南##微博超有用视频大赛##科普大作战##科技先锋官# 种斌Marco的微博视频
新浪微博 2026-04-01 00:00:00
23. 最新!AI再迎「十字路口」,林达华演讲曝光多模态底层路线图
知乎 2025-12-25 00:00:00
24. 走出屏幕,多模态智能硬件如何承载最新的 AI?
微信公众号 2026-02-08 00:00:00
25. 【#阿里千问3.5对战Gemini3#】刚刚,阿里正式发布全新一代大模型千问Qwen3.5-Plus。用户可在千问APP、千问PC端体验,点击页面顶部「千问」图标,即可切换模型,体验Qwen3.5-Plus。据悉,千问3.5实现了从纯文本模型到原生多模态模型的代际跃迁。 此次发布的版本总参数为3970亿,激活仅170亿,性能称超过万亿参数的Qwen3-Max模型,部署显存占用降低60%,推理效率大幅提升,最大推理吞吐量可提升至19倍。 Qwen3.5-Plus的API价格每百万Token低至0.8元,仅为Gemini 3pro的1/18。
新浪微博 2026-02-16 00:00:00
26. 小伙25万预算纠结不知道买什么车,要多对比再决定 #懂车帝独播 #二十五万轿车 #超哥直播回放 #买车
抖音 2026-04-12 00:00:00
27. Google 深夜放大招!Gemma 4 12B 开源模型发布,普通电脑也能跑?实测结果出乎意料!本地部署及下载 | 零度解说
哔哩哔哩 2026-06-06 00:00:00
28. DeepSeek发布多模态论文又连夜删除
微信公众号 2026-05-01 00:00:00
29. 4 月 24 日,第十九届北京国际车展启幕,卓驭科技以 “智能一切移动” 为主题召开发布会,全球首个原生多模态基础模型正式亮相,同步开放试乘体验,全面展现多领域智驾规模化落地成果,并联手中国一汽,推动智能移动技术全域普惠。作为 “移动智能基座” 理念先行者,卓驭科技打通智驾技术从验证到普惠的全路径,已覆盖乘用车、商用车、无人物流、Robotaxi 全赛道,合作客户 34 家,合作车型超 130 款,成为行业首个多垂类大规模落地的智驾科技企业。乘用车领域,卓驭量产车型超 50 款,实现油电、中外品牌全矩阵覆盖,是业内首个量产单芯片舱驾一体供应商。今年 4 月起,高悟性端到端 4.0 模型将 OTA 推送至多款车型,中低算力平台同步升级 3.0 系统,让高阶智驾全价位覆盖。商用车布局行业领先,已与国内 TOP6 重卡品牌全面合作,搭载专属智驾系统的重卡 6 月起量产;同步与宇通客车达成合作,新款智驾客车 9 月交付。独创激目 2.0 系统,精准适配重卡、客车场景,大幅提升行车安全与运营效率。无人场景持续推进,城配物流方案 7 月试运营,L4 级 Robotaxi 下半年开启试运行,均搭载新一代原生多模态基础模型,实现高阶自动驾驶规模化落地。此次发布的原生多模态基础模型,重新定义 “移动物理 AI” 内核,通过物理世界通用规律预训练,实现多模态数据统一表征,达成零数据知识迁移,跨垂类、跨地域开箱即用,彻底解决行业泛化成本高的痛点,助力智驾技术全球快速落地。展会现场该模型已开放乘用车试乘,年内将推送至乘用、商用车型,成为出海核心技术底座。同时卓驭与中国一汽深化合作,多款红旗、一汽解放车型落地智驾方案,未来将联合打造更高阶智能驾驶产品。#卓驭科技 #
新浪微博 2026-04-24 00:00:00
30. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?
知乎 2026-04-30 00:00:00
31. 面向实战的多模态数据生成与表征技术创新
知乎 2026-01-07 00:00:00
32. Cell Reports Medicine(一区|IF=10.6)|人工智能驱动的多模态成像集成在神经精神疾病精准医疗中的应用
微信公众号 2026-03-23 00:00:00
33. #DeepSeek和谷歌Gemini谁更强#大模型选到头不是看跑分,是看谁真能帮你干活。DeepSeek和Gemini本质两条路:DeepSeek是中文“解题专家”,数学、代码、长文档理解极强,百万token只要几分钱,开源还能本地部署,对隐私和数据安全要求高的团队很友好。Gemini则是多模态“全能手”,图、音、视频通吃,深度绑定Google全家桶,适合跨国办公和复杂创作场景。说人话:日常写代码、读百页合同、搞中文创作,预算有限——DeepSeek。跨模态处理、依赖Google生态、愿意为综合能力付费——Gemini。deepseek和谷歌gemini谁更强
新浪微博 2026-05-21 00:00:00
34. 变大的阔折叠 真阔绰 | 华为 Pura X Max 开箱 对比多款常规尺寸手持设备「科技美学开箱」
哔哩哔哩 2026-04-20 00:00:00
35. #千问Qwen3.5大模型发布#阿里巴巴春节AI大战再出一张王牌。今天,阿里巴巴正式开源并上线了新一代千问大模型Qwen3.5,以其原生多模态架构和极致效率设计,成为全球开源AI领域的新标杆。Qwen3.5首次实现原生多模态融合,直接支持文本、图像及视频输入,无需外部适配即可完成跨模态理解任务。推理吞吐量提升8.6倍至19倍,显存占用降低60%。实测性能超越自家万亿级前代模型Qwen3-Max,并在多项权威评测中领先。用户可通过千问APP、PC端一键切换至Qwen3.5模型,实时体验多模态交互。Qwen3.5的发布标志着国产大模型进入“效率+多能力”双轨竞争阶段。其发布节点直击春节技术窗口,与DeepSeek v4、字节豆包2.0等国产模型形成“春节AI大战”格局。#老张聊科技#
新浪微博 2026-02-16 00:00:00
36. 荣威又回来了!7年布局,数百亿投入!荣威发布全球首个AI原生序列“家越”及CPP架构硬核底层重构:全车2000+端口多模态输入,2000+ SOA全域接口实现AI原子级调度!从“互联网先行”跃升“AI定义者”。首发家越07,主打空间与智能双越级,将AI化为统一入口,交互与决策深度融合,开启家庭出行新纪元! 电动派大星的微博视频
新浪微博 2026-04-22 00:00:00
37. 亚历山大王终于发版了Muse Spark,这是Meta Superintelligence Labs(MSL)的首个模型,通过九个月从头重构AI基础设施、架构和数据管道实现,现已全面驱动Meta AI。Muse Spark为原生多模态推理模型,支持工具使用、视觉思维链和多代理编排;新增Contemplating模式可并行多代理推理,处理复杂科学问题时性能与Gemini Deep Think、GPT Pro相当。模型在预训练、强化学习和测试时推理上展现可预测扩展规律,经过前沿风险、安全对齐和对抗鲁棒性评估,未来将开放私人API预览并计划开源后续版本。
新浪微博 2026-04-09 00:00:00
38. 商汤SenseNova U1深度拆解,原生统一架构终结缝合时代
微信公众号 2026-05-14 00:00:00
39. 上交AutoLab&中科院提出OneDrive:探索原生VL模型能否统一自驾多种异构任务
微信公众号 2026-04-28 00:00:00
40. 第二代 VLA 物理 AI 大模型 原生多模态赋能,重构智驾决策核心✅ 自动驾驶问题本质上也就是物理 AI 问题,L4能力=模型x算力x数据x本体✅ 以物理 AI 为核心,打造原生多模态基座大模型,深度理解物理世界✅ 实现看、听、读一体化融合,视觉思维链推理效率飙升 32 倍✅ 支持语音、视觉、动作多模态输出,自主推演最优驾驶策略,筑牢舱驾联动底层#小鹏第二代VLA发布##小鹏智驾负责人称拉开差距的时刻到了#
新浪微博 2026-03-02 00:00:00
41. 阿里发布新一代全模态大模型Qwen3.5-Omni。 采用混合注意力MoE架构,通过1亿小时音视频+文本跨模态预训练 。 原生支持113种语言识别(含毛利语等濒危语种)和36种语音生成。 创新ARIA语音技术实现音色稳定,对话响应延迟降低至人类感知无差别水平。 核心突破: 视听理解:在DailyOmni等215项基准测试中全面超越Gemini 3.1 Pro ,嘈杂环境语音识别错误率下降42%(WenetSpeech基准)视频内容结构化描述准确率达98.1%(RealWorldQA测试) 。 Vibe Coding进化:非预设能力,在百万级多模态指令微调中自然涌现 。 普通用户可前往Qwen Chat免费体验,开发者和企业可通过阿里云百炼平台调用Qwen3.5-Omni模型Plus、Flash、Light三种API。
新浪微博 2026-03-31 00:00:00
42. ICML'26 | 复旦新作OneTrackerV2:多模态视觉跟踪大一统!
知乎 2026-05-11 00:00:00
43. Nature | 统一的多模态学习模型
微信公众号 2026-03-02 00:00:00
44. 小米开始秀技术了小米开源首代机器人 VLA 大模型,刷新多项 SOTA!Xiaomi-Robotics-0,拥有 47 亿参数、兼具视觉语言理解与高性能实时执行能力的开源 VLA 模型。它不仅在三大主流的仿真测试中获得优异成绩,更在现实真机任务中实现了物理智能的泛化——动作连贯、反应灵敏,且能在消费级显卡上实现实时推理。仿真标杆: 在 LIBERO、CALVIN 和 SimplerEnv 测试中,模型在所有的 Benchmark、30种模型对比中,均取得了当前最优的结果。真实挑战: 我们在双臂机器人平台上部署了模型并与行业标杆进行了横向对比。在积木拆解和叠毛巾这种长周期、高度挑战的任务中,机器人展现出了极高的手眼协调性。无论是刚性的积木还是柔性的织物,都能处理得游刃有余。多模态能力:模型保留了 VLM 本身的多模态理解能力,尤其是在具身更相关的 benchmark 中表现优异,这是之前的 VLA 模型所不具备的。#汽场全开##小米# 小马甲不小的微博视频
新浪微博 2026-02-12 00:00:00
45. 讲几个我猜到有趣的地方: G-ASD 如果去比较严谨的描述,确实是一个原生的多模态大模型的能力 这里我并非想去提世界模型ORVLA 这个描述,而是把他定义成原生多模态大模型 WHY? 1️⃣:浩瀚千里有做多模态模型的研发资源【牛马】 2️⃣:吉利自己有基座模型【这个优势很大】,已经验证了有自己的基座模型后优势非常的大 3️⃣:大算力芯片能支持原生多模态大模型在车端跑推理。 所以,Q1 能看到一些G-ASD有趣的进展 @极氪大白 浩瀚千里的工程能力还是相当扎实的,这个没得黑 @KerryMrX 一方面是能力上限的提升【芯片的构架迭代】 另一方面是场景的扩展【对于语义信息的理解】大幅度提升了驾驶场景的理解能力 @影总Tim @叫海啸的猫 @首席线索官 @碳粉说电池不胖 @40在跑车 @july再发呆 @本诺__ #极氪8X将首发新一代辅助驾驶技术##极氪[超话]##懒博小课堂##听不懂的汽车黑话#
新浪微博 2026-02-25 00:00:00
46. #2026北京车展# 卓驭公布最新技术和业务进展:▷ 推出首个原生多模态基础模型,其技术内核是在底层完成对物理世界通用规律的预训练,该模型可以用于乘用车、商用车的自动驾驶,也可以用于机器人。车展期间,卓驭已经正式开放原生多模态基础模型的试乘体验,测试车使用大算力英伟达Thor芯片,搭载11V视觉方案和激目2.0系统。量产版将于年内开启推送!▷ 目前卓驭累计量产车型已经超过50款,定点车型超100款,覆盖油车&电车、国内&海外。▷ 在商用重卡领域,卓驭已与中国TOP 6商用车品牌全部建立合作,搭载高悟性端到端4.0的商用重卡今年6月起交付。▷ 在商用客车领域,卓驭已经和宇通客车达成战略合作,双方将联合开发面向商用客车的NOA智能驾驶解决方案。该方案搭载激目2.0系统和卓驭自研自产的补盲激光雷达,基于英伟达Thor芯片,使用原生多模态基础模型,量产车将于今年9月交付,功能覆盖高速NOA、城区NOA及自主停泊。▷ 在无人驾驶领域,卓驭的无人物流车计划于今年7月启动试运营,L4级自动驾驶Robotaxi将于今年下半年开始试运行。Robotaxi将直接搭载下一代原生多模态基础模型,并配备卓驭自研自产、基于双英伟达Thor芯片打造的三冗余L4级控制器。#车展有ai##北京车展潮这看#
新浪微博 2026-04-27 00:00:00
47. 原生多模态模型技术全景
知乎
48. 商汤 NEO 原生架构
知乎
49. 最新进展 | 多模态原生融合
微信公众号
50. 多模态AI原生架构重构
微信公众号
51. 多模态原生融合如何实现音视频图文的统一理解与生成?
今日头条
52. 多模态智能体觉醒
微信公众号
53. OneKeyNet“万能胶水”
微信公众号 2026-04-01 00:00:00
54. 多模态特征融合发Paper是给这些人玩明白了 - 哔哩哔哩
哔哩哔哩 2026-01-27 00:00:00
55. 刚刚,DeepSeek全新多模态技术开源!
今日头条 2026-05-01 00:00:00
56. Graph4MM
今日头条 2025-12-15 00:00:00
57. 避开Transformer内卷!Mamba多模态融合新方向,省算力还轻松刷SOTA!
微信公众号 2026-05-12 00:00:00
58. 知新研学 |AlignMamba
微信公众号 2026-03-09 00:00:00
59. 多模态特征融合 = 顶会?这两篇论文直接把路给你铺好了!
微信公众号 2026-04-29 00:00:00
60. 多模态融合正在被推翻?ICLR开始正视不对齐
微信公众号 2026-04-14 00:00:00
61. 多模态融合进阶
微信公众号 2026-05-04 00:00:00
62. 多模态大模型学习笔记(七)——多模态数据的表征与对齐
微信公众号 2026-02-25 00:00:00
63. 多模态特征融合核心技巧与实践指南
小红书 2026-04-19 00:00:00
64. Gramian多模态表示学习与对齐-ICLR2025
小红书 2026-03-26 00:00:00
65. ChatGPT多模态技术拆解
什么值得买 2026-03-22 00:00:00
66. 多模态大模型的尽头只是画图吗?LatentUM
知乎 2026-04-05 00:00:00
67. 浙江大学等发布跨模态世界大模型LatentUM
小红书 2026-05-08 00:00:00
68. 【Science】RFAA架构的跨模态建模逻辑
微信公众号 2026-04-29 00:00:00
69. 阿里NeurIPS'25语言中枢全模态表示学习
知乎 2025-12-22 00:00:00
70. LLM2CLIP
微信公众号 2026-02-04 00:00:00
71. 多模态 + 跨模态对齐
知乎 2026-04-08 00:00:00
72. Nat Commun | 统一大脑跨模态感知
知乎 2026-04-03 00:00:00
73. 多模态特征融合前沿风口!跨域信息互补赋能,全域特征建模全面升级
微信公众号 2026-04-29 00:00:00
74. ACM ICMR 2026|跨模态互补表征对齐的轻量级框架
微信公众号 2026-04-18 00:00:00
75. PR Letters 2024|CrossFormer
微信公众号 2025-12-19 00:00:00
76. *TMM 2025 | Fusion-Mamba
微信公众号 2025-12-16 00:00:00
77. Nat. Methods | 统一多模态嵌入驱动的病理形态与分子特征解码
知乎 2026-05-20 00:00:00
78. CVPR'26 | 从任务统一到模态协同
知乎 2026-04-10 00:00:00
79. Pattern Recognit
微信公众号 2026-04-05 00:00:00
80. HL-CMR: 跨模态检索的超图学习
微信公众号 2026-05-07 00:00:00
81. 多模态对齐新idea!深度学习创新点
小红书 2026-01-05 00:00:00
82. GPT-4o推理能力深度拆解
什么值得买 2026-03-16 00:00:00
83. GPT-4o之后
今日头条 2026-03-20 00:00:00
84. 多模态模型是怎么训练的?从CLIP到GPT-4o,一文看懂底层原理
微信公众号 2026-06-02 00:00:00
85. AI前沿解析
微信公众号 2026-04-01 00:00:00
86. 深度拆解Gemini
今日头条 2026-04-14 00:00:00
87. Gemini官网技术路线深度拆解:原生多模态到智能体时代的架构演进
什么值得买 2026-04-15 00:00:00
88. Gemini Embedding 2 来了!谷歌首个原生多模态嵌入模型,一文看懂
微信公众号 2026-04-03 00:00:00
89. Gemini在多模态图像处理上的领先性核心在于底层原生多模态融合架构,而非简单的功能叠加;它可保留图像原生宽高比,实现像素级精准分析与空间感知,避免缩放裁剪的细节损失;兼具高准确率的图像文本解析能力,能完成图表数据提取等跨模态复杂任务,多模态推理表现突出,可处理多图序列并保持逻辑连贯;同时支持自然语言驱动的精准局部图像修改,让多模态图像处理更高效自然。
抖音 2026-02-08 00:00:00
90. Gemini Embedding 2
知乎 2026-05-29 00:00:00
91. Gemini 3技术拆解
哔哩哔哩 2026-03-24 00:00:00
92. Omni Model vs Pipeline 多模态实现方式优劣对比报告 - 哔哩哔哩
哔哩哔哩 2026-05-16 00:00:00
93. 杨立昆&谢赛宁新文章
微信公众号 2026-05-30 00:00:00
94. 彻底干掉预训练视觉编码器!纯像素嵌入做到SOTA多模态理解与生成 【多模态大模型】
哔哩哔哩 2026-04-29 00:00:00
95. GPT5.5多模态能力拆解从架构到训练的完整技术路线
今日头条 2026-05-16 00:00:00
96. 真正原生统一的多模态大模型!扔掉预训练VAE和视觉编码器,同时搞定理解和生成【多模态大模型论文解读】
哔哩哔哩 2026-05-15 00:00:00
97. 多模态大模型技术
今日头条 2026-06-03 00:00:00
98. GPT5.5多模态能力拆解从架构到训练的完整技术路线
今日头条
99. Claude 4.7论文研究视觉 - 文本跨模态推理的技术革新与场景落地
什么值得买 2026-05-07 00:00:00
100. 🚀字节这模型居然能跨模态推理
小红书 2026-04-28 00:00:00
101. 多模态大模型音频推理能力评测基准
小红书 2026-02-03 00:00:00
102. LatentUM: 潜在空间统一模型跨模态推理
小红书 2026-04-11 00:00:00
103. 卓驭首发“原生多模态基础模型”,要做移动物理AI的“OpenAI”
今日头条 2026-05-09 00:00:00
104. 【多模态大模型】盘点part2: Qwen-VL系列
知乎 2026-01-14 00:00:00
105. 什么是原生多模态?
小红书 2026-05-26 00:00:00
106. 原生多模态基础模型发布,卓驭科技开启下一场“战争”
今日头条 2026-04-25 00:00:00
107. Gemini 3表现如何?多模态和代码生成实测
今日头条 2026-04-20 00:00:00
108. GPT-4o如何通过端到端训练实现多模态交互低延迟?
今日头条 2026-03-27 00:00:00
109. 卓驭科技发布首个原生多模态基础模型,与中国一汽深化战略合作
今日头条 2026-04-24 00:00:00
110. 如何利用大模型技术有效地在跨模态场景下进行数据处理、知识融合和智能推理
微信公众号 2025-12-30 00:00:00
111. 多模态大模型Qwen-VL - 哔哩哔哩
哔哩哔哩 2026-03-10 00:00:00
112. Qwen-3.5:当混合专家架构遇上原生多模态,国产大模型站上新高度
今日头条 2026-03-06 00:00:00
113. 【完结】多模态与视觉大模型开发实战 - 2026必会
知乎 2026-01-14 00:00:00
114. 阿里Qwen3-VL多模态大模型:256K上下文与三大架构创新解析!
知乎 2026-01-04 00:00:00
115. Qwen3-VL多模态大模型深度解析:从架构设计到训练策略的完整指南!
知乎 2026-01-23 00:00:00
116. 几张表看懂Qwen-VL系列进化史
微信公众号 2026-02-03 00:00:00
117. 多模态模型详解2 - Qwen VL系列
知乎 2026-05-14 00:00:00
118. [论文速读](ACL Finding 2024)Mitigating Hallucinations in LVLMs with Instruction Contrastive Decoding
知乎 2025-12-24 00:00:00
119. GPT-4o的单模型多模态集成对智能体交互体验有何提升?
今日头条 2026-03-27 00:00:00
120. DMLR: 动态多模态潜在推理
小红书 2026-01-01 00:00:00
121. ICCV 2025 | 从博弈论视角出发!INTER:强化多模态交互,革新大视觉语言模型幻觉缓解方案
知乎 2026-01-16 00:00:00
122. Gemini 核心优势解析:原生多模态与成本控制的双重壁垒
今日头条 2026-05-03 00:00:00
123. 商汤发布SenseNova 6.7 Flash-Lite:原生多模态架构推进智能体落地
今日头条 2026-05-09 00:00:00
124. 统一多模态理解与生成模型:进展、挑战与机遇
知乎 2026-01-08 00:00:00
125. Kimi K2.6技术架构全解析:万亿参数MoE+原生多模态+Agent Swarm的工程实现
微信公众号 2026-04-23 00:00:00
126. Gemini 3 技术拆解:原生多模态与推理能力升级
今日头条 2026-04-17 00:00:00
127. 开源视觉AI的翘楚,揭秘Qwen-VL,,“看、懂、想”三位一体的内核
知乎 2025-12-23 00:00:00
128. MIBench:揭示多模态大模型核心交互能力短板
小红书 2026-03-19 00:00:00
129. 引导多模态AI幻觉可验证性
小红书 2026-04-17 00:00:00
130. 多模态Agent开发实战:Gemini原生图文语音生成详解 | AI Engineer
哔哩哔哩 2026-05-22 00:00:00
131. Kimi K2.6:月之暗面发布的原生多模态智能体模型
今日头条 2026-04-30 00:00:00
132. ICCV 2025 | 突破感知-推理壁垒!R1-Onevision:多模态推理全链路解决方案,超越GPT-4o
微信公众号 2026-03-18 00:00:00
133. 带你秒懂多模态AI大模型原理🤯不看亏了!
小红书 2026-02-14 00:00:00
134. DeepSeek V4计算量降27%,GPT-4o多模态统一:架构差异有多大
今日头条 2026-04-29 00:00:00
135. 上科大何旭明团队新作:克服简单样本偏置,让多模态模型学会「难题优先」
百度 2026-01-16 00:00:00
136. 细粒度视觉感知的基石:Qwen-VL 初代架构剖析
知乎 2026-04-19 00:00:00
137. 卓驭科技发布首个原生多模态基础模型
今日头条 2026-04-24 00:00:00
138. 原生多模态模型Scaling Law:抛弃视觉塔?
小红书 2025-12-18 00:00:00
139. 用Gemini API构建多模态智能体 | AI Engineer
哔哩哔哩 2026-05-21 00:00:00
140. SIGMA: 解耦模态内一致性与全局对齐的多模态注意力架构
知乎 2025-12-15 00:00:00
141. 华为王元:《多模态AI训练趋势》
微信公众号 2026-05-10 00:00:00
142. 多模态特征融合发Paper是给这些人玩明白了
知乎 2026-01-27 00:00:00
143. MCR新框架:MLLM跨模态推理
小红书 2026-02-06 00:00:00
144. AI算法面试题:Qwen-VL原理
微信公众号 2026-02-01 00:00:00
145. 多模态RAG:打破模态壁垒,重塑AI知识服务新模式
微信公众号 2026-05-25 00:00:00
已收藏
去我的收藏夹