张大妈

轻量多模态模型:AI普惠落地的核心引擎

源自185位全网作者

05-22 18:39

内容由AI生成

精选参考来源

1. 微表情测谎、极速赔付、AI打败AI,深聊“AI in All”下的保险革命与增长飞轮【硅谷101】

2. 当激光雷达的分辨率堪比摄像头,辅助驾驶会有多安全?【X.PIN】

3. Seedance 2.0深度评测|AI视频生产力革命

4. GDC观察:游戏大厂都来聊AI,“游戏AI”的新规则由谁制定?【硅谷101】

5. 两分钟发布会 | 小米YU7 GT发布!不是丐版的YU7标准版/小米首款耳夹式耳机/小米手环10等等

6. 硅谷《连线》杂志:性能顶级的 GPT-5们,正在输给一个中国开源模型#连线杂志 #AI #千问 #Qwen #千问恐慌

7. 复盘特斯拉FSD进化史:把端到端推向无人驾驶终局

8. Lior Alexander 推出了一项突破性技术——dLLM,实现了将任意自回归语言模型(LLM)转化为扩散模型的公开方案。这一转变核心在于:1. 去除传统自回归中的因果掩码,启用双向注意力机制,令模型能全面感知上下文;2. 随机遮蔽部分Token,训练模型填补空白,实现高效的内容推断;3. 通过轻量级监督训练,稳定生成结果,提升模型表现。这一方法不仅改变了模型架构,还带来了实用的工具链支持,涵盖训练、推理和评估,兼容LoRA、DeepSpeed、FSDP、4-bit量化及多GPU等多种高效训练方案。官方仓库还提供了自回归扩散、BERT扩散及编辑流模型的示例,极大地便利了研究和应用。技术社区反响热烈:有人关注其对偏见问题的潜在改善,有人好奇推理延迟的权衡,更有人赞叹跨领域架构迁移的创新意义——LLM技术被赋能于图像生成,打破模态壁垒。dLLM通过并行去噪128个Token,显著减少推理步骤(65步对比传统的97步),特别适合编辑式任务和专家模型(MoE)的扩展。这不仅是架构的革新,更是对模型理解和生成方式的重新定义——从线性单向走向全面双向,模型“看见了更完整的画面”。未来,dLLM有望推动更高效、更灵活的多模态AI系统,开启语言模型的新篇章。x.com/LiorOnAI/status/1998484013410046135 爱可可-爱生活的微博视频

9. 从“开车”到“懂世界”:理想MindVLA-o1重新定义自动驾驶基座理想汽车在英伟达GTC大会上,正式发布下一代自动驾驶基础模型 MindVLA-o1,定位为面向物理世界的通用智能体,首次实现感知、推理与控制的深度统一,完成自动驾驶从“功能堆叠”到“智能体思考”的跃迁。它的核心价值,不止于更稳的驾驶,简单总结三点:1. 3D空间理解:原生3D ViT架构,精准建模物理世界,复杂场景感知更可靠2. 多模态思考:把感知、推理、决策融于一体,像人一样预判与思考3. 通用物理智能:同一套VLA模型,既可控车,也能驱动机器人,打开跨域智能的想象空间总之目前最核心的变化就是它会让自动驾驶看得更远、想得更深、行得更稳、进化更快、部署更高效,所谓自动驾驶,只是物理AI的第一站。当车真正理解空间、学会思考,智能出行才真正被改写。#李想称机器人也用VLA##理想全能辅助驾驶来了##理想发布下一代自动驾驶基础模型#

10. 刚刚,智谱开源GLM-4.6V系列模型啦~GLM-4.6V系列型号包括两个版本:GLM-4.6V (106B),一个为云端和高性能集群场景设计的基础模型,以及GLM-4.6V-Flash (9B),一个针对本地部署和低延迟应用优化的轻量化模型。GLM-4.6V在训练中将其上下文窗口扩展到128k个token,并在同类参数规模的模型中实现了视觉理解的最先进性能。最关键的是,我们首次集成了原生的函数调用功能。这有效地弥合了“视觉感知”和“可执行动作”之间的鸿沟,为现实世界商业场景中的多模态智能体提供了统一的技术基础。GLM-4.6V 引入了几个关键特性:🌟原生多模态功能调用:实现了原生的视觉驱动工具使用。图像、截图和文档页面可以直接作为工具输入,而无需文本转换,同时视觉输出(如图表、搜索图像、渲染页面)会被解释并融入推理链条中。这闭环了从感知到理解再到执行的过程。🌟交错图文内容生成:支持从复杂的多模态输入中创建高质量的混合媒体内容。GLM-4.6V 处理多模态上下文—涵盖文档、用户输入和工具检索的图像—并合成与任务相关的连贯交错图文内容。在生成过程中,它可以主动调用搜索和检索工具来收集和策划额外的文本和视觉素材,生成丰富、视觉化的内容。🌟多模态文档理解:GLM-4.6V 能处理最多128K个标记的多文档或长文档输入,直接将富格式页面作为图像进行解读。它可以共同理解文本、布局、图表、表格和图形,从而准确理解复杂、以图像为主的文档,而无需将其先转换为纯文本。🌟前端复刻与视觉编辑:从 UI 截图重建像素级准确的 HTML/CSS,并支持自然语言驱动的编辑。它通过视觉检测布局、组件和样式,生成干净的代码,并通过简单的用户指令应用迭代的视觉修改。#科技先锋官#

11. AI时代,最不值钱的,就是重复劳动; 最值钱的,是你得熟练指挥智能体。#大咖观察 #红衣聊AI #硅谷 #智能体 #AI应用

12. 3B打32B?海外病毒式传播的小模型,竟然来自BOSS直聘

13. 北交&地平线提出DIVER:扩散+强化的多模态规划新框架

14. 小米为什么不深耕AI(小爱同学)反而要跨赛道去研究车呢?

15. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代

16. 盘点一周AI大事2月8日|AI相亲、AI当老板、AI狼人杀 Anthropic发布最强大模型Claude Opus 4.6 OpenAI发布最强编码模型GPT5.3Codex OpenAI推出Codex桌面版 Google上线AI狼人杀 AI雇佣人类平台RentAHuman爆火 AI雇佣AI平台ClawTasks爆火 龙虾相亲平台MoltMatch爆火 智谱开源最强OCR模型GLM-OCR 字节发布最强视频模型Seedance 2.0 研究员开源无痕编辑视频模型Edit Yourself 字节开源最强分子预测模型Protenix-v1 Google发布论文配图AI Paper Banana #AI新星计划 #前沿科技趋势发布月 #AI #AIGC #OpenAI

17. #千问Qwen3.5大模型发布#刚刚阿里正式发布全新一代大模型千问Qwen3.5-Plus。用户可在千问APP、千问PC端体验,点击页面顶部千问图标,即可切换模型,体验Qwen3.5-Plus。Qwen3.5已经从纯文本模型进化到原生多模态模型,不管是推理能力,还是多模态理解与更高效的运行体验#how i ai##过个有ai年#

18. 为什么2026年大模型都在往“理解生成统一”方向发展?去掉VAE和VE到底能带来什么本质性的提升?

19. 如何看待最新发布的国产统一多模态大模型让P视频像P图一样简单?未来的视频制作产业会发生什么变化?

20. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

21. 以前拍片烧几百万,现在只需说几句话?剪映Seedance 2.0有多逆天?#AI新星计划 #科技改变生活 #Seedream #Seedance2.0#玩个很新的东西

22. 2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】

23. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格

24. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与

25. #AI为小米汽车带来出行新体验#AI 是辅助驾驶的技术核心之一,无论是VLA模型,还是 Xiaomi HAD 增强版全新上线的「世界模型」,其本质就是让辅助驾驶系统能够像人一样思考、推理、预判。可以说,AI 就是辅助驾驶为车主带来“出行新体验”的关键一环。小米汽车在辅助驾驶能力迭代过程中相当重视AI 能力的落地与应用。2025年,小米集团于 AI 领域投入70亿资金,并建立了辅助驾驶三大研发中心,同时拥有超1800人的精英研发团队,“有钱、有人、有决心”,这便是小米汽车技术团队深耕 AI 的底气与毅力。在近期发布的 Xiaomi HAD 增强版中,我们已经能够领略小米汽车在 AI 领域的初步进展:「强化学习」带来相较传统模仿学习更高的效率与上限、「世界模型」不断丰富辅助驾驶学习场景来源,于仿真世界中不断强化模型学习推理能力。像这些 AI 技术的新进展所带来的“体验提升”是广大车主有目共睹的。AI 对辅助驾驶的“变革”离不开实践的检验,期待车主们实际场景下的体验央视财经的微博视频

26. 轻至 26g!AI录音+智能交互的眼镜能否解放双手?Vidda G11智能眼镜开箱体验

27. 卢宗青团队新作:人类先验打底,统一动作对齐,通用机器人模型正在落地

28. 在线模型推理部署经常遇到多模态模型支持复杂,性能难以优化的问题。vLLM-Omni 基于高效的 KV cache 管理和流水线执行,专为支持包括文本、图像、音频、视频等多模态输入的模型设计,轻松实现异构模型推理和服务。它不仅兼容主流 Hugging Face 开源模型,还支持分布式推理、多阶段流水线调度、流式输出和 OpenAI 兼容接口,极大提升多模态模型在线推理的效率和灵活性。GitHub: github.com/vllm-project/vllm-omni主要功能:- 支持多模态数据(文本、音频、图像、视频)处理与生成;- 支持非自回归架构如扩散模型,实现高效的并行生成;- 基于 KV cache 优化自回归模型推理性能;- 异构流水线抽象,管理复杂多阶段模型工作流;- 分布式推理支持,涵盖张量并行、数据并行和专家并行;- 开箱即用的 OpenAI 兼容 API 服务器,方便集成;- 支持主流平台(CUDA/ROCm/NPU/XPU),广泛适配多硬件环境。适合AI开发者、研究人员和企业级应用场景的多模态AI模型推理部署。#AI开发# #多模态模型# #机器学习#

29. 智驾行业学习笔记|特斯拉FSD模型的非共识

30. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】

31. 梦想照进现实!AI大模型全屋智能居然成了?!

32. 听着有点“烧脑”!但我必须给你深度讲讲,冬季用车场景小米汽车有哪些硬核技术

33. AI 圈的“春晚”提前开了?MiniMax 的M2.5,10B 激活参数跑出旗舰水准! #人工智能 #科技改变生活 #玩个很新的东西 #MiniMax #Agent

34. 多模态大模型这条赛道,阿里云开始拉速度了

35. #千问Qwen3.5大模型发布#阿里巴巴春节AI大战再出一张王牌。今天,阿里巴巴正式开源并上线了新一代千问大模型Qwen3.5,以其原生多模态架构和极致效率设计,成为全球开源AI领域的新标杆。Qwen3.5首次实现原生多模态融合,直接支持文本、图像及视频输入,无需外部适配即可完成跨模态理解任务。推理吞吐量提升8.6倍至19倍,显存占用降低60%。实测性能超越自家万亿级前代模型Qwen3-Max,并在多项权威评测中领先。用户可通过千问APP、PC端一键切换至Qwen3.5模型,实时体验多模态交互。Qwen3.5的发布标志着国产大模型进入“效率+多能力”双轨竞争阶段。其发布节点直击春节技术窗口,与DeepSeek v4、字节豆包2.0等国产模型形成“春节AI大战”格局。#老张聊科技#

36. Agent时代,为什么多模态数据湖是必选项?

37. 如何看待最新发布的国产统一多模态大模型让P视频像P图一样简单?未来的视频制作产业会发生什么变化?

38. 詹锟在GTC上分享了理想目前智能驾驶方面的进展,最关键的一点就是最新的VLA模型——MindVLA-o1,基于统一 Vision Language-Action 的 Omni 架构,在单一Transformer 中联合建模感知、推理与控制。主流 VLA 方案的三大局限性(图二):①3D 视觉 / 语言与动作对齐慢,延迟高②长尾场景数据无法规模化,真实世界长尾场景数据采集成本高、覆盖不全,模型泛化差③VLA 模型参数量大、推理重,车端算力无法支撑那么理想的VLA是怎么解决这些的呢?(图三)多模态输入——MindVLA-o1-MoE(快慢思考)——Action Output(输出轨迹)※多模态输入采用了3D 视觉基座,让其自主学习 3D 空间语义,减少了大量的人工标注数据,模态在同一表示空间获得更高效率和更强泛化能力※新增了一个Latent World Model(潜在的世界模型),将输入图像编码为潜在 Token再重构,去模拟未来一下秒的关键画面,比如这一帧进去的图片是“右侧车辆偏压线”(To),模型预判 “右侧车辆会强行加塞”,并推理两种动作:直接行驶 → 碰撞(To+1)。立即左避 → 安全(T'o+1),去提前选择安全动作,解决长尾场景下的决策难题(图五)※多模态输入进模型以后,会将语言指令会通过3.2B的MOE模型,做 CoT(思维链)推理,同时将其他视觉特征则生成动作 Token,最后生成稳定轨迹,减少了推理时间※构建强化学习框架让模型在真实和模拟环境中学习探索,反补世界模型做技术升级,优化驾驶策略(图七)。※面向端侧大模型的软硬件框架,提升端侧 VLA 模型设计和部署效率,换句话说Orin和Thor还会有一定的升级(图八)自动驾驶系统逐渐演化成通用物理世界基础模型,可控制车辆、机器人和机械臂,还能生成具身智能训练数据,未来将驱动各种物理系统,具身 AI 将走进人们生活。#懒博小课堂##微博新知##理想L9#

39. #用声音马住中国年##微博声浪计划# 阿里除夕夜发布千问Qwen3.5大模型,架构革新降本增效,多模态能力跃升。双版本覆盖全场景,轻量版适配边缘设备,高性能版企业成本降80%。开源生态加速普惠,改写全球AI竞争格局,推动技术落地与行业变革。 科技阿南的微博音频

40. 百万级大奖等你来,华为乾崑智驾公开赛见证硬核智驾实力!

41. 昨天谷歌发了 Gemma 4 开放权重模型系列,升级挺猛的。一共四个版本,除了端侧轻量版,还头一回上了 MoE 架构的 26B 模型。全系支持多模态,能看懂图片听懂语音,自带推理思考功能,上下文直接拉到了 25 万。最香的是改用 Apache 2.0 彻底开源了。感觉谷歌这次是真的放开手脚了,那个 26B 单卡就能跑,性价比挺高,可以试着本地部署跑个试试看。#谷歌发布Gemma4开源大模型# #微博跨域计划# #AI创造营#

42. 盘点一周AI大事(5月17日)|AI终于正常说话 Google发布Android大脑 Gemini Intelligence Google推出Gemini 光标 Google视频模型Veo 4曝光 Thinking Machines 发布最强实时交互模型 Interaction Models 面壁智能发布最强开源小模型 MiniCPM-V 4.6 Sakana开源 AI 指挥官 Conductor Model / Fugu Adaption发布 AI 研究员 AutoScientist 研究员开源最强运镜视频模型 Warp-as-History 研究员开源最强打光视频模型 Relit-LiVE 研究员开源最强图生 3D 模型 Pixal3D 研究员开源最强视频配音模型 Just-Dub-It #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

43. “谷歌太慢了”:与Andrew Dai聊Gemini的翻身之战,出走与视觉理解模型【硅谷101视频播客】

44. 盘点一周AI大事(2月22日)|不赚钱拔网线,龙虾狂赚1万 工程师开源龙虾打工人ClawWork,10刀开局,7小时狂赚1万刀 工程师Sigil开源首个全自主智能体The Automaton Kimi上线云端龙虾Kimi Claw 网易开源桌面版龙虾LobsterAI Google上线地表最强大模型Gemini 3.1 Pro Gemini接入音乐模型 Lyria 3 NotebookLM升级,动动嘴就能修改PPT,还支持导出PPTX格式 Anthropic发布Claude Sonnet 4.6 Claude与Figma官宣史诗联动,Claude Code写的页面能一键导入Figma 阿里开源最强行动智能体 Mobile-Agent-v3.5 字节开源极速生图模型BitDance Tavus发布最强数字人模型Phoenix-4 Taalas研发出革命性AI芯片HC1 #抖音年味新知贺岁 #前沿科技趋势发布月 #AI新星计划 #OpenAI #智能体

45. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

46. 盘点一周AI大事(1月11日)|最强人形机器人 OpenAI公布2026研发路线图 DeepSeek被爆2月发布DeepSeek V4 Google推出Veo3驱动的数字人Vids 字节开源换脸视频模型DreamID-V 阿里开源数字人框架HRM2Avatar Lightricks开源顶级视频模型LTX-2 ElevenLabs推出最强语音转录模型Scribe v2 斯坦福开源睡眠分析模型SleepFM 港大发布开源版NotebookLM DeepTutor Razer推出全息AI老婆Project AVA 波士顿动力推出下一代Atlas #抖音知识年终大赏 #前沿科技趋势发布月 #AI新星计划 #AI #机器人

47. #豆包大模型2.0发布##HOW I AI##过个有AI年#字节跳动春节AI攻势又起。今天,字节跳动正式发布豆包大模型2.0系列,在多方面取得突破,全面挑战国际顶尖水平。豆包大模型2.0定位为旗舰级通用模型,专注复杂推理与长任务链执行,比如科研分析、跨模态创作。豆包大模型2.0分为Lite、Mini、code、Pro四个版本。其中Pro版本全面对标OpenAI的GPT5.2,数学竞赛成绩达到人类金牌水平。另外,多模态理解达SOTA水平,视觉推理与编程能力超越Gemini 3 Pro,HLE-text测试全球最高分54.2。另外三个版本也各有特色。Lite版均衡性能与成本,企业级任务处理效率提升,成本低于前代1.8。Mini版低延迟响应,支持256K上下文,适配轻量级应用(如移动端)。Code版深度优化编程场景,无缝接入TRAE等开发工具。#老张聊科技#

48. 持续投入研发是产品力最有力的证明。过去一年,小米智驾已实现两次端到端大版本迭代——说到底,智能驾驶本身就是一场AI的长期战役,既需要人才与资金的持续加码,也需要技术与数据的不断沉淀。2025年,小米在AI领域投入已超70亿元,组建起超过1800人的精英研发团队。从战略布局到技术落地,小米正一步步将承诺转化为现实。这一切努力的本质,是让AI学会像人一样思考、推理与预判。正如驾驶本身是一个不断熟悉、不断积累的过程:驾驶经验越丰富,越能预判路况。AI也是如此。随着小米汽车用户规模持续扩大,数据越来越丰富,感知模型越来越精准,整个辅助驾驶系统也正朝着更成熟、更智能的方向不断进化。从1000万Clips大模型版本开始,小米的智能驾驶体验已迈上新台阶。我们相信,随着小米在技术与数据上的持续投入,未来的智驾表现,必将更加值得期待。#AI为小米汽车带来出行新体验#央视财经的微博视频

49. #阿里新一代模型Qwen3.5曝光# AI圈春节前再放大招,阿里通义千Qwen3.5即将登场,已HuggingFace提交PR并入Transformers,发布在即。全新混合注意力机制加持,长文本与推理效率全面升级;更支持原生VLM多模态视觉理解,看图理解能力一步到位。开源阵容同样亮眼:2B密集小模型+35B-A3B MoE大模型双路线覆盖,轻量部署与旗舰性能兼顾。从技术架构到生态布局持续领跑,国产开源大模型再迎重磅升级,期待正式上线!

50. 除夕夜,国产顶流压轴上线,QWEN3.5多模态开源!

51. 小米披露最新业绩!汽车业务首破千亿,实现盈利!

52. OPPO在MWC 2026上获重要奖项!3月3日,OPPO在MWC 2026上斩获GTI“移动AI应用奖”,该奖项是全球通信行业的重要奖项,这意味着以OPPO为代表的国产智能通信技术获得国际行业的高度认可。3月4日,在MWC 2026举行的联发科技发布会上,OPPO 与联发科技联合研发的技术预研成果——端侧全模态 Omni 模型正式亮相。作为业界首个在手机端侧实现多模态融合理解与交互的 AI 模型,Omni使手机端侧 AI 能够深入感知并理解周遭物理世界,为未来更主动、更自然的人机交互形态,奠定了坚实的技术基础。

53. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

54. 盘点一周AI大事(3月22日)|OpenAI红色警报 字节开源AI超级员工DeerFlow 2.0 英伟达开源Agent安全补丁NemoClaw Okara发布AI CMO Junior开源能雇佣的AI员工Junior 清华开源Agent课堂OpenMAIC MiniMax发布最强开源大模型M2.7 Miro开源最强深度研究模型Miro Thinker H1 Unsloth开源AI训练工具Unsloth Studio Google升级AI Studio和Stitch 阿里开源最强影视配音模型Fun-CineForge Google开源最强视频超分模型Spark VSSR 研究员开源最强数字人模型ID-LoRA 研究员开源首个城市级别的世界模型Seoul World Model #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #OpenAI

55. #雷军公布小米机器人最新进展##小米发布机器人基座模型#就在刚刚,我米技术对外发布开源VLA模型Xiaomi-Robotics-0,该模型有47亿参数,兼具视觉语言理解与高性能实时执行能力,刷新多项SOTA。采用MoT架构,大脑VLM理解人类指令、捕捉空间关系,小脑Action Expert生成平滑动作,训练上采用两阶段法,先跨模态预训练,再后训练,解决真机动作断层等问题。在测试中,在仿真测试和现实真机任务中表现优异,保持了VLM多模态理解能力,将模型开源,有望推动机器人在工业、服务业、家庭等场景的应用,加速具身智能落地,相信很快就会运用在更多的生态产品上。 而Xiaomi-Robotics-0机器人基座模型,Benchmark全面超越OpenVLA和Pi,跻身行业第一梯队,结合近期Mimo等成果,我米AI成长迅猛,且开源VLA与触觉模型,构建完整手脑技术栈,务实推进,为机器人商用铺路。

56. DeepSeek发布多模态论文又连夜删除

57. 百度上线文心5.0,模型参数2.4万亿,采用原生全模态统一建模技术,具备全模态理解与生成能力,支持文本、图像、音频、视频等多种信息的输入与输出。这是老罗数字人的表现。文心5.0以1460分位列LMArena文本榜国内第一、全球第八,超过GPT-5.1-High、Gemini-2.5-Pro等多款国内外主流模型。 兔撕鸡大老爷的微博视频

58. 华为乾崑技术大会省流版:♦️华为乾崑智驾ADS 5-采用WEWA 2.0架构,继续往“面向自动驾驶的AI智能体”方向走-云端世界模型引入Multi-Agent多智能体博弈机制,训练强度提升10倍-车端世界行为模型引入安全风险场理论,通过风险热力图做实时决策-面向自动驾驶的乾崑OS,可降低车内信号30%时延-车位到车位 3.0 升级,可支持更多非标场景下激活 NCA-驾驶员失能辅助功能升级,可将车辆送到高速服务区、收费站等就近安全区域♦️鸿蒙座舱 HarmonySpace 6-AMS舱内AI多模态感知系统发布,由摄像头、红外摄像头和高精度星闪传感器组成,可做动作感知、乘员监测,以及事故后的生命体征感知-小艺智能体升级,基于MoLA 2.0架构和千亿级参数多模态大模型,提升理解、决策和执行能力-开放智能座舱AI Agent生态,小艺会往全场景聊天型AI助理方向走,覆盖出行、导航、娱乐、点餐等需求-双17.2英寸3.4K蝶羽双联屏,搭载华为云晰柔光技术-HUAWEI SOUND增加AI调音魔方-XPIXEL百万像素智能大灯首次支持全彩投影,可在雨雾天气中调节色温-XSCENE LCoS车载激光投影发布,可实现后投露天影院模式

59. 小米智驾“史诗级”增强 HAD增强版表现如何

60. 预测真实世界下一秒 北京智源研究院推出全新的多模态世界模型:Emu3.5很多传统图像生成模型的主要问题是:它们“不懂世界”运行的规律,无法理解真实世界的物理规则和因果关系。Emu3.5在传统图像生成的基础上,进一步让AI具备:理解真实世界的空间关系推理物体随时间变化的规律预测“世界下一秒”会是什么样不同于以往为图像、文字、视频分开设计模型,Emu3.5 将它们全部“统一”在一个系统中:首先把多模态信息包括图文视频都统一成了token;模型通过“预测下一个 token”来学习不同模态间的关系;任务统一为 NSP:预测下一个世界状态(包括视觉和语言)。Emu3.5 不再只关注“文本之间的逻辑”,而是让模型学习“世界是如何变化的”。意思就是它不再区分:这是一张图这是一句话这是视频的一帧在它眼里,它们都是同一套“世界积木”。然后模型只做一件事:预测下一块积木是什么如果下一块积木是一行字 → 它补全文字如果是下一帧画面 → 它补全动作如果是下一步结果 → 它推演世界变化所以:预测下一 Token = 预测“世界下一秒”会是什么样Emu3.5的训练数据包含 约 790 年长的视频时长。视频是现实最接近的数字化记录:同时携带时间、空间、物理与意图信息。训练视频包含:时间(Time)空间(Space)物理(Physics)因果(Causality)意图(Intent)也就是世界的五个本质元素。学习真实的世界经验详细介绍和评测:网页链接模型官网: 网页链接在线体验: 网页链接论文:网页链接 互联网的那点事的微博视频

61. Lance 把图像与视频的理解、生成和编辑全部融合进一个 3B 活跃参数的原生统一多模态模型,真正做到「一套框架」搞定。不仅支持高质量文生图、文生视频,还能进行图像/视频编辑与多模态理解,性能直逼更大模型。GitHub:github.com/bytedance/Lance Hugging Face:huggingface.co/bytedance-research/Lance主要功能:- 3B 活跃参数,原生统一框架,支持图像/视频理解、生成、编辑- 文生图、文生视频、图像编辑、视频编辑一键完成- 多轮一致性编辑与智能视频生成,效果出色- 支持图像/视频问答、详细描述等理解任务- 提供 Gradio Demo 与完整推理脚本,开箱即用支持本地运行(需 ≥40GB VRAM),同时已有 MLX 社区移植版本可在 Apple Silicon 上运行。

62. 联发科的汽车业务,天玑 AIDV 智能体座舱在全模态交互,主动式服务,并发任务执行,端云协同等方面都给出了自己的解决方案过去是软件定义,现在是 AI 定义其实我觉得主要改变的点是需要软件主动提供交互,而不需要用户来主动提需求了#MDDC2026##天玑开发者大会#

63. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生

64. 盘点一周AI大事(4月26日)|OpenAI王炸两连 OpenAI上线下一代大模型「GPT-5.5」 OpenAI全量上线下一代图像模型「GPT-Image-2」 Kimi发布最强开源大模型「Kimi K2.6」 DeepSeek发布了「DeepSeek V4」 Office三件套(Word PPT Excel)全量上线Copilot智能体 Google发布最强深度研究「Deep Research Max」 研究员开源AI研究员「ASI-Evolve」 Google发布最强图像分割模型「Google Vision Banana」 LTX开源视频转HDR「LTX HDR LoRA」 ODYSSEY发布最强世界模型「Odyssey-2 Max」 字节开源最强3D模型「Seed3D 2.0」 工程师研发出最强乒乓球机器人 #前沿科技趋势发布月 #AI新星计划 #AIGC #AI #OpenAI

65. 差点被订阅搞崩溃,全量开放的TRAE SOLO模式帮我手搓了个管理神器#AI编程 #科技改变生活 #玩儿个很新的东西 #TRAE #AI新星计划

66. 盘点一周AI大事(1月4日)|Google包揽年度最佳模型 LMArena大模型盲选排行榜公布年度冠军 Google推出AI辅助学习系统Learn Your Way 阿里开源最强手机智能体MAI-UI DeepSeek发布新研究mHC IQuest发布最强开源编码模型IQuest-Coder-V1 字节发布动态概念大模型DLCM 腾讯发布最强开源翻译模型HY-MT1.5 阿里更新最强开源图像模型Qwen-Image-2512 Meta开源极速视频生成模型HiStream 研究员开源对象植入模型InsertAnywhere 研究员开源MV智能体AutoMV 腾讯开源3D动作生成模型Hunyuan Motion 1.0 研究员开源高保真3D模型UltraShape 研究员开源世界模型Yume 1.5 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #AIGC

67. 千问23天月活突破3000万碾压欧美,中国AI时代开启! 就在刚刚,确认数据!千问23天月活突破3000万,首周下载量1000万碾压欧美,阿里AI从“技术储备”向“价值落地”加速演进 #AI #阿里 #千问

68. Qwen3.6-Plus 太猛了!免费 + 百万上下文 + Agent + 视觉多模态AI能力拉满! 零度解说

69. 特斯拉宣布监督版FSD登陆中国,意味着什么?你看好它的市场前景吗?

70. 三星研究院公布了端侧AI的进展:他们把一个 300 亿参数的大模型压到 3GB 内,让它能直接在手机、电视等设备上跑,不用云也能发挥大模型级的智能。简单理解,就是把“服务器级 AI”做成了“本地小型化 AI”。这意味着速度更快、隐私更强,未来 Galaxy 的很多 AI 功能都会更依赖本地算力,而不是云端。

71. DeepSeek以低成本高性能挑战全球,字节则以多模态与应用场景取胜。小米的MiMo,则以端侧AI的精准定位切入消费电子的蓝海。每一个AI大模型皆如操盘手的精心布局,针对不同赛道,谋求最大回报,国内AI的发展是真强!#小米发布最新MiMo大模型#

72. 卢伟冰:AI物理世界应用方面,小米公司认为深度融合将成为下一阶段重点方向。小米拥有超过10亿级硬件接入节点,为AI落地提供独特优势。2026年3月,公司推出手机端AI Agent“小米米家智能助手”,并成为首家尝试在手机端部署复杂多模态Agent的OEM厂商,推动AI在终端与生态中的深度融合。

73. DeepSeek V4首发华为昇腾,黄仁勋最担心的事成真/小米YU7 GT定档五月底/谷歌拟向Anthropic投资最高400亿美元

74. #特斯拉监督版FSD入华# 看来马斯克这趟没白来啊,FSD监督版最新可用地区包含了中国,上次试了一下,水平还是不错的那什么是FSD Supervised(监督版)?⬇️1. 车辆可自主完成城市道路全程驾驶、转弯、变道等复杂操作2. 强制要求驾驶员全程手握方向盘、紧盯路况、随时接管

75. 阿里云发布多模态交互开发套件

76. 轮到马斯克破防,没有车企愿用FSD,“他们不想要!”

77. 盘点一周AI大事(11月23日)|AI自己画CAD图纸 Google发布最强大模型Gemini 3、最强图像模型Nano Banana Pro OpenAI发布最强编码模型GPT-5.1-Codex-Max 马斯克升级Grok 4.1,情商最强 字节开源最强空间重建模型Depth Anything 3 腾讯发布最强开源视频模型HunyuanVideo-1.5 Meta开源最强对象分割模型SAM 3,最强3D分割模型 SAM 3D Autodesk研发出最强CAD智能体VideoCAD AI2发布最强开源深度研究智能体Deep Research Tulu Google发布最强AI天气预报WeatherNext 2 Maxima推出AI会计智能体 头号玩家套装问世 #AI新星计划 #人工智能 #AIGC #OpenAI #大模型

78. 盘点一周AI大事(1月25日)|Agent进化,24小时打工 开源视频制作Remotion Skills爆火 AI编程开无限画布插件Pencil 爆火 开源个人AI助手Clawdbot爆火,7成24小时给你打工 Claude Excel插件更新 Runway上线最强视频模型Gen 4.5 字节开源视频参考模型OminiTransfer 字节发布最强数字人直播模型FlowACT R1 阿里开源最强文本转语音模型Qwen 3 TTS #AI新星计划 #抖音知识年终大赏 #AI #OpenAI #AIGC

79. 【硬核教程】教你搭建Mac AI集群!4台M3 Ultra,运行万亿参数大模型!

80. 「Github一周热点95期」META 3D 模型、智能体记忆引擎、向量数据库、 Web 3D 引擎、AirPods 跨平台、数据库管理工具

81. 小米YU7/Model Y等6款30万SUV声音表现横评,谁是黑马谁拉胯?#懂车声学院#小米#特斯拉#理想#SUV

82. 盘点一周AI大事(12月28日)|最强开源大模型易主 智谱发布最强开源大模型GLM 4.7 MiniMax发布最强开源编码模型MiniMax M2.1 阿里开源超长上下文模型QwenLong-L1.5 字节发布最强数学模型Seed-Prover 1.5 英伟达开源游戏智能体Nitrogen 阿里开源语音对话模型Fun-Audio-Chat 字节开源短剧视频模型StoryMem 字节开源关键帧视频模型DreaMontage 奥特曼认为通用人工智能已成为过去式,并提出超级人工智能定义 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #OpenAI #大模型

83. GLM-OCR 智谱开源的轻量级多模态OCR模型

84. 文档解析多模态"小"模型横评

85. 在线教程丨MiniCPM-V-4.6,1.3B端侧模型支持视频理解/多模态对话

86. 解锁边缘智能

87. 大模型应用

88. GLM-OCR

89. 中移九天全新推出轻量级多模态大模型,让智能看见更多可能!

90. 面壁智能发布 MiniCPM-V 4.6 开源模型

91. 128张A100从零训出!字节开源3B全能多模态模型Lance

92. qwen-2.0 轻量多模态更灵活,DMXAPI 平台更划算,比官方定价更低

93. 仅2600万参数!本地可跑的轻量AI模型Needle来了

94. 手机上跑AI多模态模型

95. GitHub 7.6k Star, MiniMind-v满血版! 大道至简,轻量多模态新标杆.

96. 在线教程丨MiniCPM-V-4.6,1.3B端侧模型支持图像理解/视频理解/OCR/多轮多模态对话 - 哔哩哔哩

97. AI模型小型化革命

98. 【更新中】多模态大模型 前沿算法与实战应用

99. 微软Phi-4-Vision-15B开源

100. AI的下一场革命

101. Edge Gallery现已支持Gemma4-E2B和E4B新模

102. RAG: 多模态 与 LLM+工具链

103. AI算法面试题

104. AI核心知识十——多模态大模型

105. 2025多模态大模型

106. 开源多模态模型大纲

107. 多模态大模型、AI 智能体在风控的进阶应用

108. 每天一个AI小知识

109. 字节又开源一个新模型?3B 参数就能统一理解+生成+编辑,Lance 是在重新定义多模态的效率边界吗?

110. Lance

111. 字节跳动推出Lance

112. 究极"拼好模"出现了! 字节跳动 Lance!

113. EdgeAI--基于LiteRT-LM在Android上跑多模态gemma-4

114. RunAnywhere

115. 深度解析 Qwen3.6 Flash(Qwen3.6-35B-A3B)

116. 【AI硬核】3B小模型挑战多模态极限!Qwen2.5-Omni-3B本地部署与实战揭秘!

117. 3B参数吊打老牌大厂?打工人别再手动敲Excel了,这个开源模型一夜之间改了命

118. Qwen 3.6-35B-A3B 开源,3B激活参数比肩10倍规模模型

119. Qwen3.6-35B-A3B 开源发布

120. 国产开源大模型里程碑!Qwen3.6-35B-A3B 全球开源

121. 媲美Gemini 2.5 Pro!阶跃星辰STEP3-VL-10B技术报告

122. 阶跃星辰开源10B多模态模型Step3-VL-10B,性能媲美千亿级大模型

123. 刚刚,DeepSeek全新多模态技术开源!

124. 面壁智能正式发布并开源新一代端侧多模态大模型MiniCPM-V4

125. 美团发布开源原生多模态大模型LongCat-Next

126. 多模态Qwen3-VL-Embedding悄悄开源&技术剖析

127. OpenBMB开源MiniCPM-V-4.6,可圈可点

128. 从视觉到触觉

129. FAIR plus展会收官|原生多模态具身智能技术×多模态空间智能感知全新登场

130. 技术专栏 | 具身智能中的多模态感知融合

131. AI机器视觉-精准感知物理世界

132. 江西五十铃申请ChatGPT,给智能驾驶装上“多模态大脑”

133. 多模态感知

134. 基于Qwen3-VL的自动驾驶场景实测

135. 多模态大模型与自动驾驶实战课程核心融合技术网盘 - 哔哩哔哩

136. 多模态大模型与自动驾驶实战资料学习 - 哔哩哔哩

137. 成果|MiniCPM-V 4.6 正式开源

138. 1.3B参数跑多模态,MiniCPM-V 4.6端侧部署实战

139. 东吴证券

140. 市场观察|多模态×车路云一体化

141. 轻量开源!微软基础模型LLaVA-Rad

142. 多模态小模型(Multimodal Small Models)

143. 多模态预训练或者多模态生成有比较轻量级的模型吗?

144. 2024年多模态大模型(MLLMs)轻量化方法研究现状和展望报告-中移智

145. Fast and Effective!一文速览轻量化Transformer各领域研究进展

146. 互联网行业AIGC行业趋势:强调应用落地,多模态是大势所趋

147. 端侧多模态模型

148. 多模态新旗舰MiniCPM-V 4.5:8B 性能超越 72B,高刷视频理解又准又快

149. 全球第一款端侧全模态理解模型开源!

150. 多模态大模型学杂了能力反下降?新研究:MoE+通用专家解决冲突

151. 你的手机正在"进化":多模态AI如何让端侧智能迎来爆发

152. Meta发布轻量模型Muse Spark:闭源重启AI布局,算力效率提升超10倍

153. Awesome MM|多模态模型演进的全景图谱

154. 端侧 AI Infra 落后云端 3 年:Orin 上缺的不是编译器,是一个 batch=1 的多 model set 的 vLLM

155. 端侧智能体应用方案及微调实操

156. 全能多模态大模型Omni:全新上下文展开机制,单模型统一图文视频3D推理生成 【多模态大模型论文解读】

157. 多模态AI爆发元年:跨模态理解与生成正在重塑一切

158. 每日学术导读 | Nature · 基于下一词元预测的大型多模态模型多模态学习方法

159. Mobile-O:轻量级生成和理解多模态大模型

160. 阿里开源Qwen3.6-35B-A3B模型:主打高效轻量,支持多模态思考

161. 1B 小模型彻底逆天了!MiniCPM-V 4.6 实测:看视频、做 OCR、多模态理解,居然已经接近 GPT-4o?

162. 04月11日全球AI 24小时热点日报|多模态突破,端侧智能加速落地

163. 3B参数实现物理智能涌现:飞捷科思智能科技发布首个全模态物理AI基础模型OmniFysics

164. 🧠 Omni:3B参数的多模态"思考者"

165. 双料齐发!明略科技正式开源 Cider 端侧推理加速框架与 Mano-P 端侧模型

166. 月之暗面K2.5模型发布并开源,具备多模态及Agent集群能力

167. NPU如何驱动下一代多模态交互座舱?

168. 刚刚开源!商汤「原生统一」多模态模型SenseNova U1,一个模型搞定看图、思考、画图!不仅强还很快,图文连续创作亮了

169. AI算法面试:什么是多模态大模型

170. MMEvol:通过进化式指令数据增强多模态大语言模型

171. 雷军小米汽车藏着一枚“技术王牌”,让AI会开车聊天

172. 可灵O1横空出世!全球首个统一多模态视频模型,让P视频比P图还简单

173. 图文视频反复调,画风难统一?生图生视频一体AI工具推荐帮你解决

174. 国产多模态AI再开源,实测截图转网页、搜图购物,价格减半

175. 全模态大模型迈入理解生成一体化新时代

176. 每日GitHub精选:Xinference —— 一键部署多模态大模型的利器

177. 0.8B的模型真的支持多模态吗?

178. MiniCPM-o - 端侧多模态大模型的突破

179. InternVL-U:生成和理解一体的多模态大模型

180. 谁能想到!开源多模态AI已经卷到这种程度了

181. 统一多模态模型理解能力能否指导视觉生成?

182. 快手发布可灵O1模型,实现图文视频多模态输入,持续利好AI内容产出,附快手观点更新

183. 加装“眼睛”:多智能体协作实现低成本多模态

184. Meta 放出“多模态推理王牌”:Muse Spark 正式登场

185. AI算法面试:多模态大模型的发展过程

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章