小团队如何推动多模态技术普惠?
05-12 20:37
精选参考来源
抖音 2025-11-19
抖音 2025-12-30
来源
精选参考来源
1. 开源是战略,生态是王炸,阿里千问入局AItoC #千问 #大模型
抖音 2025-11-19 00:00:00
2. 抖音前沿科技30X30|采访AI超级个体 Gemini 3发布后,这5个开发者给自己的人生装上了外挂。 27年程序员老兵:用AI写出多部长篇小说,一边敲代码一边圆武侠梦 ; 硬核奶爸:手搓本地AI操作系统,把私教装进孩子口袋; AI安全研究员:把AI变成科研副驾,打破思维墙; 有效加速主义者:打造AI全自动分身,让AI替自己看新闻处理琐事; 全栈讲师:降低新手学习门槛,把技术文档自动变成PPT; 本期视频,产品君连线5位GDE谷歌开发者专家,带你拆解AI时代的超级个体,听听他们给普通人的真诚建议。 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #Google
抖音 2025-12-30 00:00:00
3. DeepSeek发布多模态论文又连夜删除
微信公众号 2026-05-01 00:00:00
4. 商汤科技正式发布并开源了与南洋理工大学 S-Lab合作研发的全新多模态模型架构 —— NEO,为日日新 SenseNova 多模态模型奠定了新一代架构的基石。作为行业首个可用的、实现深层次融合的原生多模态架构(Native VLM),NEO 从底层原理出发,打破了传统“模块化”范式的桎梏,以“专为多模态而生”的创新设计,通过核心架构层面的多模态深层融合,实现了性能、效率和通用性的整体突破,重新定义了多模态模型的效能边界,标志着人工智能多模态技术正式迈入“原生架构”的新时代。发布了头条文章:《商汤发布 NEO 架构,重新定义多模态模型效能边界》 #大模型 # 商汤科技##ai# 商汤发布 NEO 架构,重新定义多模态模型效能边界
新浪微博 2025-12-02 00:00:00
5. #英伟达开源辅助驾驶模型和数据集##2026ces# 今年的CES展上,英伟达CEO黄仁勋照例发表了演讲,除了发布升级的Rubin芯片架构外,还发布了Alpamayo平台,并宣布开源AIpamayo 1模型。简单聊一下AIpamayo 1模型的核心特点:1、这不是简单的模型,而是一整套完整的生态。AIpamayo 1模型是英伟达首个推理VLA模型,具备开源模型+仿真框架+大规模数据集的完整开源生态,任何汽车开发者或研究团队都可以使用,能大大降低研发门槛、缩短研发周期、缓解各企业数据孤岛的行业传统痛点,加速算法迭代。2、模型规模和数据规模相当大。AIpamayo1模型参数规模达到100亿级,能够满足多模态融合与复杂场景推理的需求;配套的开放数据集包含超过1700小时的驾驶数据,覆盖25个国家、2500 +城市及罕见复杂场景,存储容量约100TB,为高质量模型训练提供了极为稀缺的底层燃料。那这件事有何意义?AIpamayo1模型是业界首个开源推理型 VLA 模型,绝对是是自动驾驶发展史上的里程碑事件,有望开启“物理AI的ChatGPT时刻”。对整个自动驾驶行业而言,它重构了研发范式,能够推动技术发展;对英伟达来说,通过生态主导权也能巩固其AI基础设施地位,同时为全行业提供技术赋能,推动自动驾驶技术加速普及与商业化落地。#汽场全开##大V聊车#
新浪微博 2026-01-06 00:00:00
6. 原生理解生成统一:商汤开源SenseNova U1,用统一架构终结「缝合怪」多模态
微信公众号 2026-04-28 00:00:00
7. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与
微信公众号 2026-03-08 00:00:00
8. 除夕夜,国产顶流压轴上线,QWEN3.5多模态开源!
微信公众号 2026-02-16 00:00:00
9. 商汤SenseNova U1:原生多模态统一模型的范式革命
知乎 2026-05-05 00:00:00
10. 【AI前沿】AI前沿动态:GLM-4.6V开源、AutoGLM 2.0与RealGen,设计师与开发者的新工具
微信公众号 2025-12-09 00:00:00
11. #横扫硅谷的千问杀回国内#横扫海外榜单的Qwen大模型第一入口来了,一经发布直接终结了比赛,国内人人都可以通过下载千问APP直接使用!不难发现,阿里这盘棋早在3年前就开始下了,如今Qwen大模型早已成为全球排名第一,在AI大模型实时投资比赛“Alpha Arena”中,Qwen同样凭借出色的策略和实操夺得第一,金融投资和风险控制能力遥遥领先!Qwen3-VL在 OpenRouter 图像处理榜单上以 48% 的市场份额跃升至全球第一,Qwen3-Coder 登顶开源LLM榜首!而搭载Qwen顶级模型的千问app,强悍的性能无需多言。就比如我问它“iphone17和 pro 以及promax 有多大区别”,它马上就能给我生成一份详细的报告,里面的内容非常贴近我的实际需求,可以说是一个非常可靠的生产力工具,每个人都值得拥有!
新浪微博 2025-11-17 00:00:00
12. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月
抖音 2025-12-21 00:00:00
13. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何
哔哩哔哩 2026-02-19 00:00:00
14. 【#英伟达开源辅助驾驶模型和数据集#】#2026ces# 当地时间1月5日,NVIDIA发布 NVIDIA Alpamayo系列开源AI模型、仿真工具和数据集,旨在推动安全的推理型辅助驾驶汽车开发在2026年国际消费电子展(CES)上,英伟达发布了NVIDIA Alpamayo系列开源AI模型、仿真工具和数据集,旨在加速下一代安全、基于推理的自动驾驶汽车开发 。相关介绍如下 : - Alpamayo 1模型:这是首个面向自动驾驶的开源大规模推理VLA(视觉语言动作)模型,它不仅能让车辆理解周围环境,还能解释其驾驶决策,有助于提升智能汽车的信任度和安全性。 - AlpaSim仿真框架:配合Alpamayo 1模型,开发者可利用该框架进行闭环训练,以应对边缘场景,能够在不同交通场景、天气条件和极端情况下进行测试,大大减少现实世界测试时间,加速验证过程。 - 物理AI数据集:英伟达开源了包含1700多小时驾驶数据的物理AI数据集,覆盖了极其广泛的地理环境与复杂路况,为高阶自动驾驶研发提供了关键数据支持。 Lucid、捷豹路虎、Uber和Berkeley DeepDrive等车企都对Alpamayo表现出兴趣,希望开发基于推理的自动驾驶堆栈,以实现L4级自动驾驶 。
新浪微博 2026-01-06 00:00:00
15. 正面硬刚Gemini 3 Pro,阿里开源Qwen3.5-Plus|甲子光年
微信公众号 2026-02-16 00:00:00
16. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?
知乎 2026-04-30 00:00:00
17. 阿里新一代模型曝光 黄心怡 财联社 据《科创板日报》,在全球最大AI开源社区HuggingFace的开源项目页面中,最新出现Qwen3.5并入Transformers的新PR(提交代码合并申请)。这意味着阿里千问新一代基座模型Qwen3.5或发布在即。相关信息透露,千问3.5采用了全新的混合注意力机制,并且极有可能是原生可实现视觉理解的VLM类模型。有开发者进一步挖掘出,Qwen3.5或将开源至少2B的密集模型和35B-A3B的MoE模型。这一最新动态印证了此前有消息称Qwen3.5将在春节期间开源。
新浪微博 2026-02-09 00:00:00
18. ICLR'26开源 | 1000+FPS!Mobile-GS:3D高斯泼溅轻量化新范式,首次在移动设备部署!
知乎 2026-05-07 00:00:00
19. 「Github一周热点112期」DeepSeek V4王者归来,一个项目玩转GPT-Image-2
哔哩哔哩 2026-04-25 00:00:00
20. 英伟达很快会反超谷歌TPU,AI模型的竞争格局会在2026年1季度变天#英伟达 #马斯克 #算力 #Gemini3#TPU #GPU #AI模型#算力集群
抖音 2025-12-22 00:00:00
21. 目前最强OpenClaw安装分享!对接飞书!普通人最该体验的AI Agent项目
哔哩哔哩 2026-02-28 00:00:00
22. 不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?
微信公众号 2026-01-13 00:00:00
23. Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了
微信公众号 2025-12-15 00:00:00
24. 26年1月开源模型汇总,太卷了,这几个已经追平闭源了!
知乎 2026-01-31 00:00:00
25. 开发者在做模型轻量化部署时,常因量化、剪枝、推理加速的工具链割裂,导致流程繁琐,且不同优化方案的效果难以直观对比,影响部署效率。 针对这一需求,torchdistill是一款专注模型蒸馏与轻量化的工具库,适配开发者对深度学习模型进行压缩优化的场景。开源地址:github.com/yoshitomo-matsubara/torchdistill 核心功能: 1. 集成蒸馏、剪枝、量化等多种轻量化算法,支持一站式模型压缩流程;2. 提供统一的评估指标,可直观对比不同优化方案的精度与速度 trade-off;3. 兼容主流CV/NLP模型,无需大幅修改原有训练代码即可接入;4. 支持自定义蒸馏策略与损失函数,满足特定场景的优化需求;5. 轻量化设计,依赖简洁,可在普通算力设备上完成实验验证。
新浪微博 2025-12-22 00:00:00
26. ICML'26 | 复旦新作OneTrackerV2:多模态视觉跟踪大一统!
知乎 2026-05-11 00:00:00
27. 【#曝DeepSeekV4或下周发布#】2月28日消息,金融时报(FT)今天(2月28日)发布博文,报道称深度求索(DeepSeek)将于下周发布全新多模态大语言模型V4,原生支持图片、视频与文本生成功能。这是DeepSeek自2025年1月推出R1推理模型以来的首个重大版本更新,有望进一步填补国内低成本、开源模型的市场需求。(IT之家) 知氪科技的微博视频
新浪微博 2026-02-28 00:00:00
28. 一个视频带你快速盘点2025年GitHub热点项目
哔哩哔哩 2025-12-28 00:00:00
29. 阿里云发布多模态交互开发套件
微信公众号 2026-01-09 00:00:00
30. DeepSeek V3.2来了,首个会"思考"的Agent模型,首个开源性能打平GPT-5的模型
微信公众号 2025-12-02 00:00:00
31. 11月开源模型汇总,是被闭源打自闭的一个月
知乎 2025-11-30 00:00:00
32. Nature | 统一的多模态学习模型
微信公众号 2026-03-02 00:00:00
33. #微博声浪计划##听见微博# 小米首个推理大模型商标“Xiaomi MiMo”通过初审,定位轻量化端侧大模型,70亿参数实现高性能推理,已开源。前DeepSeek研究员罗福莉加入领导研发,布局车载AI等多场景,面临商业化与团队规模等挑战。 科技晓鑫的微博音频
新浪微博 2025-11-13 00:00:00
34. #阿里顶配模型就用千问APP#你知道宝妈的每一秒都是怎么精打细算的吗,尤其是带我女儿出去玩的时候,她总会问我各种问题,像上次问我这是什么花,我直接用@千问 AI拍一下识图,几秒钟就能出答案,而且很准确,怪不得Qwen-VL模型能霸占各项榜单。包括一些育儿方面的问题,给出的回答也非常详细,上次问千问“冬季如何预防幼儿常见的传染病”,从预防到应对都讲得清清楚楚,比我之前在ds上得到的答案更详细精准。作为阿里最强最新Qwen大模型第一入口,确实很厉害,而且对于妈妈来说时间本来就很紧张,选对合适的AI真的能够帮我快速解决很多陪伴孩子时遇到的问题。
新浪微博 2025-11-17 00:00:00
35. 元戎不止智驾,全面探索物理AI全新赛道。北京车展重磅消息,元戎不但迎来前DeepSeek多模态技术核心大牛阮翀,展示基座模型在智能驾驶领域的最新成果。元戎还跳出单一智驾赛道,在后大模型时代全面布局以基座大模型为内核、多模态感知、舱驾一体驱动等物理AI场景,探索未来出行智能。4月25日北京车展,来一起见证元戎交出的答卷。
新浪微博 2026-04-23 00:00:00
36. 如何看待阿里开源的Qwen3-VL-Embedding 和 Qwen3-VL-Reranker 模型?
知乎 2026-01-09 00:00:00
37. FT:DeepSeek V4 下周发布,原生多模态。和华为、寒武纪联合优化,估计是优化了 V4 在对应平台上的推理性能。 现在多模态最强的还是 Gemini,Demis 的表述很有说服力: Gemini 从第一天起就是多模态的,这是有原因的。它是机器人所需要的…这些多模态模型能理解世界的物理学,再加上一点机器人微调,就能处理动作、电机控制以及机器人所需的规划…AGI 必须理解物理环境、周围的物理世界…为了让机器人工作…理解你的物理上下文。 期待 DeepSeek V4 的多模态性能!
新浪微博 2026-02-28 00:00:00
38. 刚刚,智谱开源GLM-4.6V系列模型啦~GLM-4.6V系列型号包括两个版本:GLM-4.6V (106B),一个为云端和高性能集群场景设计的基础模型,以及GLM-4.6V-Flash (9B),一个针对本地部署和低延迟应用优化的轻量化模型。GLM-4.6V在训练中将其上下文窗口扩展到128k个token,并在同类参数规模的模型中实现了视觉理解的最先进性能。最关键的是,我们首次集成了原生的函数调用功能。这有效地弥合了“视觉感知”和“可执行动作”之间的鸿沟,为现实世界商业场景中的多模态智能体提供了统一的技术基础。GLM-4.6V 引入了几个关键特性:🌟原生多模态功能调用:实现了原生的视觉驱动工具使用。图像、截图和文档页面可以直接作为工具输入,而无需文本转换,同时视觉输出(如图表、搜索图像、渲染页面)会被解释并融入推理链条中。这闭环了从感知到理解再到执行的过程。🌟交错图文内容生成:支持从复杂的多模态输入中创建高质量的混合媒体内容。GLM-4.6V 处理多模态上下文—涵盖文档、用户输入和工具检索的图像—并合成与任务相关的连贯交错图文内容。在生成过程中,它可以主动调用搜索和检索工具来收集和策划额外的文本和视觉素材,生成丰富、视觉化的内容。🌟多模态文档理解:GLM-4.6V 能处理最多128K个标记的多文档或长文档输入,直接将富格式页面作为图像进行解读。它可以共同理解文本、布局、图表、表格和图形,从而准确理解复杂、以图像为主的文档,而无需将其先转换为纯文本。🌟前端复刻与视觉编辑:从 UI 截图重建像素级准确的 HTML/CSS,并支持自然语言驱动的编辑。它通过视觉检测布局、组件和样式,生成干净的代码,并通过简单的用户指令应用迭代的视觉修改。#科技先锋官#
新浪微博 2025-12-08 00:00:00
39. #阿里除夕夜开源千问Qwen3.5# 继Qwen2.5-Max后,阿里再以“开源”打响AI开年第一枪 🧨该模型实现了模型架构的创新 。据悉,Qwen3.5采用全新的混合注意力机制,极有可能是原生支持视觉理解的视觉语言模型(VLM),将开源至少2B密集模型及35B-A3B的MoE模型 。去年除夕,阿里曾抛出Qwen2.5-Max。【评论】阿里选择除夕夜开源,是以“技术春晚”卡位AI竞争新周期继去年除夕夜开源Qwen2.5-Max后,阿里再次选择在这个阖家团圆的时刻“放猛料”,其战略意图愈发清晰:用最高规格的开源动作,抢占全球开发者春节档的技术注意力。Qwen3.5的原生多模态能力与架构创新,直指2026年AI竞争的核心——从“对话”向“视觉理解、智能体执行”的全面升级。当同行忙于发红包、抢用户时,阿里选择用开源模型“围猎”开发者心智,这是一场关于生态根基的暗战。
新浪微博 2026-02-16 00:00:00
40. SenseNova U1开源:8B参数原生统一多模态模型
知乎 2026-05-07 00:00:00
41. 火山引擎多模态数据湖如何释放模思智能的算法生产力
知乎 2026-03-11 00:00:00
42. 怎么看待新加坡政府宣布在东南亚语言大模型项目放弃Meta模型,采用阿里的通义千问(Qwen)开源架构?
知乎 2025-12-02 00:00:00
43. #国产AI超过ChatGPT了吗#阿里刚刚发布了基于强大的Qwen模型构建的Qwen App,作为全球排名第一的开源模型,Qwen 一直深受开发者和大型科技公司的喜爱,甚至连黄仁勋都称其为最好的开源人工智能之一,就连《金融时报》也报道了最近的Qwen恐慌。今天,Qwen App在中国正式上线,全球版本也正在筹备中。彭博社数据显示,Qwen的总下载量已正式超过Meta的Llama。越来越多的国家正在转向使用中国开源人工智能模型,其中Qwen处于领先地位#ai生活指南##ai创造营#
新浪微博 2025-11-17 00:00:00
44. 阿里系连发两个重磅AI产品,暗藏了一个巨大的机会#灵光 #蚂蚁灵光 #阿里巴巴 #全模态通用AI助手 #AI工具
抖音 2025-11-20 00:00:00
45. #阿里顶配模型就用千问APP#阿里基于最强大模型 Qwen 打造了个人AI助手@千问 App,大家都在说它的模型很先进,回答很聪明,我自己在咨询完健康领域相关问题后就立刻被种草了。我用图片识别功能查了一下手臂红点的症状和用药建议,千问能结合知识库分点分析,也没有出现模糊的表述,相比其他AI,千问思维链更完整,答案显然更专业,毕竟Qwen-VL在图像识别领域份额第一,视觉识别当然也是非常精准。现在有了千问,我们日常的健康管理都可以交给它来解决,这真的是做到了顶级AI走向大众!
新浪微博 2025-11-17 00:00:00
46. 盘点一周AI大事(12月7日)|GPT5.2下周发布 Gemini 3 Deep Think正式上线 OpenAI下周12月9日发布大蒜模型GPT5.2,下月发布大葱模型GPT5.5全面吊打Gemini 3 DeepSeek开源最强推理模型DeepSeek V3.2 Mistral开源Mistral 3家族 OpenAGI发布最强电脑操作模型Lux Runway发布最强视频模型Gen 4.5 阿里开源数字人直播模型Live Avatar 字节发布顶级图像模型Seedream 4.5 研究员推出3D空间音频模型ViSAudio 微软开源实时语音模型VibeVoice Harmonic推出亚里士多德智能体,6个小时解决了悬赏30年的数学问题 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #机器人
抖音 2025-12-07 00:00:00
47. 盘点一周AI大事(1月11日)|最强人形机器人 OpenAI公布2026研发路线图 DeepSeek被爆2月发布DeepSeek V4 Google推出Veo3驱动的数字人Vids 字节开源换脸视频模型DreamID-V 阿里开源数字人框架HRM2Avatar Lightricks开源顶级视频模型LTX-2 ElevenLabs推出最强语音转录模型Scribe v2 斯坦福开源睡眠分析模型SleepFM 港大发布开源版NotebookLM DeepTutor Razer推出全息AI老婆Project AVA 波士顿动力推出下一代Atlas #抖音知识年终大赏 #前沿科技趋势发布月 #AI新星计划 #AI #机器人
抖音 2026-01-11 00:00:00
48. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC
抖音 2025-12-14 00:00:00
49. 「Github一周热点94期」 开源AI渗透测试智能体、模块化智能镜子、开源AI Coding、多平台热点聚合、IPTV 频道集合和开源游戏合集
哔哩哔哩 2025-11-15 00:00:00
50. DeepSeek V4 前瞻:华为寒武纪接棒,拆解中国 AI 大模型告别英伟达后的生存战 | DeepSeek V4 | 华为昇腾 | 寒武纪 | 国产算力 |
哔哩哔哩 2026-04-07 00:00:00
51. 删掉 OpenClaw!Hermes Agent 才是真王炸,一键本地部署 +模型接入全教程(避坑指南) | 零度解说
哔哩哔哩 2026-04-11 00:00:00
52. Agent时代,为什么多模态数据湖是必选项?
微信公众号 2026-01-15 00:00:00
53. 又来了个OCR模型:混元OCR发布并开源github.com/Tencent-Hunyuan/HunyuanOCRHunyuanOCR是一款基于腾讯混元原生多模态架构的端到端OCR专家模型。仅以1B轻量化参数,便已斩获多项业界SOTA成绩。该模型精通复杂多语种文档解析,同时在文字检测识别、开放字段信息抽取、视频字幕识别、拍照翻译等全场景实用技能中表现出色。✨ 核心特点 💪 轻量化架构:基于混元原生多模态架构与训练策略,打造仅1B参数的OCR专项模型,大幅降低部署成本。 📑 全场景功能:单一模型覆盖文字检测和识别、复杂文档解析、卡证票据字段抽取、字幕提取等OCR经典任务,更支持端到端拍照翻译与文档问答。 🚀 极致易用:深度贯彻大模型"端到端"理念,单一指令、单次推理直达SOTA结果,较业界级联方案更高效便捷。 🌏 多语种支持:支持超过100种语言,在单语种和混合语言场景下均表现出色。#科技先锋官#
新浪微博 2025-11-25 00:00:00
54. 如何评价 DeepSeek 刚刚上线的多模态「识图模式」?
知乎 2026-04-29 00:00:00
55. B 站下一代多模态数据工程架构的落地实践
知乎 2026-03-09 00:00:00
56. 12 个主流小型AI模型对比评测 本地部署的选择是Qwen3-4B?
微信公众号 2026-03-24 00:00:00
57. DeepSeek开源IMO金牌模型,OpenAI和谷歌如何接招?
微信公众号 2025-12-04 00:00:00
58. 面向实战的多模态数据生成与表征技术创新
知乎 2026-01-07 00:00:00
59. 最强多模态大模型Gemini 3 Pro强在哪里?
知乎 2025-12-07 00:00:00
60. 小小的也很厉害?这个只有6B参数的开源图像模型把我看傻了
哔哩哔哩 2025-12-18 00:00:00
61. 权威评测平台SuperCLUE-VLM发布2025年12月多模态视觉语言模型综合榜单,谷歌 Gemini-3-Pro 以83.64分“断层式”领跑,看来多模态这块依然是谷歌的绝对统治区。但国产模型的追赶速度肉眼可见:商汤SenseNova拿下第二,字节豆包冲进前三,基础认知能力甚至不输国际巨头。特别值得一提的是阿里的 Qwen3-VL,作为首个总分破70的开源模型,绝对是国内开发者的福音。反倒是 GPT-5.2 这次表现平平,竟然没上70分。#AI#
新浪微博 2025-12-31 00:00:00
62. 爆火的 Z-Image 模型!8G 显存能跑,无内容审查、支持NFWS、超高速,本地部署教程!支持(Win/Mac)| 零度解说
哔哩哔哩 2025-12-08 00:00:00
63. 推特AI发展话题炸锅!2026年AI五大趋势:1️⃣ Agentic AI爆发 - AI自己就能干活,不需要人一直指挥2️⃣ 多模态模型崛起 - 能看能听能说全能型3️⃣ Edge AI普及 - 手机电脑就能跑大模型4️⃣ 开源模型爆发 - Llama、DeepSeek开源免费用5️⃣ 企业AI全面落地未来已来!你准备好了吗?
新浪微博 2026-04-11 00:00:00
64. 【#阿里千问登顶空间推理全球冠军#,超Gemini3、GPT5.1】今日,空间推理基准测试SpatialBench更新了最新一期榜单,阿里千问的视觉理解模型Qwen3-VL、Qwen2.5-VL位列头两名,超越Gemini 3、GPT-5.1、Claude Sonnet4.5等国际顶尖模型。SpatialBench榜单显示,Qwen3-VL-235B和Qwen2.5-VL-72B分别斩获13.5和12.9分,领先于Gemini 3.0 Pro Preview(9.6) 、GPT-5.1(7.5)、Claude Sonnet 4.5等海外顶尖模型。然而,AI大模型的整体表现距离人类仍有差距,人类基准线约为80分左右,可专业处理电路分析、CAD 工程和分子生物学等复杂空间推理任务,目前大模型还无法完全自动化完成此类工作。(快科技)
新浪微博 2025-11-26 00:00:00
65. 刚刚,DeepSeek全新多模态技术开源!
今日头条 2026-05-01 00:00:00
66. 炸场!DeepSeek突然开源多模态模型,效率拉满
今日头条 2026-05-01 00:00:00
67. 谷歌最强开源大模型Gemma 4,支持多模态、离线运行
今日头条 2026-04-08 00:00:00
68. 以前做多模态Agent要拼四个模型,NVIDIA用一个30B开源模型把搞定
今日头条 2026-04-30 00:00:00
69. 英伟达开源多模态模型!Agent效率狂飙9倍
今日头条 2026-04-30 00:00:00
70. Kimi K2.5开源多模态大模型有哪些亮点
今日头条 2026-01-28 00:00:00
71. Google 放大招!Gemma 4 全系列开源,any-to-any 多模态、MoE 架构全都有
微信公众号 2026-04-09 00:00:00
72. 暴涨 8.3k Stars!Hugging Face官方开源Skills,让Claude Code一句话完成70B模型GRPO训练
知乎 2026-03-09 00:00:00
73. 谷歌DeepMind重磅开源多模态TIPSv2
今日头条 2026-04-28 00:00:00
74. 谷歌开源王炸!Gemma 4端侧多模态大模型,2.3B参数吊打闭源,手机也能跑!
微信公众号 2026-04-05 00:00:00
75. 开源新王炸!10B多模态小模型屠榜,性能媲美20倍巨无霸
今日头条 2026-01-21 00:00:00
76. 智谱GLM-4.6V系列多模态AI大模型发布并开源,API降价50%
今日头条 2025-12-08 00:00:00
77. 开源破壁!智谱GLM-4.6V重构多模态格局,算力适配开启普惠时代
微信公众号 2025-12-09 00:00:00
78. 原生多模态大模型的开源里程碑
知乎 2026-05-08 00:00:00
79. 微软Phi-4-Vision-15B开源
今日头条 2026-03-06 00:00:00
80. 多模态数据集管理平台 开源! 多模态(如支持文本、图像的 LLM)高质量、标注准确的数据集管理平台,完全开源
微信公众号 2026-04-07 00:00:00
81. 2026 年开源大模型 TOP10 完整榜单
知乎 2026-02-24 00:00:00
82. 谷歌正式发布 Gemma 4
微信公众号 2026-04-07 00:00:00
83. 阿里通义千问开源 Qwen3.6-35B-A3B 模型 赋能智能体与多模态应用
今日头条 2026-04-17 00:00:00
84. 国产开源模型卷赢Gemini 3 Pro、GPT-5.2,最强多模态推理大模型易主?
今日头条 2026-01-30 00:00:00
85. 国产多模态AI再开源,实测截图转网页、搜图购物,价格减半
今日头条 2025-12-09 00:00:00
86. 8B 多模态提示词反推本地神器!Qwen3-VL 8B 对齐优化 Q8 量化版学习笔记
微信公众号 2026-04-09 00:00:00
87. MLX-VLM
微信公众号 2026-04-05 00:00:00
88. 日常复盘、AI 工具使用与本地多模态模型部署实践感悟
微信公众号 2026-05-09 00:00:00
89. 几张表看懂Qwen-VL系列进化史
微信公众号 2026-02-03 00:00:00
90. 开源多模态模型基准新高
哔哩哔哩 2025-12-14 00:00:00
91. Qwen3-VL-MoE架构深度解析
知乎 2026-02-27 00:00:00
92. Qwen3-VL-Embedding 与 Qwen3-VL-Reranker 开源!
微信公众号 2026-01-09 00:00:00
93. 从LayoutLM到文档Agent
微信公众号 2026-03-14 00:00:00
94. 消费级显卡可以快速上手跑!面壁智能MiniCPM-o 4.5发技术报告
百度 2026-04-30 00:00:00
95. MiniCPM-o - 端侧多模态大模型的突破
微信公众号 2026-03-31 00:00:00
96. Mac本地部署8B MiniCPM-V 4.5,碾压30B巨头,支持语音视频双向通话!一起探索AI普惠之路
哔哩哔哩 2026-02-08 00:00:00
97. 面壁智能
知乎 2026-02-06 00:00:00
98. 视觉原语革命!DeepSeek开源多模态模型,这些公司迎来红利
今日头条 2026-05-01 00:00:00
99. DeepSeek再放大招!多模态模型强势突破,多项性能超越海外GPT
今日头条 2026-05-01 00:00:00
100. DeepSeek多模态正式发布
今日头条 2026-05-01 00:00:00
101. 腾讯开源OpenSearch-VL
微信公众号 2026-05-08 00:00:00
102. 腾讯发布OpenSearch-VL
微信公众号 2026-05-08 00:00:00
103. DeepSeek内测识图模式,这是准备搞多模态吗?
微信公众号 2026-04-30 00:00:00
104. 从百度「Qianfan-VL·Domain-Enhanced」到「Native」,看多模态大模型的下半场
知乎 2025-12-25 00:00:00
105. 美团发布原生多模态模型LongCat-Next并全面开源
今日头条 2026-03-31 00:00:00
106. 商汤发布并开源U1系列 单一模型架构能否撬动多模态市场
今日头条 2026-04-29 00:00:00
107. 商汤发布轻量化多模态模型 Token消耗直降六成
今日头条 2026-05-09 00:00:00
108. 全面开源!商汤发布日日新SenseNova U1多模态统一模型,迈入理解生成统一时代
今日头条 2026-04-30 00:00:00
109. 多模态图像理解大模型通用方法论(从架构 / 训练 / 数据集到落地)
知乎 2026-03-03 00:00:00
110. OmniScience:大规模科学多模态数据集重磅上线
知乎 2026-04-21 00:00:00
111. 乐聚科研框架2.0
微信公众号 2026-04-02 00:00:00
112. 开源丨TTSPD: 一种融合轮胎数据的多模态交通场景感知数据集
微信公众号 2026-04-01 00:00:00
113. 微软开源Phi-4-reasoning-vision-15B,轻量化多模态推理的性价比天花板
微信公众号 2026-04-14 00:00:00
114. 商汤重磅上新!日日新多模态轻量化模型登场,调用额度限时免费 + 办公技能全开源
微信公众号 2026-05-08 00:00:00
115. Huggingface开源5T,超大多模态高质量视觉数据集
微信公众号 2025-12-17 00:00:00
116. 月之暗面K2.5模型发布并开源,具备多模态及Agent集群能力
今日头条 2026-01-27 00:00:00
117. Openclaw+LM Studio+Qwen3.5-397b-a17b 本地部署教程:免费用模型
今日头条 2026-02-28 00:00:00
118. Ollama × 魔搭社区:超简单的大模型本地部署方案
知乎 2025-11-13 00:00:00
119. GLM-4.6V开源:从看懂图片到自动完成任务
哔哩哔哩 2025-12-12 00:00:00
120. 2026年开源大语言模型选型指南
今日头条 2026-04-13 00:00:00
121. 开源多模态模型大纲
知乎 2026-03-13 00:00:00
122. 企业级OpenClaw最强拍档!万亿参数的国产多模态大模型开源发布
今日头条 2026-03-06 00:00:00
123. 每日GitHub精选:Xinference —— 一键部署多模态大模型的利器
今日头条 2025-11-28 00:00:00
124. Google DeepMind 发布 Gemma 4:新一代开源多模态 AI 模型
今日头条 2026-04-03 00:00:00
125. 幽冥大陆(六十) SmolVLM 图像识别 本地部署 轻量 AI 方案—东方仙盟筑基期
微信公众号 2025-12-23 00:00:00
126. (2023 Qwen-VL) Qwen-VL
知乎 2026-01-18 00:00:00
127. GitHub开源免费Qwen3-VL图像标注工具,ComfyUI节点+独立CLI
今日头条 2026-03-04 00:00:00
128. 国产多模态AI再开源!实测截图转网页、搜图购物,价格减半
今日头条 2025-12-09 00:00:00
129. 4月3日AI早报: HuggingFace-Speech-to-Speech 开源本地语音代理的新里程碑
微信公众号 2026-04-03 00:00:00
130. 别再用云API了!手把手教你把大模型“装进自己电脑”
微信公众号 2026-04-13 00:00:00
131. ICLR 2026 poster 多模态大模型相关论文整理四(内附源码)
微信公众号 2026-04-22 00:00:00
132. 如何评价MiniMax视频团队首次开源的VTP可扩展视觉Tokenizer预训练框架,有何优势?
知乎 2025-12-21 00:00:00
133. Qwen2.5-VL
知乎 2026-01-10 00:00:00
134. DeepSeek-V4 多模态技术架构
知乎 2026-05-10 00:00:00
135. 多模态Qwen3-VL-Embedding悄悄开源&技术剖析
今日头条 2026-01-17 00:00:00
136. KoboldCPP应用初探:告别繁琐配置,小白也能玩大模型——支持聊天模型、图像生成模型、语音模型等
知乎 2026-04-02 00:00:00
137. AI算法面试题:Qwen-VL训练流程
微信公众号 2026-02-01 00:00:00
138. 细粒度视觉感知的基石:Qwen-VL 初代架构剖析
知乎 2026-04-19 00:00:00
139. 【智能谷百大场景】①中津先进科技研究院「多模态认知智能驱动全链路教育数字化,重塑智慧教育新生态」
微信公众号 2026-05-09 00:00:00
140. Qwen-VL架构介绍
知乎 2026-02-23 00:00:00
141. 【多模态大模型】盘点part4: MiniCPM-V
知乎 2026-01-15 00:00:00
142. AI算法面试题:Qwen-VL原理
微信公众号 2026-02-01 00:00:00
143. 腾讯混元HunyuanImage-3.0微调框架开源
小红书 2025-12-05 00:00:00
144. DeepSeek多模态大模型炸场发布!国产AI王者的3大争议
今日头条 2026-05-02 00:00:00
145. spring-ai 第四多模态API
知乎 2026-04-06 00:00:00
146. 本地部署大模型方法,新手不二选择
今日头条 2026-02-26 00:00:00
147. 4.5B参数跑赢8B模型DeepSeek多模态拆解 多模态AI不只是让AI看图说话 三种架构路径: VLM流水线:能看图不能画图 Janus统一架构:看图+画图一个模型搞定 原生多模态:GPT-5/Gemini路线,最强但闭源 DeepSeek-VL2效率秘诀: 像素洗牌让视觉token从729降到196 MoE稀疏计算让4.5B跑赢8B 四大开源模型怎么选? 部署效率选DeepSeek-VL2,文档场景选Qwen2-VL #多模态AI #DeepSeek #VLM 互动话题:你觉得哪种架构路径最有前景?评论区投票
抖音 2026-04-30 00:00:00
148. HuggingFace Sentence Transformers v5.4:终于支持多模态了
知乎 2026-04-10 00:00:00
149. GLM-4.6V:基于原生工具调用的开源多模态模型的测试体验
哔哩哔哩 2025-12-12 00:00:00
150. Gemma4多模态大模型 | 谷歌最新开源的多模态大模型体验 | Google开源的多模态大模型 | Gemma-4-31B大模型体验 | 最强多模态大模型之一
哔哩哔哩 2026-04-08 00:00:00
151. DeepSeek开眼了,更新多模态,实测过后发现。。。
微信公众号 2026-04-29 00:00:00
152. 不改假期发布模式,Deepseek发布多模态模型能力
微信公众号 2026-05-01 00:00:00
153. 多模态训练数据集构建平台!开源!多模态数据集、AI落地的“破瓶颈”神器!完全开源!
微信公众号 2026-04-09 00:00:00
154. 多模态数据集管理平台 开源
微信公众号 2026-04-08 00:00:00
155. 破局闭源!多模态搜索智能体完全开源方案
小红书 2026-05-07 00:00:00
156. 多模态大模型大盘点百度上岸版(附学习资料
小红书 2025-12-13 00:00:00
157. 如何通过Ollama部署我的本地大模型
今日头条 2026-03-30 00:00:00
158. 阿里开源Qwen3.6-35B-A3B模型:主打高效轻量,支持多模态思考
今日头条 2026-04-20 00:00:00
159. 本地大模型部署
微信公众号 2026-02-20 00:00:00
160. DeepSeek 多模态模型已经在开发中了
小红书 2026-04-28 00:00:00
161. 开源视觉大模型 Qwen-VL 实现行为检测
知乎 2025-12-17 00:00:00
162. 🎯 大语言模型(LLM)本地部署完全指南
小红书 2026-04-04 00:00:00
163. 多模态文档解析开源进展:端到端OCR模型LightOnOCR-2-1B架构、效果测试
知乎 2026-01-21 00:00:00
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!346 95 -
不听劝自己在卫生间砌了个浴缸!夏天泡着真舒服~成本仅需400225 400 -
40岁再就业,年薪20万有社保还能干到65:房地产估价师(下)118 141
已收藏
去我的收藏夹