当前位置:
AIGC文章详情

张大妈

Qwen2-VL:视频理解与文档识别的多模态技术突破

源自59位全网作者

05-30 17:43

内容由AI生成

精选参考来源

1. 520,遇见国产「新模王」Qwen3.7-Max!

2. 不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?

3. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格

4. Z-Image 遇到对手了!Qwen-Image-2512 正式开源:本地无限生图,效果更逼真!

5. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

6. 百度开源全新OCR模型PaddleOCR-VL-1.5,性能超越DeepSeek-OCR2

7. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说

8. Qwen3.6-Plus 太猛了!免费+百万上下文+Agent,多模态能力直接拉满!| 零度解说

9. Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了

10. 「Github一周热点113期」AI 终端工具、一站式黑客工具箱、Skill 包、Codex 生态技能和AI短视频

11. OpenClaw + Ollama 本地部署!无需 API,断网可用,多模型自由切换(GPT-OSS / Qwen 3 / GLM 4.7)

12. 谁才是最强王者?ChatGPT5.5、Claude 4.7、Deepseek V4、Qwen 3.6 编程实测见真章!| 零度解说

13. 2026开年王炸:Qwen3.5震撼发布,一条视频讲清所有玩法...

14. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

15. 盘点一周AI大事(11月30日)|AI自己剪片子 奥特曼预告下一代大模型Shallotpeat Anthropic发布最强编码模型Claude Opus 4.5 DeepSeek发布最强开源推理模型DeepSeek-Math-V2 微软开源最强行动智能体Fara-7B Black Forest推出最强开源图像模型Flux.2 阿里发布开源版小香蕉平替Z-Image 腾讯发布开源版Veo 3平替Tencent Harmony 字节开源AI剪辑大模型Vidi2 腾讯开源最强OCR模型HunyuanOCR 1B 科学家研发出最强数据分析智能体Edison Analysis RAI研发棒球陪练机器人 港科大训练出首个会打篮球的机器人 工程师开源家用机器人Aloha mini #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

16. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月

17. 一个视频带你快速盘点2025年GitHub热点项目

18. 多模态大模型这条赛道,阿里云开始拉速度了

19. #千问Qwen3.5大模型发布#真正的卷王出现了,就在刚刚,阿里正式发布全新一代大模型千问Qwen3.5-Plus。这次核心更新在于采用了Mamba混合注意力机制(SSM-Transformer) + 稀疏MoE架构,总参数3970亿但仅激活170亿参数,显存占用降低60%,推理吞吐量最高提升19倍。举个例子,传统大模型就像人工翻整墙档案,你每问一个新问题,都要把前面所有档案重新翻一遍核对关系,内容越长,翻得越慢,越到后面越卡。 纯Mamba机制则像只记档案摘要,翻得极快,但细节容易丢,关键信息可能漏看。 而Qwen3.5-Plus的混合注意力,就是摘要+精准抽查一起上:速度跟得上,细节不丢失,长文本、复杂推理又快又准。 这才是真·技术内卷,大模型体验又要上一个台阶了。#how i ai##过个有ai年# 千问qwen3.5大模型发布

20. 如何看待阿里开源的Qwen3-VL-Embedding 和 Qwen3-VL-Reranker 模型?

21. 如何评价 3 月 30 日发布的 Qwen3.5-Omni 的性能表现?

22. G2VLM:统一3D重建和空间推理能力(上海AI Lab, UCLA, 上交开源)

23. 盘点一周AI大事(1月25日)|Agent进化,24小时打工 开源视频制作Remotion Skills爆火 AI编程开无限画布插件Pencil 爆火 开源个人AI助手Clawdbot爆火,7成24小时给你打工 Claude Excel插件更新 Runway上线最强视频模型Gen 4.5 字节开源视频参考模型OminiTransfer 字节发布最强数字人直播模型FlowACT R1 阿里开源最强文本转语音模型Qwen 3 TTS #AI新星计划 #抖音知识年终大赏 #AI #OpenAI #AIGC

24. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

25. 零成本无限 Token!Hermes + Qwen3.6,本地最强 Agent 组合来了!附部署教程 | 零度解说

26. 四道题评测 Qwen3.7-Max:从空间推理到 3D 建模,它离 Agent 更近了吗?

27. 盘点一周AI大事(1月4日)|Google包揽年度最佳模型 LMArena大模型盲选排行榜公布年度冠军 Google推出AI辅助学习系统Learn Your Way 阿里开源最强手机智能体MAI-UI DeepSeek发布新研究mHC IQuest发布最强开源编码模型IQuest-Coder-V1 字节发布动态概念大模型DLCM 腾讯发布最强开源翻译模型HY-MT1.5 阿里更新最强开源图像模型Qwen-Image-2512 Meta开源极速视频生成模型HiStream 研究员开源对象植入模型InsertAnywhere 研究员开源MV智能体AutoMV 腾讯开源3D动作生成模型Hunyuan Motion 1.0 研究员开源高保真3D模型UltraShape 研究员开源世界模型Yume 1.5 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #AIGC

28. 「Github一周热点105期」Rust 版openclaw,本地语音克隆工具,Qwen3.5, AI 渗透测试系统和精美源码图片生成工具

29. 刚才在HuggingFace上看到,Qwen3.5已经提交了并入Transformers的PR。这意味着阿里的新一代基座模型很快就要正式开源了。 这次的Qwen3.5有点意思: 1.混合注意力机制,据说是全新架构; 2.大概率是原生VLM,能看懂图像了; 3.开源包至少包含2B密集模型和35B-A3B的MoE版本。 值得关注的是,这是国内首个混合推理模型。简单说就是把快思考和慢思考结合起来,既有速度又有深度。这种设计在算力消耗上有明显优势,对开发者很友好。 其实从去年Qwen3登顶开源榜就能看出,阿里在模型架构上确实有一套。现在3.5版本继续这个势头,加上智谱唐老师之前预告的DeepSeek-v4、GLM-5也要来,今年二月中国大模型圈要热闹了。开源生态现在越来越重要。模型好不好,最后要看开发者用不用得起来。Qwen3.5这个开源策略很聪明,既展示了技术实力,又能快速建立生态。 不由感叹技术发展真快。去年这个时候大家还在讨论Qwen2.5,现在3.5都要来了。这种迭代速度,对行业是好事,对开发者也是机会。等Qwen3.5正式开源了,咱也上手试试效果。[挤眼]

30. #千问Qwen3.5大模型发布# 刚刚,千问正式官宣发布 Qwen3.5,并推出Qwen3.5系列的第一款模型 Qwen3.5-397B-A17B 的开放权重版本。作为原生视觉-语言模型,Qwen3.5-397B-A17B 在推理、编程、智能体能力与多模态理解等全方位基准评估中表现优异,助力开发者与企业显著提升生产力。该模型采用创新的混合架构,将线性注意力(Gated Delta Networks)与稀疏混合专家(MoE)相结合,实现出色的推理效率:总参数量达 3970 亿,每次前向传播仅激活 170 亿参数,在保持能力的同时优化速度与成本。我们还将语言与方言支持从 119 种扩展至 201 种,为全球用户提供更广泛的可用性与更完善的支持!#HOW I AI##过个有AI年#

31. 阿里发布新一代全模态大模型Qwen3.5-Omni。 采用混合注意力MoE架构,通过1亿小时音视频+文本跨模态预训练 。 原生支持113种语言识别(含毛利语等濒危语种)和36种语音生成。 创新ARIA语音技术实现音色稳定,对话响应延迟降低至人类感知无差别水平。 核心突破: 视听理解:在DailyOmni等215项基准测试中全面超越Gemini 3.1 Pro ,嘈杂环境语音识别错误率下降42%(WenetSpeech基准)视频内容结构化描述准确率达98.1%(RealWorldQA测试) 。 Vibe Coding进化:非预设能力,在百万级多模态指令微调中自然涌现 。 普通用户可前往Qwen Chat免费体验,开发者和企业可通过阿里云百炼平台调用Qwen3.5-Omni模型Plus、Flash、Light三种API。

32. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代

33. #千问Qwen3.5大模型发布# 阿里“年夜饭”来了,开源全新一代大模型千问Qwen3.5-Plus。 总参数为3970亿,激活170亿,性能超过万亿参数的Qwen3-Max模型,部署显存占用降低60%,推理效率大幅提升,最大推理吞吐量可提升至19倍。 在推理、编程、Agent智能体等全方位基准评估中均表现优异,并在视觉理解能力的权威评测中斩获数项性能最佳。 支持长达2小时(1M token上下文)的视频直接输入,适用于长视频内容分析与摘要生成。#过个有AI年#

34. 正面硬刚Gemini 3 Pro,阿里开源Qwen3.5-Plus|甲子光年

35. 【AI前沿】Google IO 与 Qwen 3.7 Max:模型战争没有结束,只是战场变成了 Agent 基础设施

36. #千问Qwen3.5大模型发布#千问 Qwen3.5 是采用极致稀疏 MoE 架构在保持超强性能的同时,显存占用降低 60%,推理效率大幅提升,部署成本显著下降。模型支持最高 256K 超长上下文,让长文本处理变的更加的轻松有效率了!原生多模态统一也是Qwen3.5的特点之一,也是目前国内外大模型的发展的主要趋势,模型在图文、视频理解能力全面升级,精准解析图表、文档与复杂视觉内容。实现了一个入口实现多种属性。Qwen3.5对于中小企业特别友好, 很大程度上降低了企业运营成本,可以让中小企业得到高效、普惠、全能的运营工具。不再因为高昂的费用而排斥企业去追逐AI。#过个有AI年##HOW I AI#

37. 除夕夜,国产顶流压轴上线,QWEN3.5多模态开源!

38. 【华为昇腾 0 Day 适配阿里 Qwen3.5,MindSpeed MM 框架实现 " 开箱即用、快速迭代 "】阿里在 chat.qwen.ai 页面低调上线了 Qwen3.5-Plus 和 Qwen3.5-397B-A17B 两款新模型(均支持文本和多模态任务)。Qwen3.5 Plus 定位为 Qwen 3.5 系列最新大语言模型;Qwen3.5-397B-A17B 定位则是 Qwen3.5 开源系列旗舰大语言模型。华为计算官方昨晚宣布,Qwen3.5 模型一经开源发布,昇腾 0 day 实现基于 MindSpeed MM 在 Atlas 800 A3、Atlas 900 A3SuperPoD 上的训练复现,同时也支持基于 vLLM-Ascend 和 SGLang 在 Atlas 800 A2、Atlas 800 A3 上的高效推理部署。据介绍,基于 FSDP 训练后端的设计,MindSpeed MM 框架大幅缩短了新模型的适配周期,实现了 " 开箱即用、快速迭代 " 的开发体验,为多模态大模型的研究与应用提供了技术支撑。另据阿里云介绍,Qwen3.5 实现了底层模型架构的全面革新,其中,Qwen3.5-Plus 版本总参数为 3970 亿,激活仅 170 亿,性能超过万亿参数的 Qwen3-Max 模型,部署显存占用降低 60%,推理效率大幅提升,最大推理吞吐量可提升至 19 倍。Qwen3.5 在能力、效率与通用性三个维度上推进预训练:能力(Power):在更大规模的视觉-文本语料上训练,并加强中英文、多语言、STEM 与推理数据,采用更严格的过滤,实现跨代持平:Qwen3.5-397B-A17B 与参数量超过 1T 的 Qwen3-Max-Base 表现相当。效率(Efficiency):基于 Qwen3-Next 架构 —— 更高稀疏度的 MoE、Gated DeltaNet + Gated Attention 混合注意力、稳定性优化与多 token 预测。在 32k/256k 上下文长度下,Qwen3.5-397B-A17B 的解码吞吐量分别是 Qwen3-Max 的 8.6 倍 / 19.0 倍,且性能相当。Qwen3.5-397B-A17B 的解码吞吐量分别是 Qwen3-235B-A22B 的 3.5 倍 / 7.2 倍。通用性(Versatility):通过早期文本-视觉融合与扩展的视觉 / STEM / 视频数据实现原生多模态,在相近规模下优于 Qwen3-VL。多语言覆盖从 119 增至 201 种语言 / 方言;25 万词表(vs. 15 万)在多数语言上带来约 10–60% 的编码 / 解码效率提升。vllm 部署指导可参见魔乐社区和 gitcode 社区链接:网页链接网页链接SGLang 部署指导可参见 SGLang 社区链接:网页链接

39. 权威评测平台SuperCLUE-VLM发布2025年12月多模态视觉语言模型综合榜单,谷歌 Gemini-3-Pro 以83.64分“断层式”领跑,看来多模态这块依然是谷歌的绝对统治区。但国产模型的追赶速度肉眼可见:商汤SenseNova拿下第二,字节豆包冲进前三,基础认知能力甚至不输国际巨头。特别值得一提的是阿里的 Qwen3-VL,作为首个总分破70的开源模型,绝对是国内开发者的福音。反倒是 GPT-5.2 这次表现平平,竟然没上70分。#AI#

40. 【多模态大模型实战 01】Qwen2.5-VL-3B 基础环境配置

41. Qwen2-VL:阿里开源新型世界领先视觉智能体,主打人类级别任意分辨率图像处理

42. 10 Qwen2-VL论文解读

43. Qwen-VL 进化论:从对齐到认知的终极之路

44. 多模态大模型入门指南(三)Qwen-VL 系列技术演进

45. 从 ViT 到 Qwen2-VL:多模态大模型架构演进全景指南

46. Qwen-VL系列解析(一)——Qwen2-VL

47. 多模态大模型paper整理(十) Qwenvl 3

48. 动态分辨率与三维位置编码:Qwen2-VL 的范式革新

49. 【大模型面试必知必会 1】Qwen 多模态大模型全系列演进深度拆解

50. 系列教程六| 微调 Qwen2-VL:实现 LaTeX 公式 OCR 识别!

51. VLM:qwen2-vl

52. Qwen-3 VL 中如何处理视频数据?

53. Qwen-VL架构介绍

54. Qwen2-VL 模型结构和万字源码解析篇

55. AI算法面试题:Qwen-VL原理

56. Qwen2.5-VL

57. qwen2-vl网络细节梳理

58. 基于Qwen-VL-2B-instruct的复杂文档结构分析和内容理解

59. Qwen2 VL – 图表理解的推理与微调

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章