张大妈

视觉Transformer正在重塑计算机视觉的底层逻辑

源自117位全网作者

05-20 19:14

内容由AI生成

精选参考来源

1. transformer架构的核心公式其实类似于数学期望,理解起来也不复杂,但为什么这个模型这么强呢?

2. 【AI人工智能】题库:纯公益分享【就业+考研】笔试+面试必会【小白从小学Python,C,Java】知识点名称AI中Transformer模型知识点讲解Transformer模型是2017年提出的基于自注意力机制的序列到序列架构,不依赖循环结构,主要基于自注意力,依靠多头自注意力(Multi-Head Attention)、位置编码(Positional Encoding)和前馈网络(Feed-Forward)实现并行计算,极大提升了训练速度和长序列建模能力。它是现代大语言模型(如BERT、GPT)的核心基础。举例:在机器翻译任务中,Transformer的编码器处理源语言序列,解码器通过掩码自注意力和交叉注意力生成目标语言,位置编码可用正弦/可学习等方式为每个位置添加固定向量,使模型感知序列顺序。例题(单选题)Transformer模型的核心创新是什么?A选项:使用循环神经网络处理序列B选项:以自注意力机制为核心,实现并行计算C选项:依赖卷积层提取局部特征D选项:引入门控机制控制信息流答案与题解 答案、题解:见评论区 温馨期待 期待大家提出宝贵建议,互相交流,收获更大,助教:lxy #AI创造营# #科技风向标# 网页链接

3. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

4. #科技先锋官# 机器人与实时视觉正成为全球AI技术竞争的核心赛道,各大巨头纷纷加码布局,通过多模态融合、本地智能升级、感知体系革新等创新方向。这一突破重构了机器人的环境交互能力,更拓宽了AI在工业、服务、创意等多场景的应用边界。谷歌DeepMind的创新极具颠覆性,其发布的Gemini Robotics On-Device实现关键突破,成为首个可在机器人本地独立运行的视觉-语言-动作模型。该模型摆脱云端依赖,通过多模态Transformer架构深度融合视觉感知、语言理解与动作规划,响应延迟降至毫秒级,弱网环境下任务完成率超95%,仅需50-100次演示即可让机器人掌握新技能,大幅降低部署成本。OpenAI则通过o3/o4-mini多模态模型强化视觉推理能力,实现带图思考的全新范式,能将图像融入思维链,在医学影像分析、图表解析等场景展现出精准的视觉理解与决策能力。腾讯鸿元发布HY-Motion 1.0模型,聚焦高质量3D动作生成,为机器人实时动画、虚拟人交互提供核心技术支撑;智谱与华为联合推出的GLM-Image多模态模型,在图像生成与编辑领域实现突破,适配国产算力底座。行业层面,DA3通用三维视觉模型、OpenTau开源训练平台等技术的涌现,正推动机器人视觉从多模型适配走向统一化、轻量化,为产业规模化落地奠定基础。#AI生活指南##一条vlog回顾2025##AI创造营# 种斌Marco的微博视频

5. Transformer架构是否已触及天花板?光靠Transformer能走通AGI吗?

6. 【阿里千问下载超 10 亿、衍生模型破 20 万,刷新全球开源模型新纪录】AI 开源社区数据显示,阿里千问衍生模型数突破 20 万个,成全球首个达成此目标的开源大模型。千问系列模型下载量突破 10 亿次,日均下载 110 万次,超越美国 Llama,居开源大模型全球第一。

7. Nature | Merlin:计算机断层扫描视觉语言基础模型与数据集

8. Nature正刊 | 斯坦福大学成果(0304):Merlin-3D视觉-语言基础模型——重塑 CT 智能分析新范式

9. 海外华人15人团队打造,统一理解与生成的图像模型,超越Nano banana登顶图像编辑

10. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?

11. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?

12. Python:生成器函数的应用场景

13. AI的未来,也许不在于模型规模的无限扩大。 #大咖观察 #红衣聊AI #transformer神经网络架构 #人工智能

14. 盘点一周AI大事(1月4日)|Google包揽年度最佳模型 LMArena大模型盲选排行榜公布年度冠军 Google推出AI辅助学习系统Learn Your Way 阿里开源最强手机智能体MAI-UI DeepSeek发布新研究mHC IQuest发布最强开源编码模型IQuest-Coder-V1 字节发布动态概念大模型DLCM 腾讯发布最强开源翻译模型HY-MT1.5 阿里更新最强开源图像模型Qwen-Image-2512 Meta开源极速视频生成模型HiStream 研究员开源对象植入模型InsertAnywhere 研究员开源MV智能体AutoMV 腾讯开源3D动作生成模型Hunyuan Motion 1.0 研究员开源高保真3D模型UltraShape 研究员开源世界模型Yume 1.5 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #AIGC

15. 下一个Transformer可能又被Google做出来了

16. 创新Transformer!面壁基于稀疏-线性混合架构SALA训练9B模型,端侧跑通百万上下文

17. 为什么2026年大模型都在往“理解生成统一”方向发展?去掉VAE和VE到底能带来什么本质性的提升?

18. CVPR'26开源 | SwiftVGGT:大规模3D场景重建的可扩展VGGT,4分钟跑完4542张图像!

19. CVPR'26开源 | PanoVGGT:全景图像的前馈三维重建

20. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?

21. 中科院开源OneDrive:统一自动驾驶的多种范式,一个Transformer搞定全部数据集!

22. Python:迭代器的应用场景

23. 盘点一周AI大事(4月5日)|叫AI老公多干活 OpenAI内测下一代生图模型「GPT-Image-2」 OpenAI工匠计划「Project Stagecraft」曝光 Google发布最强开源小模型「Gemma 4」 Anthropic研究发现Claude有170种情绪向量 阿里发布最强开源多模态大模型「Qwen3.5-Omni」 Sakana AI 发布AI战略官「Marlin」 微软发布最强语音识别模型「MAI-Transcribe-1」 研究员开源最强声音克隆模型「LongCat-AudioDiT」 研究员开源最强语音合成模型「OmniVoice」 工程师开源AI同事「同事.skill」爆火 首个一人独角兽公司「Medvi」诞生 #前沿科技趋势发布月 #AI新星计划 #AI #OpenAI #AIGC

24. Transformer与RNN合体,谷歌打下显存门槛,解锁超长上下文

25. 学习AI模型常常需要翻阅各种教程,有的过于浅显只教调用API,有的学术论文密密麻麻公式看不懂,来回切换效率低下。How to Train Your GPT 把从零构建现代LLM的全过程整合到一起,提供了一套零ML基础也能掌握GPT的互动教科书。不仅有12章逐行注释代码(3900+行),用“五岁小孩”比喻讲解Transformer核心,还包含Jupyter Notebook实时运行、完整训练管道,甚至支持从BPE分词到KV缓存推理的全流程。GitHub:github.com/raiyanyahya/how-to-train-your-gpt主要功能:- 零基础互动教程,支持BPE分词、嵌入、RoPE位置编码、注意力机制等逐行实现;- 完整GPT模型构建(151M参数),采用LLaMA式架构:RMSNorm、SwiGLU、Pre-Norm;- 自定义训练管道,包括AdamW优化器、余弦预热、混合精度和梯度累积;- 高级推理引擎,支持KV缓存、温度采样、top-k/p、beam search和重复惩罚;- 配套Jupyter Notebook,每章独立运行,CPU几分钟看模型训练全过程;- 支持实验扩展,如Flash Attention、LoRA微调、MoE等生产级优化。支持Python环境快速启动(pip install torch tiktoken),Web阅读章节+本地运行Notebook,适合Python开发者、学生和工程师自学LLM原理。#AI创造营##大语言模型##Transformer#

26. ICLR'26高分开源 | Depth Anything 3:新一代3D视觉模型,位姿精度超VGGT 35.7%!

27. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?

28. 压缩器与限制器:主要区别及适用场景

29. NVIDIA:扔出AI重磅炸弹

30. 在昨天的NVIDIA GTC 2026上,詹锟代表理想发布了下一代自动驾驶基座模型MindVLA-o1。我们在底层实现了一个核心突破:原生3D ViT——真正的三维视觉编码器。我们在尝试解答一个问题:人类开车看上去没那么难,每个普通人都能把车开得又快又稳,但全世界最顶尖的企业砸了几千亿进去,自动驾驶仍然进展缓慢。问题到底出在哪?我们一直在教AI做成年人的事,但从来没让它当过小孩。人类在0到6岁的阶段学会了走路,学会了扔球、接球。看起来只是简单的动作,但实际上已经帮助孩子建立了对三维物理空间的理解。这就是为什么我们能精准测距、稳定驾驶,因为“3D预训练”6岁前就完成了。但今天所有的端到端系统本质上都是“看2D视频学开车”,更像是一个人坐在电脑前看了十万小时行车记录仪,然后直接上路。它有了智能,但离人类的智能程度差得远。过去我们和行业使用的BEV把世界从俯视角拍扁,丢失了高度信息;OCC确实是3D的,但缺失了语义信息。物理AI缺的不是更大的模型、更多的数据,而是一个能真正理解3D世界的视觉基础。3D ViT解决了这个问题。不再是从2D“还原”3D,而是让模型一开始就工作在真实的三维世界里。以高分辨率多视角视觉为核心,在编码阶段直接完成对3D空间几何和语义的统一理解——空间结构、位置关系、语义信息,一次完成。模型不只是看见画面,而是理解世界,既知道它在哪,也知道它是什么。在这个体系下,激光雷达的角色变了。它不再是感知的核心,而更像一把高精度的尺子,为视觉提供几何标定和近场空间约束。真正决定感知上限的,不是传感器的物理线数,而是模型的表征能力。在统一建模下,3D ViT可以稳定感知并推理到500米以上的空间范围。这件事以前不是没人想做,是做不到,因为3D ViT对车端推理算力提出了极高的要求。我们自研的马赫芯片,单颗有效算力是上一代的3倍,能把这套架构真正放进车里。有了3D ViT打底,MindVLA-o1把空间理解、思考推理、驾驶行为统一在一个模型里。不光看见世界,还能在隐空间里模拟未来几秒的场景变化,想清楚再开。我们把这种能力称之为多模态思考。我们也已经进行了验证,这套基座模型不只是为自动驾驶设计的。同一套VLA基座模型,能开车,也能控制机器人,它正在逐渐演化成一个通用的物理世界智能体。自动驾驶,只是物理AI的一个起点。

31. 美团LongCat-Next:把图像、声音、文字都变成Token,然后呢?

32. #微博声浪计划##听见微博# DeepSeek v4 百万上下文实现技术普惠,自研DSA稀疏注意力机制降本增效,双版本适配不同场景,全链路支持国产算力。API定价低于GPT-5.5,应用场景广泛,虽存挑战但未来将开源,推动国产AI生态发展。 种斌Marco的微博音频

33. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?

34. 《Eur Heart J》重磅:首个基于Transformer的乳腺动脉钙化AI量化模型,打通女性心血管风险机会性筛查

35. 当今改进cnn,transformer还有出路吗?

36. 盘点一周AI大事(2月15日)|王炸视频模型 字节正式上线最强视频模型「Seedance 2.0」 字节发布最强开源视频模型「Alive」 工程师davidohyun开源龙虾女友「Clawra」爆火 Google升级最强推理模型「Gemini 3 Deep Think」 智谱发布最强开源大模型「GLM-5」 MiniMax发布最强开源编码模型「M2.5」 Google官宣AI互联网协议「WebMCP」 Claude上线Windows版「Cowork」 Google Stitch炸裂升级 千问发布最强开源图像模型「Qwen-Image-2.0」 研究员开源最强语音合成模型「MOSS-TTS」 研究员推出最强开源音乐模型「SoulX-Singer」 研究员开源最强配音模型「Just-Dub-It」 #AI新星计划 #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #人工智能

37. #李想称机器人也用VLA#人类能快速学习技能,除了拥有思考能力以外,还拥有百万年来生物进化留下来的本能以及各类视觉、触觉、听觉等感官的协调,而目前绝大部分的AI没办法真正接触到真实的物理环境,所以为了能够更像人类一样理解真实环境,理想汽车提出了3D ViT+多模态思考的方案,通过视频流还原3D的空间、位置、点云、语义和像素。在这一范式下进行大规模的预训练,模型所提取的特征即为3D ViT,能够表达真实、完整的3D信息,将这一套训练方案接入智驾,让智驾更加拟人,更能够处理复杂场景,并且在未来理想还会把算法拓展至机器人等更加先进的领域,实现真正的构建“硅基”生命。#理想全能辅助驾驶来了##理想发布下一代自动驾驶基础模型#

38. 小小的也很厉害?这个只有6B参数的开源图像模型把我看傻了

39. GTC 2026的争论,VLA是工程师的答案,目标是“先把车开好”,追求工程落地与量产;世界模型是科学家的理想,目标是“先看懂世界”,追求通用与泛化。 而如今这两条路已经完成了在高处的会师——当VLA开始学习3D空间特征(如3D ViT),当世界模型开始被压缩进实时芯片(如Thor),让这套复杂的融合架构,走好的玩家才是赢家。 发布了头条文章:《VLA 与世界模型之争:谁才是辅助驾驶的正确方向?》 http://t.cn/AXfDoMnU

40. 万能分割X2SAM:一个模型搞定任意图像+视频分割!

41. 理想MindVLA-o1!3D ViT重新定义自动驾驶 NVIDIA GTC 2026,理想詹锟发布MindVLA-o1,核心突破原生3D ViT,让AI从“看2D视频”变成“真正理解3D世界”。行业一直缺对物理空间的感知,理想直接从编码层统一几何与语义,激光雷达变高精度尺子,感知超500米。搭配马赫芯片落地,模型可预演未来、多模态思考,不止开车,更迈向通用物理AI。自动驾驶,只是起点。#李想称机器人也用VLA##理想发布下一代自动驾驶基础模型##李想回应AI时代的焦虑#

42. 理想MindVLA-o1自动驾驶基础模型简单总结:MindVLA-o1以多模态MoE Transformer为核心,靠五大技术打造物理世界智能。用视觉+激光雷达实现精准3D空间感知,能预判路况、生成稳定驾驶轨迹,通过闭环强化学习快速迭代,还以软硬件协同设计大幅缩短部署周期,让智驾看得远、想得深、行得稳、进化快、部署更高效。#理想汽车##大v聊车#

43. 聊聊那个在酒店大堂撞墙的“人工智障”:不仅是笨,是因为它“瞎”兼谈CNN技术入门

44. 一文详解Vision Transformer(ViT)神经网络模型原理

45. Transformer 27. Vision Transformer(ViT)

46. ViT真的取代了CNN吗?用一篇文章讲透Vision Transformer的底层逻辑

47. 【2026最新版】Transformer动画讲解教程!0基础易学,通俗易懂讲解T - 哔哩哔哩

48. 如何理解Vision Transformer

49. 机器视觉

50. 别再只盯着卷积核了

51. CVPR 2026 | 索尼 & IIIT Hyderabad 提出 EWOD 新范式!EW-DETR 革新动态世界目标检测

52. Transformer在视觉领域的革命

53. 2026 视觉大模型架构进化论

54. 视觉 Transformer 入门-----ViT(Vision Transformer)

55. 开课吧-深度学习与计算机视觉6期 - 人工智能 - 哔哩哔哩

56. 一文读懂视觉 Transformer 的演进之路

57. 视觉Transformer超越CNN,发文方向新霸主

58. 碾压CNN!一文彻底搞懂视觉Transformer(ViT/DETR/SETR/CLIP等)经典模型的深度优化

59. 【11】ViT论文解析

60. 记录每天的学习内容2026.3.4--了解vit(AI总结)与ai问答全部对话在github

61. 一文吃透 Vision Transformer

62. 【深度学习】注意力机制与自注意力机制详解

63. 动手学习深度学习

64. Vision Transformer与注意力机制

65. 视觉任务中,Transformer 与 CNN 的特征提取机制对比理解

66. 突破CNN全局特征局限

67. 从CNN到VIT

68. 从DeiT蒸馏到FlashAttention-3

69. 2026 CVPR|👓给ViT做近视手术,12项SOTA

70. 多模态到通用感知

71. 完胜CNN!一文详解视觉Transformer

72. 你的Vision Transformer可能训错了!LaSt-ViT让模型真正"看懂"前景,CVPR 2026最新研究揭示ViT训练缺陷,提出统一解决方案

73. TPAMI 2026 | 视觉 Transformer 再进化!中科院赫然团队推出 EVT

74. 从分类到语义,从 ViT 到 CLIP——ViT 的局限

75. 记录每天的学习内容2026.3.8--简单了解transformer在视觉上的发展(AI总结),与ai问答全部对话在https://github.com/101per/learning.git

76. 告别CNN局限!ViT/DETR/SETR/CLIP等经典模型,正在重构CV建模全逻辑

77. 碾压CNN?机器人视觉Transformer核心代码,我们开源了。。。

78. 网络变形请注意(6)

79. NeurIPS 2025|清华北大团队开源VCA模块,即插即用,让视觉AI“抓重点”既快又准

80. Transformer综述(A Survey on Vision Transformer) 阅读学习笔记(三)--Transformer应用的图像处理与视频处理的研究

81. 多模态大模型的基石-ViT速览

82. NaViT:适用于任意分辨率的视觉Transformer

83. 理解并微调 Vision Transformer,这篇万字长文讲透了

84. Swin-TransFormer论文阅读笔记

85. 字节大模型应用开发二面:请详细解释一下 Transformer 模型中的自注意力机制是如何工作的?它为什么比 RNN 更适合处理长序列?

86. YOLO26全网首发创新:TPAMI 2026重磅创新 | 自适应稀疏自注意力机制强势来袭,让特征聚合更高效!

87. 视觉Transformer (Vision Transformer, ViT)

88. CVPR 2026 | 你的ViT可能训错了!LaSt-ViT:让模型真正"看懂"前景

89. CNN已过时?1小时搞懂VIT,AI视觉新霸主! 🚨 还在死磕CNN?做计算机视觉研究,你必须要懂VIT了! 它不仅是顶会标配,更是论文创新的源头活水。 这个视频,帮你彻底搞懂VIT: 1️⃣ 核心思想:如何把图像当成一句话,让Transformer“读懂”? 图像切块(Patch)具体怎么操作? 位置编码如何用在图像上? 2️⃣ 代码实战(附可跑通源码) 手把手带你从零写一个简易VIT 配置环境常见坑点全避开 3️⃣ 论文/项目怎么用? 发论文:VIT作为backbone,怎么改出创新点? 做项目:用VIT做图像分类,效果到底比CNN强在哪? 📦 看完视频,你立刻能带走: ✅ 逐行注释的VIT代码(PyTorch版) ✅ VIT与CNN的详细对比实验报告 ✅ 5个VIT改进创新点方向 👉 关注我+评论区扣“已关,求”自动发资料包

90. CLIP范式已死!字节发布GenLIP | 砍掉解码器与对比学习,让ViT直接开口说话,效果反而更强

91. 自注意力机制:让AI学会"读懂上下文"的核心算法,到底如何运作?

92. 基于改进小目标实时检测Transformer 的研究与应用之研究展望

93. 别让ViT算全量Token了!LLaVA-UHD v4把Token压缩塞进ViT第6层,高分辨率多模态终于不卡了

94. 王炸方向!目标检测+Transformer连中顶会,实时DETR思路速学!

95. 避坑指南|主流视觉Transformer模型优劣势深度横评

96. 没那么复杂,用PyTorch手撕一个Vision Transformer(ViT)模型(连载2:模型训练篇)

97. DEIMv2 后的又一力作!英特灵达开源 EdgeCrafter:让轻量级 ViT 在边缘端密集预测强于YOLO系

98. 视觉预训练系统讲解(一):根本问题、ViT 架构与对比学习

99. 难绷,原来ViT模型一直在用背景做分类啊?

100. ViT家族再添猛将 | Tiny-ViT 轻量化ViT突破边缘算力瓶颈

101. 必知必会:高效注意力机制——Sparse Attention与Linear Attention详解

102. 在VIT模型中加强原始图片细节特征的方案

103. VIT架构简析

104. 高效自注意力机制

105. 重庆大学周喜川、赵思桓等丨TP-ViT:面向视觉Transformer量化的截断均匀对数量化器与渐进式比特衰减重建方法丨EITEE

106. 计算机视觉Transformer-2 目标检测

107. AI算法面试:ViT怎么预训练

108. CLIP原理以及实现心得

109. 为视觉建模注入物理灵魂:WaveFormer证明,下一站是“物理启发模型”

110. 计算机视觉Transformer-1 基础结构

111. 基于Transformer的视觉识别算法(Vision Transformer详解)

112. 视觉基础模型深度笔记:DINO、MAE、SAM

113. 深度学习实战-基于CNN和VIT的乳腺癌图像分类识别模型

114. ViT真在看目标吗?港大中大团队揭开背景捷径之谜

115. 视觉Transformer(ViT)

116. 让视觉模型学会“回头看”:一种增强ViT的沉浸式信息注入机制

117. ViT-AdaLA 让大视觉模型“瘦身”跑得更快 | 90%计算量砍掉,精度反升2.1%!

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章