视觉Transformer正在重塑计算机视觉的底层逻辑
05-20 19:14
精选参考来源
知乎 2025-11-25
新浪微博 2026-01-11
来源
精选参考来源
1. transformer架构的核心公式其实类似于数学期望,理解起来也不复杂,但为什么这个模型这么强呢?
知乎 2025-11-25 00:00:00
2. 【AI人工智能】题库:纯公益分享【就业+考研】笔试+面试必会【小白从小学Python,C,Java】知识点名称AI中Transformer模型知识点讲解Transformer模型是2017年提出的基于自注意力机制的序列到序列架构,不依赖循环结构,主要基于自注意力,依靠多头自注意力(Multi-Head Attention)、位置编码(Positional Encoding)和前馈网络(Feed-Forward)实现并行计算,极大提升了训练速度和长序列建模能力。它是现代大语言模型(如BERT、GPT)的核心基础。举例:在机器翻译任务中,Transformer的编码器处理源语言序列,解码器通过掩码自注意力和交叉注意力生成目标语言,位置编码可用正弦/可学习等方式为每个位置添加固定向量,使模型感知序列顺序。例题(单选题)Transformer模型的核心创新是什么?A选项:使用循环神经网络处理序列B选项:以自注意力机制为核心,实现并行计算C选项:依赖卷积层提取局部特征D选项:引入门控机制控制信息流答案与题解 答案、题解:见评论区 温馨期待 期待大家提出宝贵建议,互相交流,收获更大,助教:lxy #AI创造营# #科技风向标# 网页链接
新浪微博 2026-01-11 00:00:00
3. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-04-19 00:00:00
4. #科技先锋官# 机器人与实时视觉正成为全球AI技术竞争的核心赛道,各大巨头纷纷加码布局,通过多模态融合、本地智能升级、感知体系革新等创新方向。这一突破重构了机器人的环境交互能力,更拓宽了AI在工业、服务、创意等多场景的应用边界。谷歌DeepMind的创新极具颠覆性,其发布的Gemini Robotics On-Device实现关键突破,成为首个可在机器人本地独立运行的视觉-语言-动作模型。该模型摆脱云端依赖,通过多模态Transformer架构深度融合视觉感知、语言理解与动作规划,响应延迟降至毫秒级,弱网环境下任务完成率超95%,仅需50-100次演示即可让机器人掌握新技能,大幅降低部署成本。OpenAI则通过o3/o4-mini多模态模型强化视觉推理能力,实现带图思考的全新范式,能将图像融入思维链,在医学影像分析、图表解析等场景展现出精准的视觉理解与决策能力。腾讯鸿元发布HY-Motion 1.0模型,聚焦高质量3D动作生成,为机器人实时动画、虚拟人交互提供核心技术支撑;智谱与华为联合推出的GLM-Image多模态模型,在图像生成与编辑领域实现突破,适配国产算力底座。行业层面,DA3通用三维视觉模型、OpenTau开源训练平台等技术的涌现,正推动机器人视觉从多模型适配走向统一化、轻量化,为产业规模化落地奠定基础。#AI生活指南##一条vlog回顾2025##AI创造营# 种斌Marco的微博视频
新浪微博 2026-01-16 00:00:00
5. Transformer架构是否已触及天花板?光靠Transformer能走通AGI吗?
知乎 2025-11-28 00:00:00
6. 【阿里千问下载超 10 亿、衍生模型破 20 万,刷新全球开源模型新纪录】AI 开源社区数据显示,阿里千问衍生模型数突破 20 万个,成全球首个达成此目标的开源大模型。千问系列模型下载量突破 10 亿次,日均下载 110 万次,超越美国 Llama,居开源大模型全球第一。
新浪微博 2026-01-21 00:00:00
7. Nature | Merlin:计算机断层扫描视觉语言基础模型与数据集
微信公众号 2026-05-13 00:00:00
8. Nature正刊 | 斯坦福大学成果(0304):Merlin-3D视觉-语言基础模型——重塑 CT 智能分析新范式
微信公众号 2026-03-14 00:00:00
9. 海外华人15人团队打造,统一理解与生成的图像模型,超越Nano banana登顶图像编辑
微信公众号 2026-03-06 00:00:00
10. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?
知乎 2025-11-29 00:00:00
11. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?
知乎 2025-11-29 00:00:00
12. Python:生成器函数的应用场景
微信公众号 2026-02-13 00:00:00
13. AI的未来,也许不在于模型规模的无限扩大。 #大咖观察 #红衣聊AI #transformer神经网络架构 #人工智能
抖音 2025-12-13 00:00:00
14. 盘点一周AI大事(1月4日)|Google包揽年度最佳模型 LMArena大模型盲选排行榜公布年度冠军 Google推出AI辅助学习系统Learn Your Way 阿里开源最强手机智能体MAI-UI DeepSeek发布新研究mHC IQuest发布最强开源编码模型IQuest-Coder-V1 字节发布动态概念大模型DLCM 腾讯发布最强开源翻译模型HY-MT1.5 阿里更新最强开源图像模型Qwen-Image-2512 Meta开源极速视频生成模型HiStream 研究员开源对象植入模型InsertAnywhere 研究员开源MV智能体AutoMV 腾讯开源3D动作生成模型Hunyuan Motion 1.0 研究员开源高保真3D模型UltraShape 研究员开源世界模型Yume 1.5 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #AIGC
抖音 2026-01-04 00:00:00
15. 下一个Transformer可能又被Google做出来了
微信公众号 2025-12-06 00:00:00
16. 创新Transformer!面壁基于稀疏-线性混合架构SALA训练9B模型,端侧跑通百万上下文
微信公众号 2026-02-11 00:00:00
17. 为什么2026年大模型都在往“理解生成统一”方向发展?去掉VAE和VE到底能带来什么本质性的提升?
知乎 2026-05-03 00:00:00
18. CVPR'26开源 | SwiftVGGT:大规模3D场景重建的可扩展VGGT,4分钟跑完4542张图像!
知乎 2026-04-27 00:00:00
19. CVPR'26开源 | PanoVGGT:全景图像的前馈三维重建
知乎 2026-04-17 00:00:00
20. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?
知乎 2025-11-28 00:00:00
21. 中科院开源OneDrive:统一自动驾驶的多种范式,一个Transformer搞定全部数据集!
知乎 2026-05-15 00:00:00
22. Python:迭代器的应用场景
微信公众号 2026-02-12 00:00:00
23. 盘点一周AI大事(4月5日)|叫AI老公多干活 OpenAI内测下一代生图模型「GPT-Image-2」 OpenAI工匠计划「Project Stagecraft」曝光 Google发布最强开源小模型「Gemma 4」 Anthropic研究发现Claude有170种情绪向量 阿里发布最强开源多模态大模型「Qwen3.5-Omni」 Sakana AI 发布AI战略官「Marlin」 微软发布最强语音识别模型「MAI-Transcribe-1」 研究员开源最强声音克隆模型「LongCat-AudioDiT」 研究员开源最强语音合成模型「OmniVoice」 工程师开源AI同事「同事.skill」爆火 首个一人独角兽公司「Medvi」诞生 #前沿科技趋势发布月 #AI新星计划 #AI #OpenAI #AIGC
抖音 2026-04-05 00:00:00
24. Transformer与RNN合体,谷歌打下显存门槛,解锁超长上下文
微信公众号 2026-04-17 00:00:00
25. 学习AI模型常常需要翻阅各种教程,有的过于浅显只教调用API,有的学术论文密密麻麻公式看不懂,来回切换效率低下。How to Train Your GPT 把从零构建现代LLM的全过程整合到一起,提供了一套零ML基础也能掌握GPT的互动教科书。不仅有12章逐行注释代码(3900+行),用“五岁小孩”比喻讲解Transformer核心,还包含Jupyter Notebook实时运行、完整训练管道,甚至支持从BPE分词到KV缓存推理的全流程。GitHub:github.com/raiyanyahya/how-to-train-your-gpt主要功能:- 零基础互动教程,支持BPE分词、嵌入、RoPE位置编码、注意力机制等逐行实现;- 完整GPT模型构建(151M参数),采用LLaMA式架构:RMSNorm、SwiGLU、Pre-Norm;- 自定义训练管道,包括AdamW优化器、余弦预热、混合精度和梯度累积;- 高级推理引擎,支持KV缓存、温度采样、top-k/p、beam search和重复惩罚;- 配套Jupyter Notebook,每章独立运行,CPU几分钟看模型训练全过程;- 支持实验扩展,如Flash Attention、LoRA微调、MoE等生产级优化。支持Python环境快速启动(pip install torch tiktoken),Web阅读章节+本地运行Notebook,适合Python开发者、学生和工程师自学LLM原理。#AI创造营##大语言模型##Transformer#
新浪微博 2026-05-13 00:00:00
26. ICLR'26高分开源 | Depth Anything 3:新一代3D视觉模型,位姿精度超VGGT 35.7%!
知乎 2026-02-03 00:00:00
27. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?
知乎 2025-11-29 00:00:00
28. 压缩器与限制器:主要区别及适用场景
微信公众号 2025-12-01 00:00:00
29. NVIDIA:扔出AI重磅炸弹
哔哩哔哩 2026-01-07 00:00:00
30. 在昨天的NVIDIA GTC 2026上,詹锟代表理想发布了下一代自动驾驶基座模型MindVLA-o1。我们在底层实现了一个核心突破:原生3D ViT——真正的三维视觉编码器。我们在尝试解答一个问题:人类开车看上去没那么难,每个普通人都能把车开得又快又稳,但全世界最顶尖的企业砸了几千亿进去,自动驾驶仍然进展缓慢。问题到底出在哪?我们一直在教AI做成年人的事,但从来没让它当过小孩。人类在0到6岁的阶段学会了走路,学会了扔球、接球。看起来只是简单的动作,但实际上已经帮助孩子建立了对三维物理空间的理解。这就是为什么我们能精准测距、稳定驾驶,因为“3D预训练”6岁前就完成了。但今天所有的端到端系统本质上都是“看2D视频学开车”,更像是一个人坐在电脑前看了十万小时行车记录仪,然后直接上路。它有了智能,但离人类的智能程度差得远。过去我们和行业使用的BEV把世界从俯视角拍扁,丢失了高度信息;OCC确实是3D的,但缺失了语义信息。物理AI缺的不是更大的模型、更多的数据,而是一个能真正理解3D世界的视觉基础。3D ViT解决了这个问题。不再是从2D“还原”3D,而是让模型一开始就工作在真实的三维世界里。以高分辨率多视角视觉为核心,在编码阶段直接完成对3D空间几何和语义的统一理解——空间结构、位置关系、语义信息,一次完成。模型不只是看见画面,而是理解世界,既知道它在哪,也知道它是什么。在这个体系下,激光雷达的角色变了。它不再是感知的核心,而更像一把高精度的尺子,为视觉提供几何标定和近场空间约束。真正决定感知上限的,不是传感器的物理线数,而是模型的表征能力。在统一建模下,3D ViT可以稳定感知并推理到500米以上的空间范围。这件事以前不是没人想做,是做不到,因为3D ViT对车端推理算力提出了极高的要求。我们自研的马赫芯片,单颗有效算力是上一代的3倍,能把这套架构真正放进车里。有了3D ViT打底,MindVLA-o1把空间理解、思考推理、驾驶行为统一在一个模型里。不光看见世界,还能在隐空间里模拟未来几秒的场景变化,想清楚再开。我们把这种能力称之为多模态思考。我们也已经进行了验证,这套基座模型不只是为自动驾驶设计的。同一套VLA基座模型,能开车,也能控制机器人,它正在逐渐演化成一个通用的物理世界智能体。自动驾驶,只是物理AI的一个起点。
新浪微博 2026-03-18 00:00:00
31. 美团LongCat-Next:把图像、声音、文字都变成Token,然后呢?
微信公众号 2026-04-02 00:00:00
32. #微博声浪计划##听见微博# DeepSeek v4 百万上下文实现技术普惠,自研DSA稀疏注意力机制降本增效,双版本适配不同场景,全链路支持国产算力。API定价低于GPT-5.5,应用场景广泛,虽存挑战但未来将开源,推动国产AI生态发展。 种斌Marco的微博音频
新浪微博 2026-04-25 00:00:00
33. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?
知乎 2025-11-29 00:00:00
34. 《Eur Heart J》重磅:首个基于Transformer的乳腺动脉钙化AI量化模型,打通女性心血管风险机会性筛查
微信公众号 2026-03-25 00:00:00
35. 当今改进cnn,transformer还有出路吗?
知乎 2025-11-21 00:00:00
36. 盘点一周AI大事(2月15日)|王炸视频模型 字节正式上线最强视频模型「Seedance 2.0」 字节发布最强开源视频模型「Alive」 工程师davidohyun开源龙虾女友「Clawra」爆火 Google升级最强推理模型「Gemini 3 Deep Think」 智谱发布最强开源大模型「GLM-5」 MiniMax发布最强开源编码模型「M2.5」 Google官宣AI互联网协议「WebMCP」 Claude上线Windows版「Cowork」 Google Stitch炸裂升级 千问发布最强开源图像模型「Qwen-Image-2.0」 研究员开源最强语音合成模型「MOSS-TTS」 研究员推出最强开源音乐模型「SoulX-Singer」 研究员开源最强配音模型「Just-Dub-It」 #AI新星计划 #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #人工智能
抖音 2026-02-15 00:00:00
37. #李想称机器人也用VLA#人类能快速学习技能,除了拥有思考能力以外,还拥有百万年来生物进化留下来的本能以及各类视觉、触觉、听觉等感官的协调,而目前绝大部分的AI没办法真正接触到真实的物理环境,所以为了能够更像人类一样理解真实环境,理想汽车提出了3D ViT+多模态思考的方案,通过视频流还原3D的空间、位置、点云、语义和像素。在这一范式下进行大规模的预训练,模型所提取的特征即为3D ViT,能够表达真实、完整的3D信息,将这一套训练方案接入智驾,让智驾更加拟人,更能够处理复杂场景,并且在未来理想还会把算法拓展至机器人等更加先进的领域,实现真正的构建“硅基”生命。#理想全能辅助驾驶来了##理想发布下一代自动驾驶基础模型#
新浪微博 2026-03-18 00:00:00
38. 小小的也很厉害?这个只有6B参数的开源图像模型把我看傻了
哔哩哔哩 2025-12-18 00:00:00
39. GTC 2026的争论,VLA是工程师的答案,目标是“先把车开好”,追求工程落地与量产;世界模型是科学家的理想,目标是“先看懂世界”,追求通用与泛化。 而如今这两条路已经完成了在高处的会师——当VLA开始学习3D空间特征(如3D ViT),当世界模型开始被压缩进实时芯片(如Thor),让这套复杂的融合架构,走好的玩家才是赢家。 发布了头条文章:《VLA 与世界模型之争:谁才是辅助驾驶的正确方向?》 http://t.cn/AXfDoMnU
新浪微博 2026-03-26 00:00:00
40. 万能分割X2SAM:一个模型搞定任意图像+视频分割!
知乎 2026-05-15 00:00:00
41. 理想MindVLA-o1!3D ViT重新定义自动驾驶 NVIDIA GTC 2026,理想詹锟发布MindVLA-o1,核心突破原生3D ViT,让AI从“看2D视频”变成“真正理解3D世界”。行业一直缺对物理空间的感知,理想直接从编码层统一几何与语义,激光雷达变高精度尺子,感知超500米。搭配马赫芯片落地,模型可预演未来、多模态思考,不止开车,更迈向通用物理AI。自动驾驶,只是起点。#李想称机器人也用VLA##理想发布下一代自动驾驶基础模型##李想回应AI时代的焦虑#
新浪微博 2026-03-18 00:00:00
42. 理想MindVLA-o1自动驾驶基础模型简单总结:MindVLA-o1以多模态MoE Transformer为核心,靠五大技术打造物理世界智能。用视觉+激光雷达实现精准3D空间感知,能预判路况、生成稳定驾驶轨迹,通过闭环强化学习快速迭代,还以软硬件协同设计大幅缩短部署周期,让智驾看得远、想得深、行得稳、进化快、部署更高效。#理想汽车##大v聊车#
新浪微博 2026-03-17 00:00:00
43. 聊聊那个在酒店大堂撞墙的“人工智障”:不仅是笨,是因为它“瞎”兼谈CNN技术入门
知乎 2025-12-03 00:00:00
44. 一文详解Vision Transformer(ViT)神经网络模型原理
知乎 2026-03-15 00:00:00
45. Transformer 27. Vision Transformer(ViT)
知乎 2026-04-20 00:00:00
46. ViT真的取代了CNN吗?用一篇文章讲透Vision Transformer的底层逻辑
知乎 2026-02-06 00:00:00
47. 【2026最新版】Transformer动画讲解教程!0基础易学,通俗易懂讲解T - 哔哩哔哩
哔哩哔哩 2026-03-03 00:00:00
48. 如何理解Vision Transformer
知乎 2026-04-23 00:00:00
49. 机器视觉
微信公众号 2025-12-03 00:00:00
50. 别再只盯着卷积核了
微信公众号 2025-12-10 00:00:00
51. CVPR 2026 | 索尼 & IIIT Hyderabad 提出 EWOD 新范式!EW-DETR 革新动态世界目标检测
微信公众号 2026-04-09 00:00:00
52. Transformer在视觉领域的革命
知乎 2026-04-06 00:00:00
53. 2026 视觉大模型架构进化论
知乎 2026-05-08 00:00:00
54. 视觉 Transformer 入门-----ViT(Vision Transformer)
知乎 2026-01-05 00:00:00
55. 开课吧-深度学习与计算机视觉6期 - 人工智能 - 哔哩哔哩
哔哩哔哩 2025-12-25 00:00:00
56. 一文读懂视觉 Transformer 的演进之路
知乎 2026-05-15 00:00:00
57. 视觉Transformer超越CNN,发文方向新霸主
哔哩哔哩 2025-12-15 00:00:00
58. 碾压CNN!一文彻底搞懂视觉Transformer(ViT/DETR/SETR/CLIP等)经典模型的深度优化
微信公众号 2026-02-05 00:00:00
59. 【11】ViT论文解析
知乎 2026-04-26 00:00:00
60. 记录每天的学习内容2026.3.4--了解vit(AI总结)与ai问答全部对话在github
知乎 2026-03-04 00:00:00
61. 一文吃透 Vision Transformer
知乎 2026-05-12 00:00:00
62. 【深度学习】注意力机制与自注意力机制详解
知乎 2026-03-03 00:00:00
63. 动手学习深度学习
知乎 2026-05-15 00:00:00
64. Vision Transformer与注意力机制
抖音 2026-03-23 00:00:00
65. 视觉任务中,Transformer 与 CNN 的特征提取机制对比理解
知乎 2025-12-25 00:00:00
66. 突破CNN全局特征局限
微信公众号 2026-05-12 00:00:00
67. 从CNN到VIT
今日头条 2025-12-06 00:00:00
68. 从DeiT蒸馏到FlashAttention-3
微信公众号 2026-03-12 00:00:00
69. 2026 CVPR|👓给ViT做近视手术,12项SOTA
小红书 2026-05-14 00:00:00
70. 多模态到通用感知
知乎 2025-11-23 00:00:00
71. 完胜CNN!一文详解视觉Transformer
微信公众号 2026-02-10 00:00:00
72. 你的Vision Transformer可能训错了!LaSt-ViT让模型真正"看懂"前景,CVPR 2026最新研究揭示ViT训练缺陷,提出统一解决方案
微信公众号 2026-04-03 00:00:00
73. TPAMI 2026 | 视觉 Transformer 再进化!中科院赫然团队推出 EVT
微信公众号 2026-04-16 00:00:00
74. 从分类到语义,从 ViT 到 CLIP——ViT 的局限
微信公众号 2026-05-12 00:00:00
75. 记录每天的学习内容2026.3.8--简单了解transformer在视觉上的发展(AI总结),与ai问答全部对话在https://github.com/101per/learning.git
知乎 2026-03-08 00:00:00
76. 告别CNN局限!ViT/DETR/SETR/CLIP等经典模型,正在重构CV建模全逻辑
微信公众号 2026-02-04 00:00:00
77. 碾压CNN?机器人视觉Transformer核心代码,我们开源了。。。
微信公众号 2026-02-09 00:00:00
78. 网络变形请注意(6)
微信公众号 2025-12-18 00:00:00
79. NeurIPS 2025|清华北大团队开源VCA模块,即插即用,让视觉AI“抓重点”既快又准
知乎 2025-11-26 00:00:00
80. Transformer综述(A Survey on Vision Transformer) 阅读学习笔记(三)--Transformer应用的图像处理与视频处理的研究
81. 多模态大模型的基石-ViT速览
微信公众号 2025-12-08 00:00:00
82. NaViT:适用于任意分辨率的视觉Transformer
微信公众号 2025-12-14 00:00:00
83. 理解并微调 Vision Transformer,这篇万字长文讲透了
微信公众号 2026-03-24 00:00:00
84. Swin-TransFormer论文阅读笔记
知乎 2026-02-01 00:00:00
85. 字节大模型应用开发二面:请详细解释一下 Transformer 模型中的自注意力机制是如何工作的?它为什么比 RNN 更适合处理长序列?
知乎 2026-03-11 00:00:00
86. YOLO26全网首发创新:TPAMI 2026重磅创新 | 自适应稀疏自注意力机制强势来袭,让特征聚合更高效!
知乎 2026-04-15 00:00:00
87. 视觉Transformer (Vision Transformer, ViT)
知乎 2026-05-12 00:00:00
88. CVPR 2026 | 你的ViT可能训错了!LaSt-ViT:让模型真正"看懂"前景
微信公众号 2026-04-05 00:00:00
89. CNN已过时?1小时搞懂VIT,AI视觉新霸主! 🚨 还在死磕CNN?做计算机视觉研究,你必须要懂VIT了! 它不仅是顶会标配,更是论文创新的源头活水。 这个视频,帮你彻底搞懂VIT: 1️⃣ 核心思想:如何把图像当成一句话,让Transformer“读懂”? 图像切块(Patch)具体怎么操作? 位置编码如何用在图像上? 2️⃣ 代码实战(附可跑通源码) 手把手带你从零写一个简易VIT 配置环境常见坑点全避开 3️⃣ 论文/项目怎么用? 发论文:VIT作为backbone,怎么改出创新点? 做项目:用VIT做图像分类,效果到底比CNN强在哪? 📦 看完视频,你立刻能带走: ✅ 逐行注释的VIT代码(PyTorch版) ✅ VIT与CNN的详细对比实验报告 ✅ 5个VIT改进创新点方向 👉 关注我+评论区扣“已关,求”自动发资料包
抖音 2025-12-19 00:00:00
90. CLIP范式已死!字节发布GenLIP | 砍掉解码器与对比学习,让ViT直接开口说话,效果反而更强
微信公众号 2026-05-07 00:00:00
91. 自注意力机制:让AI学会"读懂上下文"的核心算法,到底如何运作?
微信公众号 2026-05-03 00:00:00
92. 基于改进小目标实时检测Transformer 的研究与应用之研究展望
微信公众号 2025-12-07 00:00:00
93. 别让ViT算全量Token了!LLaVA-UHD v4把Token压缩塞进ViT第6层,高分辨率多模态终于不卡了
微信公众号 2026-05-16 00:00:00
94. 王炸方向!目标检测+Transformer连中顶会,实时DETR思路速学!
微信公众号 2026-05-07 00:00:00
95. 避坑指南|主流视觉Transformer模型优劣势深度横评
微信公众号 2026-02-05 00:00:00
96. 没那么复杂,用PyTorch手撕一个Vision Transformer(ViT)模型(连载2:模型训练篇)
知乎 2026-02-16 00:00:00
97. DEIMv2 后的又一力作!英特灵达开源 EdgeCrafter:让轻量级 ViT 在边缘端密集预测强于YOLO系
知乎 2026-03-25 00:00:00
98. 视觉预训练系统讲解(一):根本问题、ViT 架构与对比学习
知乎 2026-04-26 00:00:00
99. 难绷,原来ViT模型一直在用背景做分类啊?
小红书 2026-04-24 00:00:00
100. ViT家族再添猛将 | Tiny-ViT 轻量化ViT突破边缘算力瓶颈
微信公众号 2026-04-03 00:00:00
101. 必知必会:高效注意力机制——Sparse Attention与Linear Attention详解
知乎 2026-05-13 00:00:00
102. 在VIT模型中加强原始图片细节特征的方案
知乎 2026-03-27 00:00:00
103. VIT架构简析
知乎 2026-01-14 00:00:00
104. 高效自注意力机制
知乎 2026-01-08 00:00:00
105. 重庆大学周喜川、赵思桓等丨TP-ViT:面向视觉Transformer量化的截断均匀对数量化器与渐进式比特衰减重建方法丨EITEE
微信公众号 2026-04-28 00:00:00
106. 计算机视觉Transformer-2 目标检测
知乎 2025-12-28 00:00:00
107. AI算法面试:ViT怎么预训练
微信公众号 2026-01-26 00:00:00
108. CLIP原理以及实现心得
知乎 2026-03-12 00:00:00
109. 为视觉建模注入物理灵魂:WaveFormer证明,下一站是“物理启发模型”
微信公众号 2026-02-03 00:00:00
110. 计算机视觉Transformer-1 基础结构
知乎 2025-12-26 00:00:00
111. 基于Transformer的视觉识别算法(Vision Transformer详解)
知乎 2026-03-25 00:00:00
112. 视觉基础模型深度笔记:DINO、MAE、SAM
知乎 2026-03-26 00:00:00
113. 深度学习实战-基于CNN和VIT的乳腺癌图像分类识别模型
知乎 2026-01-27 00:00:00
114. ViT真在看目标吗?港大中大团队揭开背景捷径之谜
知乎 2026-04-17 00:00:00
115. 视觉Transformer(ViT)
知乎 2026-03-12 00:00:00
116. 让视觉模型学会“回头看”:一种增强ViT的沉浸式信息注入机制
知乎 2026-03-28 00:00:00
117. ViT-AdaLA 让大视觉模型“瘦身”跑得更快 | 90%计算量砍掉,精度反升2.1%!
微信公众号 2026-04-07 00:00:00
已收藏
去我的收藏夹