AI发展史(五):注意力革命——从Transformer到GPT

AI发展史(五):注意力革命——从Transformer到GPT

2026-10-09 21:33:22 0点赞 0收藏 0评论
AI发展史(五):注意力革命——从Transformer到GPT

一

2017年6月,谷歌大脑团队发表了一篇论文。

论文标题是《Attention Is All You Need》,翻译过来是“你需要的只是注意力”。作者列表中有八个人:Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Łukasz Kaiser、Illia Polosukhin。

这篇论文提出了一种新的神经网络架构:Transformer。它完全抛弃了循环和卷积,只用一个叫“自注意力”的机制来处理序列数据。

在Transformer之前,处理文本序列的主流方法是循环神经网络和长短期记忆网络。这些网络按顺序处理每个词,每个词的处理依赖于前一个词的输出。这种顺序处理有两个问题:第一,无法并行计算,训练速度慢;第二,长距离依赖难以捕捉,前面的信息传到后面容易丢失。

Transformer用自注意力机制解决了这两个问题。自注意力允许模型在处理每个词时,同时关注序列中的所有其他词,计算它们之间的关联强度。这个过程可以并行计算,而且不受距离限制。

论文发表时,Transformer主要用于机器翻译。但它的影响远远超出了翻译领域。在接下来的五年里,Transformer成为几乎所有大语言模型的基础架构。GPT、BERT、Claude、Gemini、DeepSeek——所有你能想到的大模型,都建立在Transformer之上。

二

注意力机制不是Transformer发明的。

2014年,本吉奥团队在论文《Neural Machine Translation by Jointly Learning to Align and Translate》中提出了注意力机制。这篇论文解决的问题是:在机器翻译中,如何让模型在生成每个目标词时,关注源语言句子中的相关部分。

传统的编码器-解码器架构把整个源句子压缩成一个固定长度的向量,然后从这个向量生成目标句子。当句子很长时,这个固定向量无法容纳所有信息。注意力机制允许解码器在每一步“查看”编码器的所有隐藏状态,动态决定关注哪些部分。

这个思想被证明极其有效。注意力机制迅速成为机器翻译的标准配置。2015年,Luong等人提出了多种注意力变体。2016年,谷歌的神经机器翻译系统全面采用注意力机制,翻译质量大幅提升。

但注意力机制仍然附着在循环神经网络上。Transformer的突破在于,它证明了注意力机制本身——不需要循环、不需要卷积——就足以处理序列数据。

“Attention Is All You Need”这个标题,既是一个技术声明,也是一个哲学声明。

三

Transformer论文发表时,谷歌大脑团队正在研究如何提高机器翻译的训练效率。Uszkoreit是论文作者之一,他后来回忆:“我们想用更多的计算来训练更大的模型,但循环网络的顺序处理是瓶颈。我们想知道,能不能去掉循环,只用注意力。”

这个想法在当时是激进的。循环网络被广泛认为是处理序列数据的自然选择,因为它们模仿了人类阅读的顺序。去掉循环意味着放弃“顺序性”这个直觉假设。

但Transformer的作者们用实验证明,去掉循环不仅可行,而且更好。Transformer在WMT 2014英德翻译任务上达到28.4 BLEU分,超过此前最佳结果2个BLEU分。训练成本只有此前方案的几分之一。

更关键的是,Transformer的可扩展性极强。循环网络在序列长度增加时,计算复杂度线性增长。自注意力机制的复杂度是序列长度的平方,但在实际训练中,因为可以并行计算,Transformer在GPU上的训练速度远快于循环网络。

这个可扩展性,为后续的大规模预训练铺平了道路。

四

2018年,OpenAI发表了GPT-1。

GPT-1是基于Transformer的生成式预训练模型。它的核心思想是:先用大量无标注文本预训练一个语言模型,然后在具体任务上微调。GPT-1有1.17亿参数,在多项自然语言理解任务上取得了当时最好的结果。

2019年,GPT-2发布,参数量增加到15亿。GPT-2展示了“零样本学习”的能力——模型可以在没有微调的情况下,完成一些它从未被训练过的任务。OpenAI最初因为担心滥用而推迟了GPT-2的完整发布,引发了关于AI安全的第一轮公开讨论。

2020年,GPT-3发布,参数量达到1750亿。GPT-3的“少样本学习”能力令人震惊——只需要几个示例,模型就能完成新任务。GPT-3还展示了代码生成、数学推理、创意写作等能力,这些能力在训练数据中并没有被明确教导。

2022年,InstructGPT和ChatGPT发布。ChatGPT在GPT-3.5基础上,通过人类反馈强化学习进行微调,让模型的输出更符合人类偏好。这个简单的改进,让ChatGPT从“技术演示”变成了“消费产品”。

2023年,GPT-4发布,参数量据传达到1.8万亿。GPT-4在多模态理解、复杂推理、专业考试等维度全面超越人类平均水平。

五

Transformer的成功,带来了一些意想不到的后果。

第一个后果是规模定律的发现。OpenAI的研究者发现,模型性能与参数量、数据量、计算量之间存在幂律关系。这意味着,只要增加规模,性能就能持续提升。这个发现直接导致了AI训练的“军备竞赛”——从GPT-1的1亿参数到GPT-4的1.8万亿参数,只用了五年。

第二个后果是注意力机制的效率问题。自注意力机制的复杂度是序列长度的平方。处理长文本时,计算量急剧上升。这催生了大量“高效注意力”研究——稀疏注意力、线性注意力、滑动窗口注意力等。2026年OPPO发布的Linear Attention端侧模型,就是这一研究方向的应用成果。

第三个后果是预训练范式的扩散。Transformer不仅用于语言,还被用于图像、视频、音频、蛋白质结构预测等领域。Vision Transformer成为计算机视觉的主流架构。AlphaFold用Transformer预测蛋白质结构。Sora用Transformer生成视频。

六

Transformer的成功,也带来了一个悖论。

论文标题说“你需要的只是注意力”,但实际上,注意力机制本身并没有解释为什么Transformer会如此成功。自注意力机制在数学上并不复杂——它就是一个加权求和,权重由查询和键的相似度决定。这个机制早在2014年就被提出了,但直到2017年才被证明能支撑大规模预训练。

Transformer的成功,更多来自它对并行计算的友好性。循环网络的顺序处理让GPU无法充分发挥并行计算能力,而自注意力的全连接结构天然适合GPU的矩阵运算。当训练数据足够多、模型足够大时,并行计算的优势就变得决定性。

换句话说,Transformer的成功不是“注意力机制的胜利”,是“注意力机制+GPU并行计算+海量数据”的组合胜利。这个组合让AI训练从“小步慢跑”变成了“大步快跑”。

七

从注意力机制到Transformer,从GPT-1到GPT-4,只用了不到十年。

但这十年不是从零开始的。注意力机制源于2014年本吉奥团队的机器翻译研究,Transformer源于谷歌大脑团队对训练效率的追求,GPT系列源于OpenAI对“规模定律”的探索。

每一步都建立在前一步的基础上,每一次突破都来自对前一步局限性的深刻理解。

2026年,Transformer仍然是主流架构。但研究者已经在探索下一代架构——状态空间模型、线性注意力、混合专家模型。没有人知道下一个“Attention Is All You Need”级别的突破会在哪里出现。

但有一件事是确定的:当它出现时,它一定是站在Transformer的肩膀上。

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松