AI发展史(四):突破——AlexNet与深度学习革命

一
2012年10月,意大利佛罗伦萨。
国际计算机视觉大会的会场里,一位名叫亚历克斯·克里泽夫斯基的年轻研究者走上讲台。他身后的大屏幕上显示着一个叫“AlexNet”的神经网络架构。他要在接下来的十分钟里,向在场的研究者解释一件事:为什么他的模型在ImageNet图像识别大赛中,以超过第二名10个百分点的成绩夺冠。
ImageNet是计算机视觉领域最权威的评测。它包含超过100万张标注图像,涵盖1000个类别。参赛者需要训练模型,让它在这些图像上尽可能准确地识别物体。2012年之前,最好的系统错误率约为26%。AlexNet的错误率是15.3%。
这个差距有多大?在竞赛的历史上,每一年进步通常在1到2个百分点。AlexNet把进步速度提高了五倍。
更关键的是,AlexNet用的是深度学习。它是一颗深度卷积神经网络,包含6000万个参数、65万个神经元、5个卷积层和3个全连接层。它不依赖人工设计的特征——传统的图像识别系统需要人类专家手动设计特征(边缘、纹理、形状),然后把这些特征输入分类器。AlexNet直接从原始像素学习特征。
克里泽夫斯基在演讲中展示了AlexNet学到的特征。第一层学到了边缘和颜色斑块,第二层学到了纹理和简单形状,第三层学到了物体部件,第四层和第五层学到了完整的物体。这个层次结构,与人类视觉皮层的处理方式惊人地相似。
演讲结束后,整个计算机视觉界沉默了。然后,所有人都开始转向深度学习。
二
AlexNet的成功,不是偶然。
它的两个关键人物——辛顿和克里泽夫斯基——都不是计算机视觉领域的专家。辛顿是认知心理学家出身,研究神经网络四十年。克里泽夫斯基是他的学生,当时还是本科生。他们参赛的动机很简单:证明深度学习能解决实际问题。
但AlexNet的成功,依赖三个条件同时满足。
第一个条件是数据。ImageNet在2009年发布,包含超过1400万张标注图像。这是计算机视觉领域第一个大规模标注数据集。在此之前,研究者只能使用几千到几万张图像的小数据集。神经网络需要大量数据才能发挥优势,小数据集上容易过拟合。
第二个条件是算力。克里泽夫斯基用了两块英伟达GTX 580 GPU训练AlexNet。这两块游戏显卡的算力,超过了他实验室里所有CPU的总和。训练一个AlexNet需要五到六天。如果用CPU训练,需要几个月。
GPU的并行计算能力,恰好匹配神经网络的矩阵运算需求。英伟达在2006年推出的CUDA平台,让研究者可以用GPU进行通用计算。这个平台在2006年时没有引起AI界的注意,但到了2012年,它成了深度学习训练的基础设施。
第三个条件是算法。AlexNet用了多项技术突破:ReLU激活函数解决了梯度消失问题;Dropout正则化防止过拟合;数据增强扩充训练集;双GPU并行训练加速计算。这些技术中,有些是辛顿团队发明的,有些是其他研究者提出但未被广泛使用的。
数据、算力、算法——三件事同时成熟,深度学习革命才得以爆发。
三
AlexNet之后,深度学习以惊人的速度渗透到AI的每一个领域。
2013年,辛顿加入谷歌,谷歌开始大规模使用深度学习改进搜索、广告和翻译。2014年,Facebook成立AI研究院,杨立昆担任院长。2015年,微软在ImageNet竞赛中把错误率降到了3.57%,首次低于人类的5.1%。2016年,谷歌的AlphaGo以4比1击败围棋世界冠军李世石。2017年,Transformer架构发表,成为大语言模型的基础。2020年,GPT-3发布,参数量达到1750亿。2022年,ChatGPT发布。
每一步突破,都建立在AlexNet开创的路径上:用深度神经网络从大量数据中学习,用GPU加速训练,用更多数据和更多算力持续提升性能。
但AlexNet的成功也带来了一些被忽视的问题。
第一个问题是可解释性。AlexNet有6000万个参数,没有人能解释这些参数的含义。深度学习模型是“黑箱”,输入图像、输出标签,中间过程无法被人类理解。这在医疗、金融、司法等高风险领域引发了担忧。
第二个问题是数据依赖。深度学习需要大量标注数据,而标注数据的成本很高。ImageNet用了数万人年进行标注。在很多领域,获得足够的高质量标注数据是瓶颈。
第三个问题是泛化能力。深度学习模型在训练数据上表现优异,但在新场景中容易出错。一个在晴天图像上训练的自动驾驶模型,在雨天可能完全失效。
这些问题至今没有被完全解决。但它们没有阻止深度学习的扩张。
四
AlexNet的故事,还有一个被忽视的细节。
克里泽夫斯基参加ImageNet竞赛时,并没有告诉他的导师辛顿。他用辛顿实验室的两块GPU,在业余时间训练了模型。当他把结果发给辛顿的时候,辛顿回了一封简短的邮件:“这太不可思议了。”
辛顿后来回忆说:“我当时就知道,我们赢了。不是AlexNet赢了,是深度学习赢了。”他的判断是对的。AlexNet之后,深度学习从“边缘方法”变成了“主流方法”。计算机视觉会议上的论文,从“偶尔提到神经网络”变成了“几乎全部是神经网络”。
2012年之后,深度学习的人才争夺战开始了。谷歌、Facebook、微软、百度在全球范围内争抢深度学习研究者。辛顿的公司DNNresearch被谷歌收购,杨立昆加入Facebook,本吉奥留在学术界但成为多家公司的顾问。深度学习研究者的薪资在两年内翻了数倍。
五
2018年,辛顿、杨立昆和本吉奥获得图灵奖。
图灵奖是计算机领域的最高荣誉。三巨头的获奖,标志着深度学习从边缘走向主流。在获奖演说中,辛顿说了一句话:“我们花了三十年才让这个领域被接受,但真正的突破才刚刚开始。”
这句话在四年后得到了验证。2022年11月,OpenAI发布ChatGPT。这个基于GPT-3.5的对话模型,在两个月内吸引了超过1亿用户,成为历史上增长最快的消费应用。
ChatGPT的底层技术——Transformer、自注意力机制、大规模预训练——都源自深度学习的研究传统。从AlexNet到ChatGPT,只用了十年。但从反向传播到AlexNet,用了二十六年。
这二十六年里,辛顿在多伦多大学的办公室里坚持研究神经网络,杨立昆在贝尔实验室开发LeNet,本吉奥在蒙特利尔大学研究注意力机制。他们不知道自己的研究什么时候会被认可,也不知道需要多少年才能看到突破。
他们只是相信,神经网络是理解智能的正确路径。
六
AlexNet之后,深度学习的发展呈现出一个规律:每一次突破,都需要三个条件同时满足。
数据、算力、算法。AlexNet的突破依赖ImageNet、GTX 580和ReLU。Transformer的突破依赖海量文本、TPU和自注意力。GPT-3的突破依赖更大的文本、更多的GPU和更大的参数量。ChatGPT的突破依赖人类反馈数据和RLHF算法。
每一次突破,都建立在前一次突破的基础上。AlexNet解决了“图像识别”的问题,Transformer解决了“序列建模”的问题,GPT-3解决了“零样本学习”的问题,ChatGPT解决了“对齐人类偏好”的问题。
问题在变化,方法论在迭代,但底层的逻辑没有变:用更多的数据、更强的算力、更好的算法,持续逼近智能的边界。
AlexNet是这个持续逼近过程中的一个关键节点。它不是终点,是起点。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
