张大妈

清华姚班校友刘壮团队再发力,无需归一化的Transformer性能进化

源自公众号:机器之心

01-23 19:09

清华姚班校友刘壮团队提出Derf层,让无需归一化的Transformer实现训练稳定且性能超越传统模型。这一发现挑战了LayerNorm作为Transformer标配的认知,为构建更高效AI架构提供了新思路。

清华姚班校友刘壮团队再发力,无需归一化的Transformer性能进化智能速览

  • Derf层实现无需归一化的Transformer稳定训练

  • 多项实验显示Derf性能超越LayerNorm

  • 结构简单的逐点函数设计易于部署

  • 在ViT、DiT、语音、DNA等多领域验证有效

  • Derf优势源于更好泛化而非更强拟合

清华姚班校友刘壮团队再发力,无需归一化的Transformer性能进化精华内容

Derf的出现标志着无需归一化Transformer研究的重要突破。这种结构简单的激活层不仅解决了训练不稳定问题,还在多项任务中实现了性能超越。

技术突破

Derf(Dynamic erf)是一种结构极其简单的逐点层,直接替换Transformer中的LayerNorm位置。它不依赖激活分布的统计信息,仅需少量可学习参数:位移参数s和缩放参数α作为可学习标量,γ和β作为可学习逐通道向量。

这种设计让无归一化Transformer首次实现稳定训练,同时性能超越传统架构。Derf本质上是平移并缩放后的高斯误差函数,保持了计算效率的同时提升了模型表现。

设计原则

研究团队通过系统性实验发现,优秀的逐点函数需同时满足四个条件:零中心性、有界性、中心敏感性和单调性。满足这些条件的函数能让模型训练更稳定并取得更好性能。

基于这一发现,Derf被设计为最优的函数形式。它与标准高斯分布的累积分布函数密切相关,在数学特性上天然适合替代归一化层,为无归一化Transformer提供了明确的设计指导。

多域验证

在ImageNet-1K上,ViT-Base和ViT-Large使用Derf的Top-1准确率均超过LayerNorm。扩散TransformerDiT系列的FID分数更低,表明图像生成质量提升。

语音任务中,wav2vec 2.0在LibriSpeech数据集上的验证损失降低。DNA模型HyenaDNA和Caduceus在GenomicBenchmarks上的分类准确率提升。这些结果证明Derf具有强大的跨领域泛化能力。

性能解析

令人意外的是,Derf的优势并非来自更强的拟合能力。在训练集上,基于归一化的模型损失更低,但Derf在测试集上表现更好。这证明Derf的主要价值在于提升泛化能力而非过拟合。

在语言模型任务中,GPT-2(124M)使用Derf的表现与LayerNorm持平,明显优于之前的DyT方案。一个足够简单的逐点层,不仅能够替代归一化层,还能让Transformer变得更强。

Derf为Transformer架构演进提供了新选择,证明简单设计也能实现高性能突破。随着无归一化Transformer的不断成熟,AI模型架构将迎来更多创新可能。这一发现是否会改变未来大模型的设计方向?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章