清华姚班校友刘壮团队提出Derf层,让无需归一化的Transformer实现训练稳定且性能超越传统模型。这一发现挑战了LayerNorm作为Transformer标配的认知,为构建更高效AI架构提供了新思路。
智能速览
Derf层实现无需归一化的Transformer稳定训练
多项实验显示Derf性能超越LayerNorm
结构简单的逐点函数设计易于部署
在ViT、DiT、语音、DNA等多领域验证有效
Derf优势源于更好泛化而非更强拟合
精华内容
Derf的出现标志着无需归一化Transformer研究的重要突破。这种结构简单的激活层不仅解决了训练不稳定问题,还在多项任务中实现了性能超越。
技术突破
Derf(Dynamic erf)是一种结构极其简单的逐点层,直接替换Transformer中的LayerNorm位置。它不依赖激活分布的统计信息,仅需少量可学习参数:位移参数s和缩放参数α作为可学习标量,γ和β作为可学习逐通道向量。
这种设计让无归一化Transformer首次实现稳定训练,同时性能超越传统架构。Derf本质上是平移并缩放后的高斯误差函数,保持了计算效率的同时提升了模型表现。
设计原则
研究团队通过系统性实验发现,优秀的逐点函数需同时满足四个条件:零中心性、有界性、中心敏感性和单调性。满足这些条件的函数能让模型训练更稳定并取得更好性能。
基于这一发现,Derf被设计为最优的函数形式。它与标准高斯分布的累积分布函数密切相关,在数学特性上天然适合替代归一化层,为无归一化Transformer提供了明确的设计指导。
多域验证
在ImageNet-1K上,ViT-Base和ViT-Large使用Derf的Top-1准确率均超过LayerNorm。扩散TransformerDiT系列的FID分数更低,表明图像生成质量提升。
语音任务中,wav2vec 2.0在LibriSpeech数据集上的验证损失降低。DNA模型HyenaDNA和Caduceus在GenomicBenchmarks上的分类准确率提升。这些结果证明Derf具有强大的跨领域泛化能力。
性能解析
令人意外的是,Derf的优势并非来自更强的拟合能力。在训练集上,基于归一化的模型损失更低,但Derf在测试集上表现更好。这证明Derf的主要价值在于提升泛化能力而非过拟合。
在语言模型任务中,GPT-2(124M)使用Derf的表现与LayerNorm持平,明显优于之前的DyT方案。一个足够简单的逐点层,不仅能够替代归一化层,还能让Transformer变得更强。
Derf为Transformer架构演进提供了新选择,证明简单设计也能实现高性能突破。随着无归一化Transformer的不断成熟,AI模型架构将迎来更多创新可能。这一发现是否会改变未来大模型的设计方向?