音频Transformer(AST)是实现原生多模态模型的关键技术,它解决了AI如何理解连续声音信号的问题。通过借鉴傅里叶变换的核心思想,该方法将音频分解为一系列周期性片段,并逐步提取出机器可处理的特征向量,为声音与图像、文本的融合理解奠定了基础。
智能速览
音频信号通过采样被离散化成数字点,为后续处理做准备。
音频被切分成毫秒级的短帧,并通过加窗操作将其视为周期函数。
利用短时傅里叶变换和梅尔刻度映射,提取人耳敏感的频谱特征。
通过大量卷积核扫描特征矩阵,高效捕捉音频中的局部模式。
最终生成定长的音频嵌入向量,可无缝接入多模态大模型。
精华内容
音频Transformer如何将连续的声波,转化为AI可以理解的结构化数据?其核心在于将声音分解为一系列具有周期性特征的帧,并逐步提取有效信息。
声音的数字化与分帧
要让机器处理音频,首要任务是将其数字化。通常以44.1kHz的频率对原始音频信号进行采样,将连续的波形转换成一系列离散的数字点。
接着,将这些采样点切分成一个个极短的小段,称为“帧”,每帧时长约为23.22毫秒。直接切割会在帧的边缘产生不连续的断层,因此需要通过汉明窗等窗函数进行平滑处理,使每一帧的起点和终点都能自然过渡到零,从而在数学上近似为一个周期函数,为后续的频谱分析创造条件。
频谱特征提取
在将每一帧视为周期函数后,就可以运用傅里叶变换的原理来分析其频率构成。短时傅里叶变换(STFT)能够计算每个帧在不同频率上的能量分布,从而得到一个时频谱图。
然而,人耳对声音的感知并非线性,对低频的变化远比高频敏感。为了更贴近人类的听觉特性,需要引入梅尔刻度进行非线性映射。它将原始的频率维度(通常上千个)压缩至更能代表关键听觉信息的维度(如80个梅尔频段),最终形成一个T×80的梅尔音能矩阵,其中T代表音频的总帧数。
卷积扫描与特征编码
得到的梅尔音能矩阵包含了丰富的音频信息,但仍需进一步提炼。音频Transformer采用卷积神经网络(CNN)的思路,用大量预设的卷积核(例如512个16×80的卷积核)来扫描这个矩阵。
每个卷积核负责识别一种特定的音频模式,如特定音调或节奏。通过在矩阵上滑动卷积核,可以捕捉到局部的、细微的特征。这一过程会生成一个尺寸约为353×512的特征矩阵。随后,通过一个可学习的注意力压缩机制对这个矩阵进行降维和投影,生成一个高度浓缩的、能代表整段音频核心信息的向量。
构建多模态输入
经过上述步骤,原始音频被成功编码成一个定长的向量。这个向量如同图像或文本的嵌入向量一样,可以作为标准化的输入模块。
在构建多模态模型时,这个音频向量会与其他模态的特征向量(例如图像的512维特征)进行纵向拼接。同时,为了保留音频的时间顺序信息,还会为拼接后的矩阵注入位置编码。最终形成一个完整的输入矩阵,送入Transformer模型进行后续的跨模态交互与理解,实现AI“看图听声”的能力。
音频Transformer通过一套精密的流程,将复杂的声波信号解构为机器可读的结构化特征。它不仅是音频处理领域的一次技术革新,更是通往通用人工智能多模态感知能力的基石。未来,随着模型的不断优化,AI在声音理解、生成与交互方面将展现出怎样的潜力?