多模态技术正重塑AI理解世界的方式。通过将文本、图像、声音等信息映射到统一的语义空间,AI能够实现跨模态的理解与推理。这不仅是技术突破,更打开了通往通用人工智能的大门。
智能速览
当前多模态技术以文本霸权为主导,其他模态向文本对齐
CLIP通过对比学习构建图像与文本的联合语义空间
L2归一化将不同模态数据映射到单位超球面
ViT将图像切块伪装成文本Token处理
ImageBind实现了六大模态的统一融合
所有信息最终可映射到黎曼流形的统一坐标
精华内容
多模态技术的核心在于模态对齐,不同信息如何在一个统一空间里找到彼此的语义对应关系,这决定了AI的跨模态理解能力。
文本霸权现象
目前的多模态架构普遍采用文本霸权模式,即以文本模态为基准,让其他模态向文本对齐。这种选择并非偶然。语言的离散性使其天然适合作为优化目标,梯度下降更容易收敛。从几何形态看,离散的文本界限分明,而连续的图像边界模糊。从信息纯度上,文本比图像包含更多信号。这就是CLIP和大模型都选择文本为基准的根本原因。
杨立昆的JEPA则走视觉霸权路线,用视觉模态来融合其他模态,这代表了另一种技术路径。
CLIP融合机制
CLIP通过两台巨大的几何液压机实现模态融合。图像刺球和文本刺球分别经过投影矩阵处理,压缩或拉伸至统一的512维。这个过程好比图像中"棕色像素+毛茸茸纹理+四条腿"的组合,与文本中"一只棕色小狗"的组合,都在"狗概念"维度上输出高分。
L2归一化进一步处理,将所有数据点映射到单位球面,剥离强度只保留语义方向。原本长短不一的刺球变成了绝对光滑的512维超球面。
对比学习威力
对比损失函数是CLIP的终极引擎。用4亿对"图片+文字说明"训练数据,强迫模型学习图文对应关系。最终,"柯基"的文字点与图片点在联合语义空间中形成稳定关联。
这种架构的威力体现在后续扩展中:CLAP融合声音与文本,ULIP连接3D模型与文本,ImageBind更是将图像、文本、音频、深度图、热成像、IMU六大模态统一。用IMU传感器数据就能检索到"狗在草地上狂奔"的视频,展示了惊人的跨模态检索能力。
ViT图像处理
ViT革命性地将图像切块伪装成文本。一张224×224像素的图片被切成196个16×16像素的小方块,每个方块拉直成768维向量。通过线性投影层转换为文本Token格式,再添加位置编码告诉模型每个方块的位置。
关键在于CLS Token,它在196个切片之外形成全局表示。经过与D维矩阵相乘,CLS Token就变成了CLIP中那个代表特定概念的向量点。
统一处理范式
GPT-4V的诞生标志着多模态处理的新阶段。将"图片Token序列"和"文字Prompt序列"首尾相连,直接输入GPT-4训练。这意味着图像数据被当作另一种文本来处理。
这种统一范式极大简化了多模态训练。不需要专门的跨模态架构,只需将不同模态数据转换为Token格式,就能利用成熟的语言模型框架。这是工程上的重大突破,让多模态技术更容易落地应用。
多模态技术的演进指向一个深刻洞察:所有人类感知信息,经过神经网络压缩后都能在统一空间找到坐标。这不仅是技术进步,更是对柏拉图"理型世界"的现代诠释。随着算力增长和数据丰富,AI将越来越接近那个统一的语义空间,真正的通用人工智能或许就在这条路的尽头。