张大妈

多模态方向岂不是同时得学nlp和cv?

源自知乎:第欧根尼

03-04 12:32

多模态技术正重塑AI理解世界的方式。通过将文本、图像、声音等信息映射到统一的语义空间,AI能够实现跨模态的理解与推理。这不仅是技术突破,更打开了通往通用人工智能的大门。

多模态方向岂不是同时得学nlp和cv?智能速览

  • 当前多模态技术以文本霸权为主导,其他模态向文本对齐

  • CLIP通过对比学习构建图像与文本的联合语义空间

  • L2归一化将不同模态数据映射到单位超球面

  • ViT将图像切块伪装成文本Token处理

  • ImageBind实现了六大模态的统一融合

  • 所有信息最终可映射到黎曼流形的统一坐标

多模态方向岂不是同时得学nlp和cv?精华内容

多模态技术的核心在于模态对齐,不同信息如何在一个统一空间里找到彼此的语义对应关系,这决定了AI的跨模态理解能力。

文本霸权现象

目前的多模态架构普遍采用文本霸权模式,即以文本模态为基准,让其他模态向文本对齐。这种选择并非偶然。语言的离散性使其天然适合作为优化目标,梯度下降更容易收敛。从几何形态看,离散的文本界限分明,而连续的图像边界模糊。从信息纯度上,文本比图像包含更多信号。这就是CLIP和大模型都选择文本为基准的根本原因。

杨立昆的JEPA则走视觉霸权路线,用视觉模态来融合其他模态,这代表了另一种技术路径。

CLIP融合机制

CLIP通过两台巨大的几何液压机实现模态融合。图像刺球和文本刺球分别经过投影矩阵处理,压缩或拉伸至统一的512维。这个过程好比图像中"棕色像素+毛茸茸纹理+四条腿"的组合,与文本中"一只棕色小狗"的组合,都在"狗概念"维度上输出高分。

L2归一化进一步处理,将所有数据点映射到单位球面,剥离强度只保留语义方向。原本长短不一的刺球变成了绝对光滑的512维超球面。

对比学习威力

对比损失函数是CLIP的终极引擎。用4亿对"图片+文字说明"训练数据,强迫模型学习图文对应关系。最终,"柯基"的文字点与图片点在联合语义空间中形成稳定关联。

这种架构的威力体现在后续扩展中:CLAP融合声音与文本,ULIP连接3D模型与文本,ImageBind更是将图像、文本、音频、深度图、热成像、IMU六大模态统一。用IMU传感器数据就能检索到"狗在草地上狂奔"的视频,展示了惊人的跨模态检索能力。

ViT图像处理

ViT革命性地将图像切块伪装成文本。一张224×224像素的图片被切成196个16×16像素的小方块,每个方块拉直成768维向量。通过线性投影层转换为文本Token格式,再添加位置编码告诉模型每个方块的位置。

关键在于CLS Token,它在196个切片之外形成全局表示。经过与D维矩阵相乘,CLS Token就变成了CLIP中那个代表特定概念的向量点。

统一处理范式

GPT-4V的诞生标志着多模态处理的新阶段。将"图片Token序列"和"文字Prompt序列"首尾相连,直接输入GPT-4训练。这意味着图像数据被当作另一种文本来处理。

这种统一范式极大简化了多模态训练。不需要专门的跨模态架构,只需将不同模态数据转换为Token格式,就能利用成熟的语言模型框架。这是工程上的重大突破,让多模态技术更容易落地应用。

多模态技术的演进指向一个深刻洞察:所有人类感知信息,经过神经网络压缩后都能在统一空间找到坐标。这不仅是技术进步,更是对柏拉图"理型世界"的现代诠释。随着算力增长和数据丰富,AI将越来越接近那个统一的语义空间,真正的通用人工智能或许就在这条路的尽头。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章