文心一言5.0作为下一代统一多模态基础模型,摒弃了传统模态拼接方式,实现了端到端的文本、图像、音频、视频统一建模。这份技术报告揭示了万亿参数MoE架构背后的创新设计,为多模态大模型发展提供了重要参考。
智能速览
ERNIE 5.0实现纯端到端多模态统一建模
采用万亿参数超稀疏MoE架构
提出下一帧与比例预测视觉生成范式
创新弹性训练策略支持多尺寸模型部署
引入U-RB等多模态强化学习优化技术
精华内容
深入ERNIE 5.0的技术内核,可以发现其在多模态统一建模、训练优化和部署灵活性方面的系统性创新,这些技术突破为构建更强大的通用人工智能模型奠定了基础。
统一多模态架构
ERNIE 5.0的核心突破在于从零开始将文本、图像、音频、视频映射到统一Token空间。与传统文本模型挂载其他模态解码器的做法不同,该模型采用单一自回归框架,通过"下一组Token预测"目标进行优化。万亿参数规模的混合专家模型(MoE)不按模态分发Token,而是基于Token语义特征进行路由,实现真正的多模态融合。
视觉分词创新
针对视觉模态,ERNIE 5.0提出了因果2D多尺度分词器,通过膨胀操作扩展为3D卷积分词器,统一图像和视频处理。训练期间采用渐进式分词器切换策略,从低位分词器(小词表)逐步过渡到高位变体(大词表),有效缓解早期训练不稳定性。按位量化策略将视觉潜变量量化为位代码,位的数量直接对应离散词表大小。
音频建模突破
音频信号被表示为层次化离散编解码器Token,Token频率为12.5Hz。采用残差向量量化设计,第一个Token编码高层音频语义,其余Token编码递进细节的残差声学信息。从Whisper模型进行知识蒸馏,确保第一个Token捕捉丰富语义信息。基于下一编解码预测(NCP)范式,实现从粗到精的音频生成。
弹性训练策略
首次在预训练阶段引入弹性训练,同时优化子网络家族,使单一大模型能产出多种可部署变体。在深度、宽度、稀疏度三个维度引入结构灵活性:75%概率使用全深度网络,25%采样较浅子网络;80%概率激活全部专家,20%限制在专家子集;80%概率应用默认路由配置,20%随机采样Top-K值。
强化学习优化
为解决多模态RL训练挑战,引入多项创新技术。U-RB通过动态划分推理池和训练池,防止因长样本导致的计算空闲。MISC技术修改为token级重要性采样,避免策略熵崩塌。WPSM策略防止模型在已掌握查询上过度优化。AHRL注入部分提示,将复杂问题分解为中间步骤,缓解稀疏奖励问题。
ERNIE 5.0的技术创新为多模态大模型发展提供了新思路。统一架构、弹性训练和RL优化等突破,不仅提升了模型性能,更为实际部署带来了灵活性。这些技术实践对未来AGI模型的构建具有重要启示意义。