Qwen-Image 模型架构复杂,现有讲解多停留在高层概念,令初学者难以入门。这篇内容旨在填补这一空白,通过代码级拆解,详细剖析其核心组件与创新设计,帮助理解其如何实现高保真度的文本到图像生成。
智能速览
Qwen-Image 架构由 MLLM、VAE 和 MMDiT 三大核心组件构成。
其 MMDiT 架构与 Stable Diffusion 3 相似,但拥有更深的 60 层结构。
创新的 MSRoPE 位置编码方案有效解决了多模态对齐难题。
因果卷积等设计保留了其视频模型的遗产,为未来视频生成奠定基础。
精华内容
要真正理解 Qwen-Image 的强大,必须深入其内部,探究每个模块如何协同工作。本文将逐一解析其核心组件,揭示其设计巧思与实现细节。
三大核心组件
Qwen-Image 的架构建立在三个核心组件之上。首先是多模态大型语言模型(MLLM),即 Qwen2.5-VL,它作为条件编码器,负责从文本中提取特征,其语言和视觉空间已对齐,更适合文本到图像任务。
其次是变分自编码器(VAE),它作为图像标记器,将图像压缩到潜在空间。该 VAE 源自阿里的 Wan-2.1 视频模型,采用 16 通道和 8 倍下采样,但冻结了编码器,仅微调了图像解码器以提升细节还原能力。
第三是多模态扩散变换器(MMDiT),这是模型的骨干,负责在文本指导下对噪声和图像潜变量进行联合建模。
骨干模型 MMDiT
Qwen-Image 的 MMDiT 是一个拥有 60 层的巨大模型,其设计与 Stable Diffusion 3 非常相似,属于标准的双流架构。双流指图像(视觉 latents)和文本(提示嵌入)被并行处理,随后通过联合注意力机制实现跨模态信息融合。
在归一化策略上,模型在 QK-Norm 中使用了 RMSNorm,而在所有其他归一化层则采用 LayerNorm。这种设计选择旨在优化训练稳定性和模型性能。其庞大的层数和精巧的注意力机制是实现高质量生成的关键。
位置编码创新
为了解决文本和图像位置编码的协同问题,Qwen-Image 提出了一种新的位置编码方案 MSRoPE(Multimodal Scalable RoPE)。传统方法将文本 token 直接串联在图像 token 后,容易导致位置编码混淆,尤其是在进行分辨率缩放训练时。
MSRoPE 的创新之处在于,它将文本输入视为一个 2D 张量,在两个维度上应用相同的位置 ID,概念上相当于将文本沿着图像对角线进行串联。这种设计既利用了图像端的分辨率缩放优势,又保持了文本端与 1D-RoPE 的功能等效,巧妙地解决了多模态对齐难题。
视觉大一统设计
Qwen-Image 的一个显著目标是统一图像和视频模型。这从其 VAE 的选择和代码结构中可见一斑。它采用了 Wan-2.1-VAE 的单编码器、双解码器架构,用一个共享编码器处理图像和视频,再用各自的专用解码器还原,使图像模型能作为未来视频模型的骨干。
此外,代码中保留了用于视频处理的 QwenImageCausalConv3d(因果 3D 卷积)模块。这意味着图像可以被看作是时间帧为 1 的视频,这种设计为阿里实现视觉大一统的战略构想奠定了技术基础。
通过这次拆解,Qwen-Image 的技术轮廓变得清晰。它不仅吸收了现有先进模型的优点,更在多模态对齐和架构统一性上做出了创新。这种为视觉大一统所做的铺垫,或许预示着下一代多模态模型的演进方向。