很多人误以为SDXL只是SD1.5的简单升级,但其底层架构与工作逻辑已发生根本性变化。本文旨在厘清SDXL与SD1.5的核心区别,并详细展示如何搭建一个能发挥其100%功力的完全体工作流,助你生成更高质量的图像。

智能速览
SDXL采用双模型架构,含Base构图和Refiner精修模型。
SDXL原生支持1024x1024分辨率,突破SD1.5的512x512限制。
SDXL的双文本编码器大幅提升了对自然语言提示词的理解。
搭建完全体工作流需串联Base生图与Refiner修图两个阶段。
通过高级K采样器,可精确分配40步中前30步用于生图,后10步用于精修。
SDXL的生态系统虽在快速发展,但部分插件仍仅兼容SD1.5。
精华内容
理解SDXL与SD1.5的根本不同,是构建高效工作流的第一步。接下来,将深入解析如何搭建一个能发挥其全部实力的完全体工作流。
架构与数据差异
SD1.5是单一Unet模型架构,而SDXL是Base模型(负责构图)和Refiner模型(负责精修)的双模型架构,可理解为自带了“后期美颜”功能。
在训练数据上,SD1.5基于512x512图像集训练,生成更大尺寸图片时易出现肢体错乱。SDXL则基于1024x1024图像集训练,能直接生成高分辨率图片,这是两者最直观的区别。
语言理解飞跃
文本编码器的不同决定了模型对提示词的理解能力。SD1.5使用单一的CLIP模型,对复杂自然语言的理解能力较差,更擅长识别“标签式”短词。
SDXL则采用了CLIP-L与CLIP-G双模型文本编码器,极大增强了对自然语言提示词的识别能力,允许用户用更日常的语句进行创作,从而提升了出图的准确性和艺术表现力。

双阶段工作流逻辑
在ComfyUI中,SDXL可以在SD1.5的基础文生图工作流中运行,但这仅能发挥其约80%的性能。要发挥全部潜力,必须采用其专属的双阶段工作流。
该逻辑分为两部分:首先由Base模型根据提示词生成图像的基础构图和内容,然后将其传递给Refiner模型进行细节的优化和修复,实现“先生图、后精修”的流程,最终获得细节更丰富的图片。

节点配置详解
搭建完全体工作流需掌握几个关键节点。首先是“CLIP文本编码器SDXL”,它有两个输入框:CLIP_G用于自然语言提示词,CLIP_L用于标签式词组,通过双重限定提升理解度。
其次是“K采样器(高级)”,它通过“添加噪波”“开始降噪步数”“结束降噪步数”等参数来划分工作。例如,在40步总流程中,可设置Base模型在0至30步生成图像并启用“返回噪波”,然后将噪波传递给Refiner模型,后者在30至40步进行精修并禁用“添加噪波”,从而实现无缝衔接。

掌握SDXL并非简单替换模型,而是理解其双模型协同工作的全新范式。通过搭建完全体工作流,能够充分利用其在分辨率、语言理解和细节表现上的优势。随着技术的迭代,未来的AI绘画模型又会带来哪些新的挑战与可能?