张大妈

《图生图(Img2Img):Stable Diffusion 的第一道分水岭——模型从哪里开始生成?》

源自公众号:进击的Jeremy

01-27 20:11

许多人将 Stable Diffusion 的图生图理解为在原图上继续绘制或增强细节,但这种认知并不准确。要真正掌握高级重绘技巧,关键在于理解其底层工作机制:输入图像在模型生成流程中究竟扮演什么角色,以及 denoise 参数如何精准控制重绘程度。本文将从原理层面剖析图生图,为后续的稳定创作建立坚实认知基础。

《图生图(Img2Img):Stable Diffusion 的第一道分水岭——模型从哪里开始生成?》智能速览

  • 图生图和文生图的核心区别在于采样的起始点不同。

  • 输入图像以 latent 形式参与生成,模型本身不“看图”。

  • Denoise 参数控制的是向输入 latent 注入的噪声强度。

  • 低 denoise 值实现质量修复,高 denoise 值则趋向于完全重绘。

  • KSampler 控制着生成的起点、过程和约束力。

《图生图(Img2Img):Stable Diffusion 的第一道分水岭——模型从哪里开始生成?》精华内容

要理解图生图,就必须深入到 Stable Diffusion 的生成流程中,看清那张输入的图到底是如何影响最终结果的。

机制差异

图生图与文生图在 ComfyUI 中使用的其实是同一套 KSampler 采样逻辑。它们的根本区别不在于模型或算法,而在于采样的起点。文生图从一个随机噪声 latent 开始,而图生图则是先将输入图像通过 VAE 编码成一个 latent,再以此作为起点进行去噪生成。

这意味着图生图并非“从头画起”,而是在一个已经包含图像信息的状态上开始演化。

图像的真实角色

当一张图被输入模型,它看到的并非人物、构图或颜色,而是由 VAE 编码后的一组 latent 数值。这组数值包含了原图的构图、明暗和纹理结构信息,但模型并不知道这些信息“是什么”。

因此,图生图无法精确控制“改哪里”,也不能“锁住”某个区域。所有变化都源于噪声与去噪过程的间接作用。这也解释了为何局部控制必须依赖 Inpaint 或 ControlNet 等额外机制。

Denoise 的作用

Denoise 参数的作用发生在采样开始之前,它决定了向输入的 latent 中注入多少噪声。这个值并非线性比例,也不是“保留原图百分比”的直接体现。

Denoise 值越低,注入噪声越少,模型可调整的空间越小,输出越接近原图。Denoise 值越高,latent 越接近随机噪声,模型的自由度就越大,生成结果也越偏离原图。最终效果是 denoise 与 steps、scheduler 等参数共同作用的结果。

参数效果实测

通过最小化变量实验,可以清晰看到 denoise 的阶段性效果。当 denoise=0.25 时,效果接近质量修复,人物五官、构图几乎不变,但皮肤纹理和光线更干净。

当 denoise=0.5 时,进入可控重绘区,人物主体保留,但精致度和审美开始向模型偏好靠拢。当 denoise=0.75 时,结构开始松动,面部轮廓和发型可能被重新设计。而当 denoise 达到 0.95 时,行为已接近文生图,原图仅作为一个极弱的起点存在。

理解图生图的本质,是掌握 Stable Diffusion 高级玩法的基石。它并非简单的重绘,而是生成起点的变化,而 denoise 参数则是调整生成自由度的关键。然而,当需要更精确的结构控制时,仅靠图生图便会力不从心,人物姿态和构图容易漂移。如何解决这一问题?这引出了对 ControlNet 等高级工具的必然需求。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章