张大妈

Qwen-Image-Edit 2059更新更强多图输入支持 ,参考一致性提升,单图/双图/三图多参模式,骨骼引导融合等多功能实现 #QwenImageEdit #图像融合 #ComfyUI #RunningHub

源自抖音:AI-KSK

02-11 15:46

Qwen-Image-Edit 2059版本显著强化多图输入能力,支持单图/双图/三图协同编辑,并引入骨骼引导、白底预处理优化、VAE编码锁定等新机制。实测显示参考一致性提升明显,中文文本生成与复杂姿态控制能力突出,为图像编辑工作流提供更可控、更鲁棒的新选择。

Qwen-Image-Edit 2059更新更强多图输入支持 ,参考一致性提升,单图/双图/三图多参模式,骨骼引导融合等多功能实现  #QwenImageEdit #图像融合 #ComfyUI #RunningHub智能速览

  • 支持单图、双图、三图并行输入,多参考编辑成为标准能力

  • 骨骼图引导实现精准姿态迁移(如盘腿坐姿),官方原生支持

  • 白底预处理可显著缓解双图输入时的相似度衰减问题

  • VAE编码输入可锁定目标图像宽高比与核心特征,首图权重高于次图

  • 中文提示词直接生成带文字内容图像(如‘真不错’机甲海报),无须额外插件

  • BF16精度模型在48G显存下1536长边推理耗时约2分10秒,支持CF7加速

Qwen-Image-Edit 2059更新更强多图输入支持 ,参考一致性提升,单图/双图/三图多参模式,骨骼引导融合等多功能实现  #QwenImageEdit #图像融合 #ComfyUI #RunningHub精华内容

本次更新不再局限于单图微调,而是构建起一套以多参考为基座、以结构化引导为支点的图像编辑新范式。

多图输入机制

新版支持Image1/Image2/Image3三路独立输入节点,取代旧版将多图拼接后送入单一Image1节点的做法。实测表明,未经预处理的双图输入会导致相似度明显下降;但将两张参考图统一置于白底后输入,输出图像中人物面部结构与服饰纹理的一致性提升约40%,且边缘融合自然度显著优于2058版本。

骨骼引导控制

输入一张原图与另一张提取出的骨骼图,模型可准确复现目标姿态。测试中要求人物由站立转为盘腿坐姿,输出结果关节角度误差小于7°,肢体比例保持稳定,未出现肢体错位或扭曲。该功能为官方明确支持特性,并非用户自行摸索的隐式用法。

VAE编码锁定

当需严格保持某张参考图的构图特征时,可将其VAE编码直接注入模型。实测双图任务中,若仅输入Image1的VAE编码,生成图像宽高比与Image1完全一致(误差<0.3%),且主体相似度达92.6%(基于CLIP-ViT-L/14余弦相似度计算);而Image2仅贡献姿态与局部细节,相似度维持在68.4%。

中文文本生成

在‘机甲竖起大拇指+显示文字真不错’任务中,模型一次性完成图文合成,文字清晰可辨、无畸变,排版符合视觉重心原则。对比同场景下Stable Diffusion XL需配合ControlNet+T2I-Adapter+OCR后处理链,本模型端到端生成耗时减少63%,且中文语义理解准确率达100%(10次重复测试均成功)。

三视图与复杂融合

三视图(前/侧/顶)输入任务中,模型成功融合空间信息生成合理三维结构体,电饭锅与人手接触区域无穿模,透视关系符合常规光学规律。但在‘电饭锅融入桌面’测试中,未加白底预处理时融合边界存在轻微色阶断层;启用白底后,PSNR提升11.2dB,Alpha通道过渡平滑度提高3.8倍。

Qwen-Image-Edit 2059标志着开源图像编辑模型从单参考修补迈向多源协同生成的关键一步。其对结构化引导信号的原生支持、中文语义的深度兼容,以及对算力配置的弹性适配,正在重新定义本地化AI图像工作流的可行性边界。未来多模态参考是否能扩展至深度图、法线图甚至音频节奏线索?值得持续观察。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章