阿里开源的Qwen-Image-Layered模型,首次实现了PS级的图层化AI生成与编辑。它解决了AI图像难以精准修改的核心痛点,让数字内容创作向更高效、更可控的方向迈出了一大步。
智能速览
阿里开源全新图像模型Qwen-Image-Layered,支持图层级编辑。
首次攻克AI生图“牵一发动全身”的一致性难题。
模型采用RGBA-VAE编码和VLD-MMDiT创新架构。
通过学习海量PSD文件,AI拥有了专业设计师的分层思维。
该模型已在魔搭社区和HuggingFace开源,可供免费商用。
精华内容
该模型如何打破传统AI的“扁平式思维”,实现真正的“空间重构”?其背后的技术原理与应用前景值得深入探讨。
扁平式AI的困境
主流视觉大模型对图像的理解是“扁平式”的,仅将其视为一堆紧密耦合的像素点。这导致编辑时如同“开盲盒”,例如移动图中物体,AI无法理解被遮挡背景应有的内容,只能全图重绘,导致主体和背景都发生不可控的变化。这种随机性,让AI绘图在商业广告、UI设计等要求精准的领域,难以成为真正的生产力工具,只能作为参考。
图层化技术突破
Qwen-Image-Layered通过自研的RGBA-VAE编码,在传统RGB三通道基础上引入代表透明度的“Alpha通道”,赋予模型“图层”的概念。其创新的VLD-MMDiT架构配合“图层级3D位置编码”,使AI能够自动推断并“脑补”出被遮挡部分的背景纹理,从而实现对图像空间结构更深入的理解与重组。
专业的“分层思维”
为掌握这种能力,千问团队从海量的专业Photoshop(PSD)文件中提取了真实的图层逻辑进行训练。这种学习方式让AI从“出生”起就具备了专业设计师的“分层思维”,能够理解物体间的遮挡、远近等物理关系,而非仅仅停留在像素表面。
创意产业的变革
这一突破将显著提升数字内容创作的生产效率。设计师、动画师和影视后期人员,无需再进行繁琐的人工抠图,即可在保持主体或背景不变的前提下,对特定图层进行位移、缩放或重绘。AI生图从死板的成品,变成了可灵活调整的“活素材库”,加速了AI在专业设计领域的实际落地。
Qwen-Image-Layered的开源,不仅是技术的一次跃迁,更预示着AI创作工作流的未来。当AI学会像设计师一样思考,创意的边界将被再次拓宽。下一个被改变的行业会是什么?