阿里千问Image 2.0正式发布,将文生图与图像编辑合二为一,并大幅提升了长文本理解与文字生成能力。此次升级使其在生成海报、漫画等复杂内容时表现更佳,出图速度也显著加快。通过实际测试,可以清晰地看到它在文字排版和准确性上的进步,以及当前仍存在的局限性。
智能速览
模型合并,支持文生图与图像编辑二合一。
新增1K token长指令支持,可生成复杂海报或漫画。
支持2K分辨率生成,出图速度大幅提升至3-4秒/张。
文字生成能力显著增强,能处理大量文字并保持排版。
实测发现,生成文字时需提供完整文本以确保准确性。
精华内容
这款新模型的实际表现究竟如何?尤其是在备受关注的文字生成和长文本理解上,它能否达到宣传效果,又有哪些细节值得注意?
核心升级概览
千问Image 2.0的核心升级点在于将原有的文生图与图像编辑两个分支模型合二为一,采用7B参数的轻量化架构。它首次支持高达1K token的指令输入,这意味着用户可以写入更详细、多层次的描述,甚至直接生成PPT海报或连环漫画。同时,模型支持2K分辨率输出,官方数据显示生成一张2K图像仅需3-4秒,速度远超前代。
文字生成实测
文字生成是本次升级的重点。测试显示,当提示词中包含完整的诗歌或文案时,模型能准确复现并保持良好排版,无论是横版海报还是竖版诗篇效果都令人满意。然而,当指令要求模型“生成全诗”或“写出全部诗词”时,模型往往只能理解和生成开头与结尾的文字,中间部分则会出现乱码或错误。这表明其文字能力虽有飞跃,但仍需用户提供明确的完整文本。
适用场景与技巧
基于实测结果,该模型非常适合需要大量文字配合的插画、故事九宫格、宣传海报等场景的快速生成。为了获得最佳效果,建议在提示词中直接写入所有需要出现的文字内容,而不是用模糊指令让模型自行创作。对于食谱菜单等包含大量零散文字的复杂排版,目前仍可能出现部分错误,需要后期检查调整。
免费使用途径
尽管模型尚未开源,但阿里官方的通义万相AI平台已上线Qwen-image 2.0,并允许用户免费、不限量地使用。用户只需在平台将模型切换至“千问Image 2.0”,即可自定义图像比例、分辨率,并输入详细的提示词进行体验,这为想尝试其新功能的用户提供了极大的便利。
千问Image 2.0通过整合功能与提升文字能力,展现了其在AI图像生成领域的竞争力,尤其是在复杂图文内容的创作上。虽然文字生成仍有优化空间,但其速度和可控性已具备实用价值。未来,它能否进一步降低使用门槛,实现更精准的复杂排版,值得期待。