实测数据看着挺扎实,不过普通用户更关心实际用起来顺不顺手。比如扫个发票能不能直接识别出金额和日期,这种细节才决定要不要用
全文概述
阿里通义千问模型在图片编辑方面展示了多种功能,包括文字修改、风格转换和图像生成。尽管在某些细节处理上存在不足,如毛笔字识别和光效控制,但整体表现仍具实用性,尤其适合中文文字修改和简单人物生成。
文字修改效果
测试表明,通义千问模型能够有效将英文文字修改为中文,并保持背景和其他元素不变。然而,在处理毛笔字时,模型的识别能力较差,导致生成的图片与原图不符,且文字大小未能保持一致。
风格转换效果
在风格转换方面,模型可以将插画风格的人物图片转换为真实照片风格,但在衣服、发型和妆容等细节上表现欠佳,且生成的照片存在过度曝光的问题,影响了整体的真实感。
图像生成效果
对于图像生成任务,如将人物手中的花朵改为风铃草,模型的表现不尽如人意。生成的图片未能完全按照提示词进行修改,且光效处理过度,导致图片质量下降。
使用方法介绍
用户可以通过三种免费方法使用通义千问模型:腾讯云CNB平台部署、LMArena网站和千问Chat官方网站。其中,LMArena不限制使用次数,对新手用户较为友好。
总结与展望
尽管通义千问模型在某些细节处理上仍有提升空间,但对于中文文字修改和简单人物生成具有实用价值。未来通过引入合适的LoRA(低秩适应)技术,有望进一步提升模型的图片编辑能力和美学效果。
已收藏
去我的收藏夹