千问2.5-12B模型更新,实测显示其文生图与局部重绘能力均有提升,综合表现优于竞品ZImage。然而图生图功能因控制模型兼容问题暂不可用,以下为详细工作流解析。
智能速览
文生图建议使用6-8步采样,Beta调度器效果最佳。
人像细节比初代更优,综合能力超越ZImage。
局部重绘仅支持换装换色,无法进行复杂的改字操作。
图生图因控制模型不匹配,目前无法有效使用。
生成人像需在提示词中指定国籍以避免默认外国面孔。
精华内容
针对千问2.5-12B模型在实际工作流中的表现,从参数设置到功能局限性,以下是详细的测试结果与优化建议。
文生图参数优化
在文生图工作流中,使用FP8模型配合四步加速LoRA时,建议将采样步数设为6-8步,四步采样会导致画质明显下降。调度器选择Beta以替代Simple,因为Simple在开启LoRA时容易产生网格状伪影。该模型生成的人像细节充足,经过放大处理后皮肤质感自然,且图像饱和度略高。
综合能力对比
与ZImage模型相比,千问2.5-12B在人像生成方面略逊一筹,但在文字渲染及多种风格绘制的综合表现上更为出色。实测表明,该模型对提示词的响应良好。值得注意的是,若需生成特定人像,必须在提示词中明确指定国籍,否则系统倾向于生成外国面孔。
局部重绘局限
局部重绘功能兼容ControlNet impating模型,操作逻辑与ZImage相似,能够实现更改衣服颜色、添加眼镜或项链等基础修改。不过,该功能灵活性较差,无法像AIO或Editor模型那样处理修改文字等复杂任务,适用场景相对有限。
图生图暂不可用
图生图工作流目前存在严重的兼容性问题,新模型与现有的深度图控制模型不匹配。测试结果显示,生成的图像几乎完全忽略原图的结构约束,导致该功能现阶段基本没有实用价值,需等待后续适配的控制模型发布。
千问2.5-12B模型在文生图和局部重绘方面展现了不错的潜力,综合能力强劲,尤其是在文字和细节处理上。但图生图功能的缺失是一大遗憾,期待后续能有适配的控制模型来释放其全部实力。