AI绘画圈这个八月比天气还热闹:海螺H3、FLUX.3的开源热度还没散,生图这边8月9日B站刚冒出新的Z-Image人像训练教程,隔天社区新的高清化模型Z-Image Tile 2.1就有人实测。但翻一遍评论区会发现,大家最焦虑的还是那两件事:家里的卡跑不跑得动,训练一轮要多久。哔哩哔哩这篇就把这几个问题一次说清:谁该练、四条路线各花多少钱、哪些坑是真实费钱费时间的。
先泼冷水:两种人根本不用炼丹
第一类是"只想看看自己长什么样"。这种需求拿一张正脸照做面部参考一键生成就够,连本地都不用跑。Z-Image-Turbo本身是少步数文生图模型,整套工作流不过六七个节点,文本编码节点里直接写中文提示词就行。知乎本地生成端的门槛更是被压到了8G显存老卡。bilibili

第二类是"要一致性,但只要几张"。把面部参考提示词写好,能解决八成问题。LoRA训练真正解决的,是"几百张图人物不崩、多服装多场景、还想固定自己风格"这种硬需求,也就是电商模特、连载角色和数字分身的入场券。如果既懒得练又想要一致性,还有个更新的折中方案:图生LoRA-V2上传几张图一次前向就能预测出一个LoRA文件。知乎它目前的效果上限不如老老实实训练,但拿来玩够本。
为什么人像主角目前是Z-Image
开源生图模型里,Z-Image目前是对外部条件最"不挑"的一个:6B参数、阿里通义开源,社区口碑最集中的两点是皮肤质感和对亚洲面孔的审美。生成端8G显存起步,训练端围绕它的教程、整合包、LoRA生态是国产开源模型里最全的——零度解说去年12月的本地部署视频播放16万+,今年8月新教程的评论区里,4060Ti 8G、2060 6G的提问还在排队。生态也还在动:8月10日已有人放出社区新高清晰度路线Z-Image Tile 2.1的实测。bilibili
四条炼丹路线的账
路线一,本地免费开源。秋叶训练器、ai-toolkit这类工具全免费,花的只是自家电费和卡,产物完全在自己手里;代价是环境要自己装、参数要自己调,但今天这套流程已经被整合包压缩到解压即用。路线二,云端GPU租用。AutoDL、优云智算这类平台按小时计费,还有一键部署的训练镜像,适合没有独显的人;价格随卡型和时段浮动,练完即释放,单次成本可控。路线三,免费云镜像。B站早就有人共享Z-Image训练的免费云镜像,零成本入门,代价是环境和排队靠运气。bilibili路线四,付费整合包和激活码式训练器。花钱买的是"不想折腾",可相关视频评论区里,不乏买过激活码却几乎没用过、等着看别人反馈再入手的人——工具本身没问题,问题在于新手路线的免费门槛没有想象中高。
路线 | 金钱成本 | 硬件要求 | 单丹耗时 | 最适合谁 |
|---|---|---|---|---|
本地开源 | 0元 | ≥8G显存,12G舒适 | 数小时 | 有卡、愿意折腾 |
云端租卡 | 按小时计费 | 无需本地卡 | 1-2小时 | 没卡、想快速迭代 |
免费云镜像 | 0元 | 浏览器即可 | 看排队 | 零预算试水 |
付费整合包 | 激活码/软件费 | 一般仍需自己的卡 | 同本地 | 真不想折腾 |
本地路线摊开看其实就这几个节点:加载器、文本编码、采样、解码,一屏摆得下。知乎

三个真实费钱费时间的坑
第一个坑最经典:直接拿Turbo训LoRA,训到崩溃。Z-Image-Turbo的快来自一致性蒸馏,30+步去噪被压到8步,而蒸馏改变了模型的训练目标,直接LoRA训练效果很差甚至崩溃。知乎
解法不复杂:给Turbo挂上官方训练Adapter就能正常训,Z-Image Base和De-Turbo则不需要这一步。知乎这个坑浪费的往往不是训练本身,而是排查不出原因时反复重训的那几个小时。
第二个坑:把训练标签写成小作文。训练时每张图要配同名txt标签,很多人用自然语言描述,但自然语言虽然易读,信息密度低,关键特征容易被忽略。知乎正确姿势是逗号分隔的关键词串,触发词放最前;想一个LoRA装多个角色或多套服装,就用分级触发词做"一炉多丹"。
第三个坑:数据集发型服装乱炖。评论区高频问题是"几张图片发型和衣服不统一能训练不"——能训,但模型会把特征学平均,出图四不像。按造型拆数据集更稳;显存不够时别硬撑,社区实测的口诀是显存低于16G就老老实实开低显存模式。知乎
按显卡对号入座
16G显存以上的,直接本地全开,分辨率敢往1024拉;12G是社区实测的舒适线,开低显存模式一晚上能出一丹;8G的卡建议从Z-Image-Base的8G显存教程入手,Turbo路线要叠更多优化,不行就转云端。训练时长这件事,评论区的实测回答是"好几个小时"量级,别信"十分钟出丹"的标题。哔哩哔哩没有独显的,先走免费云镜像试水,真上瘾了再算租卡的账,为练一个丹买卡基本是冲动消费。

本地路线的价值在于整套链路开源透明:从加载器、文本编码到采样解码,每个节点的参数都摊在面板上,改什么、怎么改全是自己的决定,这是付费整合包给不了的东西。
收尾前两句提醒
Z-Image生态迭代极快,社区微调版、衍生模型按月冒新,工具永远会变,但"训什么、怎么选路线"是稳定的,晚一个晚上开始不吃亏。还有一件是肖像权:拿自己或家人的照片训练没问题,拿别人的脸训练还公开发布模型,就不是技术问题,是红线。
想继续蹲这个方向的,留两个观察信号:一是Z-Image官方底模会不会出新一代,二是国内平台会不会把训练价格往"像生图一样接近免费"卷。这两件事只要有一件变了,上面四笔账就要重算。