本篇把 Z-Image Turbo LoRA 从"新建任务"到"训练完成"的完整流程走一遍,包括每步该看什么、怎么判断训练是否健康。
端到端流程
准备数据(04 篇)→ 建数据集(Datasets 页)→ New Job 配置(03 篇参数)
→ 创建并启动 → 监控(本页)→ 采样诊断 → 收尾
新建任务(New Job)
按 03 篇的速查表逐项填:
- Job:任务名(如
Z-Image-Turbo - Children's Drawings);caption-only 风格法不需要 Trigger Word - Model:架构
Z-Image-Turbo;Name or PathTongyi-MAI/Z-Image-Turbo - Training Adapter:选 Z-Image-Turbo 训练适配器 V1(新任务自动取最新版;克隆旧任务记得更新到 V2)
- Training:Steps 3000、lr 1e-4、Batch 1、BF16、AdamW8Bit
- Advanced:Differential Guidance 开启、Scale 3
- Quantization:24GB+ 关量化(更快);16GB 开量化
- Text Encoder Optimizations:Cache Text Embeddings 开启
- Datasets:Target Dataset 选数据集;Cache Latents 开;Resolutions 保持默认
- Sample:Sample Every 250、8 步、CFG 1、填 1–3 个代表性 prompt
点 Create 创建,然后在 Training Queue 启动任务。
训练启动后会发生什么
- 首次:下载模型 + 缓存 latents(较慢,属正常)
- 预热后:逐 step 训练,5090 上约 1.3 秒/步
- 显存:BF16 无量化约 17GB——16GB 卡开量化后也能跑
监控要点
| 观察项 | 健康信号 | 异常信号 |
|---|---|---|
| 迭代速度 | 稳定(~1s–2s/it) | 突然变慢 → 可能触发了 offload/量化瓶颈 |
| loss | 缓慢下降/波动收敛 | 发散、NaN → 通常 lr 太高(确认是 1e-4) |
| 采样图 | 每 250 步出现,逐渐贴近目标 | 几百步不变 → 见 06 篇诊断 |
采样诊断三件套
固定 seed、固定 prompt,对比各 checkpoint 采样:
- 激活:目标风格/主体是否出现
- 泛化:换主体/prompt 后风格是否仍然成立
- 泄漏:不用任何风格相关词时是否保持正常
训练中的动态调整
训练不需要一次配死。常见操作:
- 风格只部分出现(有些图像、有些不像)→ 切 time step bias 为 High Noise(详见 06 篇)
- 样本开始复读 → 提前停止,用更早的 checkpoint
- 重风格没学够 → 直接延长步数(3000 → 5000+),不必重启
收尾
- 3000 步是风格类合理默认:风格跨主体/prompt 稳定传播、构成已是"画优先"、细节简化但形体可辨
- 重风格可延到 5000 步以上提升一致性
- 警惕:超长训练会逐渐破坏蒸馏(适配器章节的局限),出现"要 20–50 步才好看"就是退化信号
- 训练完成:适配器在推理时自动移除,你得到的是纯 Turbo + 你的 LoRA
占位图
演示图占位
此处放:训练任务页(Job 名 + 采样缩略图 + 提示词/步数信息)
说明:展示 step 2500 时风格已稳定传播
下一步
→ 06 · 评估与调优 学不会的时候怎么救