注册
教程中心 / AI Toolkit 训练 Z-Image Turbo LoRA

AI Toolkit 训练 Z-Image Turbo LoRA

用 AI Toolkit 训练 Z-Image Turbo LoRA:蒸馏保护与训练适配器原理、参数配置、风格与角色训练、调优技巧与 ComfyUI 使用

05 · 创建任务与训练监控

AI Toolkit 训练 Z-Image Turbo LoRA 更新于 2026-10-10 16:46:01

本篇把 Z-Image Turbo LoRA 从"新建任务"到"训练完成"的完整流程走一遍,包括每步该看什么、怎么判断训练是否健康。

端到端流程

准备数据(04 篇)→ 建数据集(Datasets 页)→ New Job 配置(03 篇参数)
→ 创建并启动 → 监控(本页)→ 采样诊断 → 收尾

新建任务(New Job)

按 03 篇的速查表逐项填:

  1. Job:任务名(如 Z-Image-Turbo - Children's Drawings);caption-only 风格法不需要 Trigger Word
  2. Model:架构 Z-Image-Turbo;Name or Path Tongyi-MAI/Z-Image-Turbo
  3. Training Adapter:选 Z-Image-Turbo 训练适配器 V1(新任务自动取最新版;克隆旧任务记得更新到 V2)
  4. Training:Steps 3000、lr 1e-4、Batch 1、BF16、AdamW8Bit
  5. Advanced:Differential Guidance 开启、Scale 3
  6. Quantization:24GB+ 关量化(更快);16GB 开量化
  7. Text Encoder Optimizations:Cache Text Embeddings 开启
  8. Datasets:Target Dataset 选数据集;Cache Latents 开;Resolutions 保持默认
  9. Sample:Sample Every 250、8 步、CFG 1、填 1–3 个代表性 prompt

点 Create 创建,然后在 Training Queue 启动任务。

训练启动后会发生什么

  • 首次:下载模型 + 缓存 latents(较慢,属正常)
  • 预热后:逐 step 训练,5090 上约 1.3 秒/步
  • 显存:BF16 无量化约 17GB——16GB 卡开量化后也能跑

监控要点

观察项 健康信号 异常信号
迭代速度 稳定(~1s–2s/it) 突然变慢 → 可能触发了 offload/量化瓶颈
loss 缓慢下降/波动收敛 发散、NaN → 通常 lr 太高(确认是 1e-4)
采样图 每 250 步出现,逐渐贴近目标 几百步不变 → 见 06 篇诊断

采样诊断三件套

固定 seed、固定 prompt,对比各 checkpoint 采样:

  1. 激活:目标风格/主体是否出现
  2. 泛化:换主体/prompt 后风格是否仍然成立
  3. 泄漏:不用任何风格相关词时是否保持正常

训练中的动态调整

训练不需要一次配死。常见操作:

  • 风格只部分出现(有些图像、有些不像)→ 切 time step bias 为 High Noise(详见 06 篇)
  • 样本开始复读 → 提前停止,用更早的 checkpoint
  • 重风格没学够 → 直接延长步数(3000 → 5000+),不必重启

收尾

  • 3000 步是风格类合理默认:风格跨主体/prompt 稳定传播、构成已是"画优先"、细节简化但形体可辨
  • 重风格可延到 5000 步以上提升一致性
  • 警惕:超长训练会逐渐破坏蒸馏(适配器章节的局限),出现"要 20–50 步才好看"就是退化信号
  • 训练完成:适配器在推理时自动移除,你得到的是纯 Turbo + 你的 LoRA

占位图

演示图占位
此处放:训练任务页(Job 名 + 采样缩略图 + 提示词/步数信息)
说明:展示 step 2500 时风格已稳定传播

下一步

→ 06 · 评估与调优 学不会的时候怎么救

已是最后一篇 →
TOP