Z-Image Turbo 是蒸馏模型,直接训练会破坏蒸馏——这是整条 Z-Image Turbo LoRA 训练路线里最核心的概念。本篇讲清楚为什么会坏、训练适配器怎么救。
直接训练蒸馏模型的后果
Z-Image Turbo 的"8 步出图"来自 Decoupled-DMD 蒸馏:用教师-学生方式把推理步数压到极少,学生模型学会"几步就跳到干净图像"。
如果你拿它直接做常规 LoRA 微调:
- 几百步之后开始出现 artifacts(伪影)
- 模型会试图恢复它未蒸馏时的行为——回归标准扩散行为,需要 20–50 步 + CFG 才好看
- 继续训练,蒸馏被进一步侵蚀,速度优势彻底丢失
一句话:直接训 = 把"8 步快模型"慢慢改回"慢模型",这不是我们想要的。
训练适配器:把蒸馏"冻结"起来
ostris 为 AI Toolkit 设计了 Z-Image Turbo 训练适配器(ostris/zimage_turbo_training_adapter),思路非常巧妙:
- 制作:用 Z-Image Turbo 生成数千张各种尺寸/宽高比的图,然后用极低学习率(1e-5)在这批图上训练一个 LoRA——这个 LoRA 不学任何新概念,只内化"蒸馏带来的差异/破坏轨迹"
- 训练时:AI Toolkit 把这个适配器自动合并进模型。你实际是在一个"去蒸馏表示"上训练自己的 LoRA,你的 LoRA 只会学你要的概念,不会去破坏蒸馏
- 推理时:适配器自动移除,回到蒸馏模型上——你的新概念保留在 Turbo 上,依然 8 步高速
演示图占位
此处放:BASE / NO ADAPTER / WITH ADAPTER 三组对比图
说明:同一步数下,无适配器直接训出伪影,带适配器正常
适配器版本与更新
- 当前 V1 可用;ostris 正在制作 V2(训练更充分)
- 新任务会自动使用最新版;克隆旧任务时需手动把适配器版本更新到 V2
- 适配器在 AI Toolkit 内建,UI 里选择架构后勾选/选择训练适配器即可,合并/移除全自动
适用范围与局限(务必知道)
| 场景 | 是否合适 |
|---|---|
| 风格 / 概念 / 角色 LoRA(5000–20000 步) | ✅ 很合适 |
| 数十万到百万级图像的超长微调 | ⚠️ 不合适——训练太长蒸馏仍会被慢慢破坏,移除适配器后出伪影 |
| 需要极低步数场景 | ✅ 适配器不影响推理步数 |
本质:它是个"显著延缓蒸馏破坏"的技巧,不是永久免疫。短跑很好用,超长跑会失效——训练时心里有数即可。
为什么 AI Toolkit 里它"开箱即用"
适配器已内建进 AI Toolkit:
- 训练:自动合并适配器 → 训练你的 LoRA
- 采样/推理:自动移除适配器 → 预览就是纯 Turbo 权重 + 你的 LoRA
- 采样设置(8 步、CFG 1)也保持正确
所以你在 UI 里几乎感觉不到它的存在,只需在新建任务时选对架构和适配器版本。
下一步
→ 03 · 训练配置详解 把参数基线一次配好