Z-Image Turbo 是通义(Tongyi-MAI)开源的 6B 参数图像生成模型:8 步出图、16GB 消费级显卡就能训练 LoRA、Apache 2.0 完全开源。是入门 LoRA 训练门槛最低、也最不容易卡住的模型。
模型速览
| 项 | 值 |
|---|---|
| 模型规模 | 6B 参数(远小于 FLUX 12B / FLUX.2 32B) |
| 架构 | S3-DiT(单流扩散 Transformer) |
| 蒸馏 | Decoupled-DMD 蒸馏,8 NFE(函数求值次数) |
| 推理步数 | 约 8 步高质量出图(少步数、无 CFG) |
| 显存 | 训练 16GB 起、24GB 舒适;推理 16GB 内轻松 |
| 协议 | Apache 2.0(免授权、可商用) |
| 能力亮点 | 写实质量强、中英文双语文字渲染、指令跟随好 |
它擅长什么
ostris 在教程里的实测评价:
- 写实:6B 参数里表现领先,人物与场景细节扎实
- 文字:中英文文字渲染是亮点(比大多数同量级模型好)
- 指令跟随:对自然语言 prompt 的理解不错
- 风格迁移默认偏弱——这正是训练风格 LoRA 的动机:基座写实强、风格弱,训练一个风格 LoRA 就能补齐短板
变体生态(选哪个训练)
| 变体 | 定位 | 能否直接训练 LoRA |
|---|---|---|
| Z-Image(Base) | 未蒸馏基底,官方定位是社区微调基底 | 可以,但 Base 发布较晚、生态资料少 |
| Z-Image-Turbo | 蒸馏版,8 步高速 | 可以(本教程主线),需用训练适配器保护蒸馏 |
| Z-Image-Edit | 编辑专用变体(官方规划中) | 发布后另论 |
| De-Turbo | 社区去蒸馏变体(ostris/Z-Image-De-Turbo),低 CFG 2–3、20–30 步 | 可以,适合不追求少步数的场景 |
ai-toolkit 内建对 Tongyi-MAI/Z-Image-Turbo 与 ostris/Z-Image-De-Turbo 的支持。
为什么用它入门 LoRA
对比 FLUX.2 [dev](32B)与 Krea 2(gated 授权):
| 维度 | Z-Image Turbo | FLUX.2 dev | Krea 2 |
|---|---|---|---|
| 模型规模 | 6B | 32B | 大模型(flow-matching) |
| 训练显存 | 16–24GB | 24–48GB+ | 24–48GB+ |
| 授权 | Apache 2.0 免授权 | HF gated | HF gated |
| 采样 | 8 步、CFG 1 | guidance 蒸馏 | Raw 28 步 / Turbo 9 步 |
对新手最友好的组合:免授权(少一道许可门槛)+ 低显存(16GB 就能跑)+ 少步数(验证快、试错成本低)。
模型入口
- Hugging Face:
Tongyi-MAI/Z-Image-Turbo(1.2k+ 赞、Apache 2.0、ModelScope 同步) - 训练适配器:
ostris/zimage_turbo_training_adapter(详见 02 篇)
演示图占位
此处放:Z-Image Turbo 基座效果样例(写实人物/场景)
说明:展示 8 步采样下的人物写实与文字渲染能力
下一步
→ 02 · 蒸馏与训练适配器 理解"为什么不能直接训练 Turbo"