训练 Z-Image Turbo LoRA 的数据组织,ostris 推荐一条"省事又稳定"的路:caption-only 风格法——不写风格词、把风格当默认输出。本篇讲清楚怎么做,以及角色数据集的差异。
数据集基本准备
在 AI Toolkit 的 Datasets 页操作:
- 创建数据集(如
zimage_children_drawings) - 上传图片(jpg/jpeg/png)
- 为每张图配同名 .txt caption,工具自动读取
示例:ostris 用"儿童涂鸦"数据集做演示——一个房子、一个人、一只猫头鹰,各配对应描述。
Caption-only 风格法(推荐)
核心思路:把目标风格当作模型"默认就应该这样画",caption 里如实描述主体、完全不提风格。
对比:
| 写法 | 内容 | 效果 |
|---|---|---|
| ❌ 描述风格 | "a house, child drawing, rough crayon sketch, crude drawing" | 模型可能学到"风格是附加属性",需要 trigger 才触发 |
| ✅ 只描述主体 | "a house"(房子就是房子) | 风格成为默认输出,激活后自动生效,无需 trigger |
要点:
- 描述主体本身:房子写"a house"、人写"a person"、猫头鹰写"an owl",不加风格限定词
- 不要写 "child drawing / rough crayon sketch / crude drawing" 这类风格描述词
- 风格 LoRA 激活后会自动应用该风格,生成时不需要任何 trigger 词
Trigger word 仍然可用,作为补充手段;但 caption-only 法在简单性、一致性上更省心,是 ostris 的偏好做法。
角色数据集(区别)
角色/身份 LoRA 与重风格 LoRA 的数据组织不同:
| 维度 | 角色 LoRA | 重风格 LoRA |
|---|---|---|
| caption | 用 trigger + 类别词(person/woman)描述特征 | caption-only,不提风格词 |
| timestep bias | Balanced(不需要动构成) | 可能需 High Noise(见 06 篇) |
| 收敛速度 | 更快 | 更慢(要重构画面构成) |
图像数量与质量
- 数量参考:风格 15–30 张起步;角色 20–60 张
- 多样性优先:同主体不同角度/光线/场景;重风格注意跨主体(房子、人、动物都有)让风格泛化
- 只缩小不放大:素材用高分辨率原图,交给分桶机制
什么时候要 trigger
- caption-only 风格:不需要
- 角色/主体:推荐,选独特组合词(如
p3r5on) - 混合需求(既要风格又要可开关):用 trigger + caption 里写
[trigger]占位
占位图
演示图占位
此处放:儿童涂鸦风格数据集样例(房子/人物/猫头鹰 + 同名 caption)
说明:caption 只描述主体,不写风格词
下一步
→ 05 · 创建任务与训练监控 端到端跑起来