对小步数模型,一个小而多样的数据集,比一个大而重复的数据集更可靠。本篇按 LoRA 类型给出数据组织方式,以及 repeats、分辨率、caption dropout 与 trigger 的使用规范。
数据集总体原则
- 小而多样:干净、覆盖角度/距离/光照/背景/构图变化
- 移除近似副本:重复取景会很快增加僵化程度
- 不要靠增加重复或步数来弥补薄弱或不一致的标注
角色 / 产品 / 物件 LoRA
- 使用大约 10–30 张干净图像
- 在角度、距离、光照、背景和构图上做变化
- 当近景和远景在推理时都必须生效时,二者都要包含
- 移除近似副本;重复取景会很快增加僵化程度
风格 LoRA
- 在保持视觉处理一致的同时,让主体和构图多样
- 避免每张图像都包含相同物件或布局的数据集(那会让模型记住构图而不是风格)
- 把场景内容如实标注,让 LoRA 学到的是风格,而不是记住某一种构图
数据集配置基线
| 字段 | 值 | 说明 |
|---|---|---|
| Num Repeats | 1 |
第一次运行保持 1 |
| Resolutions | 512 / 768 / 1024 |
默认三档分桶 |
| Caption Dropout | 0.05 |
防记忆精确标注 |
标注规范
- 使用简洁的 sidecar 标注(同名 .txt 文件)
- 希望 LoRA 是可选触发时,一致地使用同一个罕见的 trigger token
- 风格 LoRA 描述场景内容,不写风格词
- 角色 LoRA 用 trigger + 类别词(person / woman / product 等)+ 特征描述
常见标注错误
| 错误 | 后果 | 修正 |
|---|---|---|
| caption 过于具体(每张都写死姿势/背景) | 模型记住构图而不是概念 | 描述"有什么",让构图成为可变化空间 |
| trigger 不统一 | LoRA 学不到稳定绑定 | 全文统一同一 trigger |
| 重复图像 | 僵化、复制同一姿势 | 去重,保持 repeats 1 |
| 风格词写进风格类 caption | 风格变附加属性 | 只写内容词 |
数据准备检查清单
- 10–30 张(角色/产品)或风格一致、主体多样的图(风格)
- 角度/距离/光照/背景/构图覆盖
- 无近似副本
- 标注简洁、trigger 统一、风格词不出现
- repeats 1、512/768/1024、dropout 0.05
下一步
→ 06 · 简短训练与检查点流程 1000 步流程与"最早干净检查点"