FLUX.2 [dev] LoRA 的数据集设计,核心是三个问题:多少张图、怎么描述、要不要正则化。本篇给出可直接套用的答案。
需要多少图像?
| LoRA 类型 | 图像数量 |
|---|---|
| 简单风格 LoRA | 约 15–30 张精选图像 |
| 角色 / 身份 LoRA | 约 20–60 张图像 |
| 编辑 / 指令 LoRA | 50–200 个三元组(源、目标、指令) |
数量不是唯一标准:精选 + 多样远比"多而杂"重要。FLUX.2 是 32B 大模型,小数据集上过拟合很快,宁少勿滥。
描述策略:不写什么比写什么更重要
您在描述中"不写"的内容,对 LoRA 来说是"自由的"——模型会把没提到的部分当作可变化空间。
| 类型 | 描述策略 |
|---|---|
| 风格 LoRA | 描述图像里有什么(主体、场景、元素),不要写媒介或风格词。风格词不写,风格就是默认输出;写了风格词,风格变成"附加属性" |
| 角色 LoRA | 用简短独特的触发词(如 midnight_tarot)+ 类别词(person、woman 等),描述可辨认特征 |
触发词写法
- 独特组合词,避免与常见英文单词冲突
- 在 caption 中使用
[trigger]占位符,训练时自动替换为 Trigger Word 字段的值 - 示例:Trigger Word =
midnight_tarot,caption =[trigger] woman with a celestial tarot card deck
DOP(Differential Output Preservation)
作用:一种正则化策略——当触发词不存在时,惩罚 LoRA 对生成结果的改变。防止 LoRA 渗漏(不触发也长得像训练目标),保住基础模型行为。
使用:
- 在 Datasets 页准备正则数据集(Is Regularization),样本是普通内容图、caption 不含 trigger
- 训练时开启 DOP 并绑定正则数据集
- 注意:开启 DOP 后不能再开 Cache Text Embeddings(03 篇)
何时用:训练目标与基座原有能力重叠(如真实人物、常见物体)或已出现渗漏时。
数据准备清单
- 按类型确定数量与形式(上表)
- 统一格式:jpg/jpeg/png + 同名 txt caption
- caption 写"有什么"不写"什么风格"(风格类)
- 触发词独特且一致
- 需要时准备正则数据集(勾选 Is Regularization)
演示图占位
此处放:风格 LoRA 数据集样例(主题一致、场景多样)
说明:caption 只描述主体,风格词不出现
下一步
→ 06 · 分步配置训练 打开 New Job,逐面板填参数