FLUX.2 [dev] 训练最常见的四类问题,本篇按"症状 → 原因 → 处理"给出解法,覆盖下载报错、学不动、过拟合、显存不足。
1. GatedRepoError / 401:下载 FLUX.2-dev 报错
症状:训练启动下载模型时报 GatedRepoError 或 401。
原因:FLUX.2-dev 是 HF gated 模型,未接受许可或未配令牌。
处理:
- 在 Hugging Face 上打开
black-forest-labs/FLUX.2-dev页面,接受许可协议 - 创建 Read 令牌(Settings → Access Tokens)
- 配置到训练器设置(Settings 页填入,或
huggingface-cli login)
2. 1000+ 步后没有变化
症状:训练了上千步,采样图一直和基线差不多。
排查顺序:
- 确认 LoRA 真的在采样中被应用(sample 配置里加载了)
- rank 是否太低(4–8 在 FLUX.2 上可能太弱)→ 尝试 rank 16–32
- Learning Rate 是否为 0.0001(不是被误设成 1e-5 或 0)
- 描述策略:从描述里删除风格描述词(风格 LoRA 别写"油画/水彩/漫画风"这类词)
3. LoRA 覆盖了基础模型
症状:激活 LoRA 后,基础模型的多样性/其他风格全没了。
处理(三选一或组合):
- 开启 DOP(Differential Output Preservation)
- 减少步数到 800–1500
- Linear Rank = 16、Learning Rate = 0.000075(更保守的组合)
4. CUDA 显存不足(OOM)
处理阶梯:
- 分辨率 1024 → 896 → 768
- 开启 Gradient checkpointing 与 gradient accumulation
- FP8 / 4-bit 量化(Transformer 与 Text Encoder)
- Cache Latents 开启
- 降 rank / batch
- 最后手段:迁移到 RunComfy 的 H100/H200
5. 过拟合
症状:后期只会复读训练图、prompt 不听话。
处理:
- 用更早的 checkpoint(过拟合前的采样通常质量最高)
- 降 steps
- 降 rank
- 略增 weight decay
- 正则数据集 + DOP
6. 效果不稳 / 风格漂移
处理:
- 固定 seed 对比(Sample 面板 Walk Seed 关闭时用固定 seed)
- 用 3 类诊断 prompt:激活(带 trigger)/ 泛化(换属性)/ 泄漏(不带 trigger)
- 一次只改一个旋钮,看下一批采样再决定
诊断 prompt 设计示例
| 类型 | 示例(trigger=midnight_tarot) |
|---|---|
| 激活 | [trigger] woman holding a celestial tarot card deck, studio lighting |
| 泛化 | [trigger] man holding a celestial tarot card deck, outdoor daylight |
| 泄漏 | a cyberpunk city street at night, neon lights |
下一步
→ 08 · 在推理中使用 LoRA 把训练成果部署到推理