注册
教程中心 / AI Toolkit 训练 FLUX.2 dev LoRA

AI Toolkit 训练 FLUX.2 dev LoRA

用 AI Toolkit 训练 FLUX.2 [dev] LoRA:架构解析、LoRA 类型选择、硬件显存三档配置、数据集设计、分步训练与调试推理

07 · 调试与质量提升

AI Toolkit 训练 FLUX.2 dev LoRA 更新于 2026-10-10 16:46:01

FLUX.2 [dev] 训练最常见的四类问题,本篇按"症状 → 原因 → 处理"给出解法,覆盖下载报错、学不动、过拟合、显存不足。

1. GatedRepoError / 401:下载 FLUX.2-dev 报错

症状:训练启动下载模型时报 GatedRepoError 或 401。

原因:FLUX.2-dev 是 HF gated 模型,未接受许可或未配令牌。

处理:

  1. 在 Hugging Face 上打开 black-forest-labs/FLUX.2-dev 页面,接受许可协议
  2. 创建 Read 令牌(Settings → Access Tokens)
  3. 配置到训练器设置(Settings 页填入,或 huggingface-cli login)

2. 1000+ 步后没有变化

症状:训练了上千步,采样图一直和基线差不多。

排查顺序:

  1. 确认 LoRA 真的在采样中被应用(sample 配置里加载了)
  2. rank 是否太低(4–8 在 FLUX.2 上可能太弱)→ 尝试 rank 16–32
  3. Learning Rate 是否为 0.0001(不是被误设成 1e-5 或 0)
  4. 描述策略:从描述里删除风格描述词(风格 LoRA 别写"油画/水彩/漫画风"这类词)

3. LoRA 覆盖了基础模型

症状:激活 LoRA 后,基础模型的多样性/其他风格全没了。

处理(三选一或组合):

  • 开启 DOP(Differential Output Preservation)
  • 减少步数到 800–1500
  • Linear Rank = 16、Learning Rate = 0.000075(更保守的组合)

4. CUDA 显存不足(OOM)

处理阶梯:

  1. 分辨率 1024 → 896 → 768
  2. 开启 Gradient checkpointing 与 gradient accumulation
  3. FP8 / 4-bit 量化(Transformer 与 Text Encoder)
  4. Cache Latents 开启
  5. 降 rank / batch
  6. 最后手段:迁移到 RunComfy 的 H100/H200

5. 过拟合

症状:后期只会复读训练图、prompt 不听话。

处理:

  • 用更早的 checkpoint(过拟合前的采样通常质量最高)
  • 降 steps
  • 降 rank
  • 略增 weight decay
  • 正则数据集 + DOP

6. 效果不稳 / 风格漂移

处理:

  • 固定 seed 对比(Sample 面板 Walk Seed 关闭时用固定 seed)
  • 用 3 类诊断 prompt:激活(带 trigger)/ 泛化(换属性)/ 泄漏(不带 trigger)
  • 一次只改一个旋钮,看下一批采样再决定

诊断 prompt 设计示例

类型 示例(trigger=midnight_tarot)
激活 [trigger] woman holding a celestial tarot card deck, studio lighting
泛化 [trigger] man holding a celestial tarot card deck, outdoor daylight
泄漏 a cyberpunk city street at night, neon lights

下一步

→ 08 · 在推理中使用 LoRA 把训练成果部署到推理

TOP