FLUX.2 [dev] 是 32B 体量,训练显存需求从"紧张可行"到"舒适"跨度很大。本篇按显存分三档给出完整配置,照着选即可。
三档配置速查
级别 A:16–24GB GPU(4070 Ti / 4080 / 4090)
- 现实范围:可行但紧张。Batch Size = 1,896–1024px
- 关键设置:
- Low VRAM 开启
- Layer Offloading 开启
- Transformer 与 Text Encoder 均
float8(默认)
级别 B:32–48GB GPU(RTX 6000 Ada / A6000)
- 现实范围:训练变得舒适。1024×1024 下训练风格与角色 LoRA,20–60+ 图像,1000–3000 步
- 关键设置:
- Batch Size = 1–2
- Steps ≈ 1000–3000
- Learning Rate = 0.0001
- Linear Rank = 32
级别 C:64–96+ GB GPU(H100 / H200)
- 现实范围:1024×1024,Batch Size = 2–4,DOP 默认开启
- 关键设置:
- Low VRAM 关闭
- Linear Rank = 32–64
选档位对照表
| 你的显卡 | 档位 | 关键词 |
|---|---|---|
| 4070 Ti / 4080 / 4090(16–24GB) | A | 紧张可行:batch 1、float8、Low VRAM + Layer Offloading |
| RTX 6000 Ada / A6000(32–48GB) | B | 舒适:1024px、rank 32、batch 1–2 |
| H100 / H200(64–96GB+) | C | 最佳:batch 2–4、DOP 开、rank 32–64 |
本地 vs 云端
| 维度 | 本地 AI Toolkit | RunComfy 云端 AI Toolkit |
|---|---|---|
| 安装 | 从 GitHub 仓库安装 | 浏览器即用 |
| 显卡 | 你自己的 GPU | H100 / H200(80/141GB) |
| 数据 | 本地磁盘 | 云端持久工作区 |
| 适用 | 级别 B/C 显卡持有者 | 级别 A 显卡想跑 C 档、或想并行多任务 |
显存吃紧时的操作顺序(提前收藏)
- 分辨率 1024 → 896 → 768(收益最大)
- 开 Gradient checkpointing / accumulation
- Transformer / Text Encoder 量化(qfloat8 → 6/4 bit)
- Cache Latents 开启
- 降 rank / batch
- 还不行:上云(H100/H200)
下一步
→ 05 · 数据集设计 数据多少、怎么写描述