FLUX.2 [dev] 是 Black Forest Labs 的新一代旗舰:320 亿参数整流流 Transformer,同一 checkpoint 同时处理文生图与图像编辑。训练它的 LoRA 与训练旧版 SD 模型很不一样——先理解架构,再动手。
高层架构四要素
| 组件 | 规格 | 说明 |
|---|---|---|
| 基础模型 | 32B 整流流 Transformer(DiT 风格潜在流模型) | 从头训练,不是 FLUX.1 的延续 |
| 文本编码器 | Mistral Small 3.1 / 3.2 – 24B 视觉语言编码器 | 在 32B DiT 之上再叠加 24B 参数 |
| 自动编码器(VAE) | AutoencoderKLFlux2,32 个潜在通道 | FLUX.1 是 16 通道;专为高分辨率编辑与纹理保留设计 |
| 能力形态 | 统一生成 + 编辑 | 同一架构处理纯文生图、单图编辑、多参考编辑 |
Guidance 蒸馏:FLUX.2 [dev] 是 guidance 蒸馏模型——没有经典的"条件 / 无条件"双通道 CFG。这对训练参数有直接影响(见 03 篇的 guidance_scale 设置)。
架构对 LoRA 训练的 4 个含义
- 核心 Transformer 巨大(32B) → LoRA 秩需要谨慎选择(不是越大越好,显存与过拟合都要权衡)
- 文本编码器很重(24B)且对行为至关重要 → 文本嵌入缓存策略直接决定显存占用(03 篇)
- 同一权重处理 T2I 与编辑 → 一个 LoRA 可能同时影响生成与编辑两条路径
- Guidance 特殊 → 通常用
guidance_scale = 1训练,SD 那套"CFG 7–8"直觉不适用
与旧模型训练的差异总览
| 维度 | SD 1.5 / SDXL | FLUX.2 [dev] |
|---|---|---|
| 架构 | UNet | DiT(32B Transformer) |
| 文本编码 | CLIP 系列(小) | Mistral 24B VLM(巨大) |
| VAE 通道 | 4 / 4 | 32 |
| CFG | 常规双通道 | guidance 蒸馏(无双通道) |
| 训练显存 | 8–16GB | 24GB 起(量化后) |
对 LoRA 训练者的启示
- 不要照搬 SD 教程的参数:rank、guidance、文本缓存逻辑都不同
- 32B 的体量意味着过拟合窗口很窄:小数据集、低 rank、少步数是常态
- 一次训练可以同时得到"生成 + 编辑"能力,设计数据集时可以一并考虑(02 篇)
演示图占位
此处放:FLUX.2 [dev] 文生图与图像编辑效果样例
说明:同一 checkpoint 同时展示生成与多参考编辑能力
下一步
→ 02 · 选择 LoRA 类型 先决定这个 LoRA 要做什么