三个最影响 FLUX.2 [dev] LoRA 成败的细节:秩的选择、guidance 蒸馏下的训练参数、24B 文本编码器的缓存策略。本篇逐个讲透。
融合 Transformer 上的秩缩放
FLUX.2 [dev] 把注意力和 MLP 投影融合成非常宽的矩阵——这让低秩的效果和旧模型不一样:
- rank 4–8 通常太弱,学不动
- rank 32 是 VRAM 允许时的良好默认(风格/角色)
- 显存紧张:rank 8–16
- 复杂品牌/身份:rank 32–64 可能有帮助
代价明确:rank 越高,显存与过拟合风险越高。别一上来就 64。
Guidance 蒸馏模型:在 guidance_scale = 1 下训练
FLUX.2 [dev] 是 guidance 蒸馏的,所以 SD 时代"CFG 7–8"的直觉完全不适用:
| 阶段 | 设置 |
|---|---|
| 训练 | guidance_scale = 1 |
| 推理 | guidance_scale = 2–4 效果良好 |
训练用 1,推理用 2–4。这是新旧模型最大的参数差异之一。
文本编码器很大:缓存策略决定显存
FLUX.2 [dev] 的文本编码器(Mistral 24B VLM)约有 24GB 参数——比很多显卡的总显存还大。AI Toolkit 的处理方式:
| 场景 | 设置 |
|---|---|
| 固定描述、不用 DOP | 开启 Cache Text Embeddings(缓存文本嵌入后卸载编码器,省显存) |
| 使用 DOP | 不能缓存文本嵌入(DOP 导致每步文本变化,缓存会失效/出错) |
取舍:开缓存省显存,但牺牲文本的"动态性";DOP 与缓存二选一。
VAE 与分辨率
- FLUX.2 使用 32 通道的 AutoencoderKLFlux2
- 实际训练中,768–1024 分辨率能获得大部分显存收益
- 1024 全分辨率更适合 48GB+ 的舒适区间;24GB 建议 768–896
配置要点汇总
rank: 32(默认)/ 8-16(紧张)/ 32-64(复杂品牌)
guidance 训练: 1
guidance 推理: 2-4
文本缓存: 无 DOP → 开 Cache Text Embeddings;有 DOP → 关
分辨率: 768-1024(显存换收益的甜点区)
下一步
→ 04 · 硬件与显存要求 按你的显卡选配置档位