注册
教程中心 / AI Toolkit 训练 FLUX.2 dev LoRA

AI Toolkit 训练 FLUX.2 dev LoRA

用 AI Toolkit 训练 FLUX.2 [dev] LoRA:架构解析、LoRA 类型选择、硬件显存三档配置、数据集设计、分步训练与调试推理

03 · FLUX.2 特定训练细节

AI Toolkit 训练 FLUX.2 dev LoRA 更新于 2026-10-10 16:46:01

三个最影响 FLUX.2 [dev] LoRA 成败的细节:秩的选择、guidance 蒸馏下的训练参数、24B 文本编码器的缓存策略。本篇逐个讲透。

融合 Transformer 上的秩缩放

FLUX.2 [dev] 把注意力和 MLP 投影融合成非常宽的矩阵——这让低秩的效果和旧模型不一样:

  • rank 4–8 通常太弱,学不动
  • rank 32 是 VRAM 允许时的良好默认(风格/角色)
  • 显存紧张:rank 8–16
  • 复杂品牌/身份:rank 32–64 可能有帮助

代价明确:rank 越高,显存与过拟合风险越高。别一上来就 64。

Guidance 蒸馏模型:在 guidance_scale = 1 下训练

FLUX.2 [dev] 是 guidance 蒸馏的,所以 SD 时代"CFG 7–8"的直觉完全不适用:

阶段 设置
训练 guidance_scale = 1
推理 guidance_scale = 2–4 效果良好

训练用 1,推理用 2–4。这是新旧模型最大的参数差异之一。

文本编码器很大:缓存策略决定显存

FLUX.2 [dev] 的文本编码器(Mistral 24B VLM)约有 24GB 参数——比很多显卡的总显存还大。AI Toolkit 的处理方式:

场景 设置
固定描述、不用 DOP 开启 Cache Text Embeddings(缓存文本嵌入后卸载编码器,省显存)
使用 DOP 不能缓存文本嵌入(DOP 导致每步文本变化,缓存会失效/出错)

取舍:开缓存省显存,但牺牲文本的"动态性";DOP 与缓存二选一。

VAE 与分辨率

  • FLUX.2 使用 32 通道的 AutoencoderKLFlux2
  • 实际训练中,768–1024 分辨率能获得大部分显存收益
  • 1024 全分辨率更适合 48GB+ 的舒适区间;24GB 建议 768–896

配置要点汇总

rank:          32(默认)/ 8-16(紧张)/ 32-64(复杂品牌)
guidance 训练: 1
guidance 推理: 2-4
文本缓存:      无 DOP → 开 Cache Text Embeddings;有 DOP → 关
分辨率:        768-1024(显存换收益的甜点区)

下一步

→ 04 · 硬件与显存要求 按你的显卡选配置档位

TOP