注册
教程中心 / AI Toolkit 训练 FLUX.2 dev LoRA

AI Toolkit 训练 FLUX.2 dev LoRA

用 AI Toolkit 训练 FLUX.2 [dev] LoRA:架构解析、LoRA 类型选择、硬件显存三档配置、数据集设计、分步训练与调试推理

04 · 硬件与显存要求

AI Toolkit 训练 FLUX.2 dev LoRA 更新于 2026-10-10 16:46:01

FLUX.2 [dev] 是 32B 体量,训练显存需求从"紧张可行"到"舒适"跨度很大。本篇按显存分三档给出完整配置,照着选即可。

三档配置速查

级别 A:16–24GB GPU(4070 Ti / 4080 / 4090)

  • 现实范围:可行但紧张。Batch Size = 1,896–1024px
  • 关键设置:
  • Low VRAM 开启
  • Layer Offloading 开启
  • Transformer 与 Text Encoder 均 float8(默认)

级别 B:32–48GB GPU(RTX 6000 Ada / A6000)

  • 现实范围:训练变得舒适。1024×1024 下训练风格与角色 LoRA,20–60+ 图像,1000–3000 步
  • 关键设置:
  • Batch Size = 1–2
  • Steps ≈ 1000–3000
  • Learning Rate = 0.0001
  • Linear Rank = 32

级别 C:64–96+ GB GPU(H100 / H200)

  • 现实范围:1024×1024,Batch Size = 2–4,DOP 默认开启
  • 关键设置:
  • Low VRAM 关闭
  • Linear Rank = 32–64

选档位对照表

你的显卡 档位 关键词
4070 Ti / 4080 / 4090(16–24GB) A 紧张可行:batch 1、float8、Low VRAM + Layer Offloading
RTX 6000 Ada / A6000(32–48GB) B 舒适:1024px、rank 32、batch 1–2
H100 / H200(64–96GB+) C 最佳:batch 2–4、DOP 开、rank 32–64

本地 vs 云端

维度 本地 AI Toolkit RunComfy 云端 AI Toolkit
安装 从 GitHub 仓库安装 浏览器即用
显卡 你自己的 GPU H100 / H200(80/141GB)
数据 本地磁盘 云端持久工作区
适用 级别 B/C 显卡持有者 级别 A 显卡想跑 C 档、或想并行多任务

显存吃紧时的操作顺序(提前收藏)

  1. 分辨率 1024 → 896 → 768(收益最大)
  2. 开 Gradient checkpointing / accumulation
  3. Transformer / Text Encoder 量化(qfloat8 → 6/4 bit)
  4. Cache Latents 开启
  5. 降 rank / batch
  6. 还不行:上云(H100/H200)

下一步

→ 05 · 数据集设计 数据多少、怎么写描述

TOP