注册
教程中心 / AI Toolkit 教程

AI Toolkit 教程

AI Toolkit 扩散模型 LoRA 训练套件入门:工具认识、安装运行、Web UI 操作、数据集准备、核心超参数与常见排障,从零跑通第一个 LoRA

05 · 核心超参数详解

AI Toolkit 教程 更新于 2026-10-10 16:46:00

训练 LoRA 不需要背参数,但要理解每个旋钮在干嘛,才能"有目的地"调参。本篇把 AI Toolkit 的核心超参数逐个讲清楚,并给出各模型通用基线。

概念 → 参数映射

先回顾 LoRA 原理:W_new = W + α·A·B。对应到参数:

概念 参数 一句话
容量 Linear Rank(秩) 能学多少;越大越强但越吃显存、越易过拟合
步幅 Learning Rate(lr) 每步学多少;太大崩、太小不动
时长 Steps 学多久;结合采样图判断
学什么 数据集 + captions 内容与描述决定方向

rank(秩)

  • 通用建议:从 16 起步,不够再上 32
  • 模型差异:Z-Image Turbo 常用 8–16;FLUX.2 [dev] 融合 Transformer 上 32 是良好默认(紧张时 8–16,复杂品牌 32–64)
  • 过拟合风险与显存随 rank 上升;小数据集用低 rank 更稳

learning rate(学习率)

  • 默认基线 1e-4(0.0001)附近
  • ⚠️ 少步数/turbo 模型不要盲目 2e-4——实测会导致不稳定甚至爆炸
  • 调优信号:loss 震荡/发散 → 降 lr;几百步没变化 → 先查数据与 rank,再小幅升 lr

steps(步数)

各用途参考基线:

用途 步数参考
风格 LoRA 1500–2500(Z-Image Turbo 3000 起步)
角色 LoRA 1500–3000
FLUX.2 dev 风格 800–2000;角色 1000–2500;指令 1500–3000

原则:看采样图决定,不是机械照搬。风格没学够就加,出现复读/过拟合就减。

noise schedule 与 timestep

  • Noise Scheduler:训练默认 flowmatch(流匹配),与采样器保持一致
  • Timestep Type:linear / weighted 等,影响各噪声阶段的学习权重
  • Timestep Bias:High Noise(重构成)/ Balanced(默认)/ Low Noise(重细节)——重风格时切 High Noise 让构成先对齐,再回 Balanced 细化纹理

分辨率桶(Resolutions / bucket)

  • 多分辨率桶(如 256 / 512 / 768 / 1024)让模型适应多种宽高比
  • 低桶更省显存:24GB 跑大模型时去掉 1024 桶是常用减压手段
  • 尽量让桶覆盖训练数据实际分辨率范围

量化(Quantization)

  • 默认 qfloat8(Transformer 与 Text Encoder 都是)
  • 显存紧张按 8 → 6 → 4 → 3 bit 递进;再配合 Low VRAM 与 Layer Offloading
  • 显存充足时关量化训练更快;注意:量化变体越激进,训练速度可能越慢

正则化与高级机制

机制 作用 开关时机
EMA 指数滑动平均权重副本,收敛更稳 默认开(小数据集尤其有用)
DOP 差分输出保持,抑制 LoRA 渗漏 需要正则数据集;渗漏时开
Differential Guidance turbo 类模型聚焦"该改变的部分",加速收敛 可选;Scale 3 常用
Cache Latents 训练前把 latent 缓存到磁盘,省显存换速度 默认开
Cache Text Embeddings 缓存文本 embedding 后卸载文本编码器,省显存 仅 caption 静态时开;用 DOP 时不能开

Save 与 Sample 的配合

  • Save Every = Sample Every(如都设 250):每个 checkpoint 对应一组采样图,方便对照进度
  • Max Step Saves to Keep:保留最近几个中间 checkpoint,节省磁盘
  • 采样诊断三件套(建议 Sample Prompts 覆盖):
  • 激活:带 trigger 的 prompt → 确认 LoRA 有反应
  • 泛化:带 trigger 但换属性 → 确认不是复读训练图
  • 泄漏:不带 trigger → 确认没有渗漏

调参纪律

一次只改一个旋钮。同时动 rank + lr + steps,出问题都不知道怪谁。改完看下一批采样图再决定下一步。

占位图

演示图占位
此处放:Training 面板完整参数截图(Batch/Steps/Optimizer/LR/EMA/量化)
说明:与本文参数一一对应

下一步

→ 06 · 快速上手第一个 LoRA 用一个最小可行的任务把整个流程跑通

TOP