注册
教程中心 / AI Toolkit 教程

AI Toolkit 教程

AI Toolkit 扩散模型 LoRA 训练套件入门:工具认识、安装运行、Web UI 操作、数据集准备、核心超参数与常见排障,从零跑通第一个 LoRA

01 · 认识 AI Toolkit 与 LoRA 训练

AI Toolkit 教程 更新于 2026-10-10 16:46:00

AI Toolkit(Ostris AI Toolkit)是开源的扩散模型微调训练套件:用图形界面或命令行,就能在本地显卡上训练自己的 LoRA,支持 FLUX、Z-Image、Krea 2、Qwen-Image、Wan 视频等 30+ 模型家族。

它是什么

AI Toolkit 由 Ostris 开发并开源(MIT 协议,GitHub 12k+ stars),一句话定位:面向图像与视频扩散模型的统一 LoRA 训练工具。

它支持两类扩散模型:

  • 传统 DDPM 风格 UNet 模型:SD 1.5、SDXL
  • 现代 diffusion-transformer 模型:FLUX.1 / FLUX.2、Z-Image、Krea 2、Qwen-Image、Wan 2.x、OmniGen2 等

无论是哪一类,AI Toolkit 都用同一套训练引擎:模型加载、量化、LoRA/LoKr 定义、训练超参数、数据集处理、采样规则全部统一。不同模型只是换了"预设",界面上、配置上的思路高度一致——学会一个模型,其他模型触类旁通。

LoRA 训练到底在做什么

LoRA(Low-Rank Adaptation,低秩适配)是当前微调扩散模型的主流方式。核心思路一句话:

冻结基座模型不动,只训练一小部分"低秩更新"权重,用很小的成本给模型注入新概念(人物、画风、物体、编辑规则)。

数学上可以理解为在冻结权重 W 上叠加一个低秩增量:W_new = W + α·A·B。不用理解公式也能记住三个要点:

要素 作用 对应配置项
rank(秩) 决定 LoRA 的"容量",越大能学的东西越多,显存和过拟合风险也越高 Linear Rank
lr(学习率) 决定每次学习的"步幅",太大容易崩、太小学不动 Learning Rate
steps(步数) 决定学多久,配合采样图判断该停还是继续 Steps

而数据集和 caption(描述文本)决定了模型到底学到什么——这是训练里最需要花心思的部分。

CLI 与 Web UI 双模式

AI Toolkit 提供两种使用方式,底层是同一份配置:

  • CLI:直接读取 YAML 配置文件执行,python run.py config/xxx.yml
  • Web UI:http://localhost:8675,本质是 YAML 的图形化配置层——UI 里有 Job、Model、Quantization、Target、Training、Regularization、Datasets、Sample 等面板,通常不需要手写 YAML
演示图占位
此处放:AI Toolkit Web UI 主界面(New Job 页)
说明:左侧导航 Dashboard / New Job / Training Queue / Datasets / Settings,右侧为训练配置面板

开箱即用的内置能力

  • 量化与低显存模式:可配置 8 / 6 / 4 / 3 bit 的 Transformer 量化与层级 offload,让 FLUX、Wan 这类大模型在 24GB 显存上也能训练
  • LoRA / LoKr 适配器:标准 LoRA 之外还支持更紧凑的 LoKr(LyCORIS 体系)
  • DOP(差分输出保持):对"正则图像"同时跑基座与 LoRA 输出并加惩罚,抑制 LoRA 渗漏(不触发也长得像训练目标)
  • Differential Guidance:面向 turbo 类少步数模型,让训练聚焦"相对基座该改变的部分"
  • 多阶段噪声训练、Latent/文本 embedding 缓存、EMA 等专业机制,教程后续会逐一展开

支持哪些模型

类别 模型家族(节选)
图像 · 文生图 FLUX.1 / FLUX.2、Krea 2(Raw/Turbo)、Z-Image(Base/Turbo/De-Turbo)、Qwen-Image 系列、SDXL / SD 1.5、Flex.1 / Flex.2、Chroma、Lumina2、HiDream、ERNIE-Image、Ideogram 4、Anima、Mage-Flow、OmniGen2 等
图像 · 指令/编辑 FLUX.1-Kontext、Qwen-Image-Edit、Krea 2 Edit、HiDream E1 等
视频 Wan 2.1 / 2.2(T2V / I2V 各规格)、LTX-2 / 2.3 / 2.5、MiniMax-H3(T2V + Ref2V)
音频 Ace-Step 1.5 / XL、YuE2
LLM Qwen2.5-Omni-7B
实验 Zeta Chroma、F-Light

显存建议(社区实测参考):SD 1.5 从 8GB 起;Z-Image Turbo 16–24GB;FLUX.1/FLUX.2 训练最低 24GB(量化后);Wan 14B 视频 24GB 需谨慎设置、48GB 更舒适。

与其他训练工具的关系

生态里还有 SimpleTuner、fal.ai trainer 等同类工具。AI Toolkit 的优势是免费开源、模型支持面广、UI/CLI 双模式、社区更新活跃;后续的 Z-Image Turbo 与 FLUX.2 专项教程都基于它展开。

下一步

→ 02 · 安装与运行环境 装好工具并准备运行环境

← 已是第一篇
TOP