辅助适配器减缓了蒸馏的崩溃,但不能无限期地阻止它。所以 Krea 2 Turbo 训练的铁律是保持简短、频繁存检查点——最早能干净捕捉概念的那个检查点,通常比训练损失最低的那个更安全。
实用训练流程
对一个干净的 10–30 张图像数据集:
第 1 步:100 步冒烟测试
只跑 100 步,目的是确认模型、适配器、标注和数据集都能正确加载。这一轮的产出不是"学习效果",是"流水线是否通"。
第 2 步:1000 步正式运行
- Steps =
1000 - Save Every =
250 - Sample Every =
250
你会得到 250 / 500 / 750 / 1000 四个检查点。
第 3 步:在精确的 8 步、guidance 1 下比较
用 07 篇的采样设置(8 步、guidance 1、FlowMatch),逐个比较四个检查点:
| 检查点 | 看什么 |
|---|---|
| 250 | 概念是否开始出现 |
| 500 | 概念是否清晰、是否开始僵硬 |
| 750 | 质量与灵活性的平衡 |
| 1000 | 首次正式评估点 |
第 4 步:按需小幅延长
只有当 1000 步的检查点明显欠拟合、且仍然保留着干净的少步数行为时,才再延长 250–500 步。否则停在 1000 步以内。
学习率纪律
把学习率保持在 0.0001。
- 不要为了强行加快学习而调高它——同时加速的还有僵化和蒸馏损伤
- 如果
250步的样本已经显得生硬、重复,或过度锁死在训练图像上: - 使用更早的检查点
- 清理数据集
- 或把学习率降到
0.00005
在增加步数之前,先做上面三件事。
什么时候停
判断标准:最早能干净捕捉概念的检查点 = 最优解。
- 概念成立 + 8 步行为干净 → 用这个检查点
- 训练损失最低 ≠ 最好(损失最低时往往已僵硬/过拟合)
- 一旦样本开始生硬或瑕疵密集,停止延长运行
流程速查
100 步冒烟 → 1000 步正式(250 保存)→ 8步/guidance1 比较 250/500/750/1000
→ 明显欠拟合才延长 250–500 步 → 选最早干净检查点
lr 保持 1e-4;250 步就生硬 → 早检查点 / 清数据 / 降 5e-5
下一步
→ 07 · 8 步与 guidance 1 采样验证 验证设置是配方,不是装点