这篇教程用一组“二次元原图 → 真人效果图”训练编辑 LoRA,让 Qwen Image 2.1 学会一种明确的转换方式。流程是:准备成对图片、配置训练任务、先检查采样能否运行,再根据中途样片选择合适的 LoRA。

对应 9 月 22 日的视频教程。下面按视频中的云端 AI Toolkit 环境讲解,镜像里已经准备好模型;本地安装请使用文末的项目说明。

先准备什么

  • 支持 Qwen Image 2.1 的 AI Toolkit 环境,以及对应的模型。
  • 一组原始图片,以及与它们一一对应的目标图片。
  • 准备一个用于表达转换目标的触发词或短语。视频中的例子是 photo realistic、Live action。

先决定自己要学习哪一种转换,再收集数据。例如目标是真人风格,目标图就应体现你想保留的真人质感;不要把明显不同的目标效果混在一起,却期待模型自动理解你偏好哪一种。

1. 把原图和目标图配对

AI Toolkit 中的两类图片承担不同的作用:

文件夹放什么本教程的例子
control编辑前的输入图片二次元原图
targets希望模型生成的目标图片对应的真人效果图

同一组图片的命名要对应。 模型需要学习的是这张原图应该怎样变化,而不是任意两张图之间的关系。

目录可以按下面的示意整理,示例文件名可自行更换:

dataset/
├── control/
│   ├── character_a.png
│   └── character_b.png
└── targets/
    ├── character_a.png
    └── character_b.png

把两个文件夹上传到数据集目录,刷新 AI Toolkit 的数据集页面,再打开图片抽查:原图与目标图是否配对、文件有没有放反、目标效果是不是你真正想学的。

2. 建立编辑训练任务

使用教程提供的已有任务时,先复制一份再修改。这样可以保留原配置,也更容易比较不同精度或参数的结果。

在任务中完成这些设置:

  1. 选择 Qwen Image 2.1,确认这是本次要训练的模型。
  2. 在数据集配置中,将目标图绑定到 target,原图绑定到 control。
  3. 填入自己的触发词,并让测试采样也使用同样的转换描述。
  4. 替换示例采样图片,使用自己的原图测试;否则看到的是别人的例图表现。

视频中的这套编辑配置没有为每张图片单独写 caption,而是使用统一的默认文字条件和触发词。因此,“没有逐张打标”不等于完全不需要提示词。你仍要告诉模型这组编辑任务希望完成什么转换。

3. 在精度、显存和速度之间选择

视频比较了两种运行方式:

方式视频里的观察选择时看什么
bf16使用 4090 演示,作者更满意训练效果显存是否够用,以及样片质量
INT8/8bit 量化路径提到了 3090 的使用方式,速度更快、显存压力更小,但该次测试效果较差节省的资源是否值得这次效果损失

这是视频里那套模型、数据和配置的比较,不是单凭显卡型号就能判断能否运行。尤其要区分训练占用和采样占用:训练已经开始,后续生成样片时仍可能爆显存。

视频使用过 1280 分辨率,并在显存不足时调整 offloading。初次跑自己的数据时,先用能稳定完成采样的分辨率,再逐步提高。

4. 先跑采样,再跑长训练

启动任务后先观察起始采样。它能同时帮助你检查:数据绑定是否正确、提示词是否匹配、模型是否能在当前配置下生成图片。

如果采样时报显存不足,按这个顺序排查:

  1. 降低训练/采样分辨率。 不要在显存已经不足时继续坚持高分辨率。
  2. 检查 offloading。 视频里一次失败就发生在没有开启卸载的配置中。
  3. 重新跑采样。 确认问题消失后,再继续完整训练。
  4. 若仍无法运行,再考虑量化路径,同时重新比较效果。

视频演示中曾把一个卸载相关设置调整到 30,但字幕没有保留准确字段名,不能据此把界面里任意百分比都设成 30。对应操作可直接看 约 5 分 30 秒。

5. 训练多少步,用哪个版本

视频中跑到了 5000 步,但作者在 500 步已经看见变化,在 1000 步和 1750 步附近已经得到不错的效果。因此这套数据不必为了跑满计划而一直训练。

实际使用时保留中途版本,用相同的测试原图和提示词对比:

  • 目标风格是否已经出现?
  • 需要保留的人物特征和构图有没有被改坏?
  • 继续训练后,是否真的比前一个版本更好?

视频中的一次迭代约 5.44 秒,“大约两小时”描述的是该次训练的量级。自己的耗时还会随步数、分辨率、量化与卸载设置变化。

训练完成后怎么用

下载训练得到的 LoRA,在对应的 Qwen Image 2.1 编辑工作流里测试。也可以使用 AI Toolkit 自带的测试入口,选择模型和 LoRA 后直接生成,先确认效果,再搬到常用的 ComfyUI 工作流。

基础模型的文生图、编辑和透明底图用法见 Qwen Image 2.1 使用笔记:文生图、图像编辑与透明底图。

资源