---
id: qwen-image-2-1-lora-training
title: Qwen Image 2.1 编辑 LoRA：二次元转真人
topic: LoRA训练
aliases:
- 千问编辑训练
- 二次元转真人
- 配对数据
applicability: []
publish: true
---

这篇教程用一组“二次元原图 → 真人效果图”训练编辑 LoRA，让 Qwen Image 2.1 学会一种明确的转换方式。流程是：准备成对图片、配置训练任务、先检查采样能否运行，再根据中途样片选择合适的 LoRA。

对应 [9 月 22 日的视频教程](https://www.bilibili.com/video/BV1GZhk6pEMw)。下面按视频中的云端 AI Toolkit 环境讲解，镜像里已经准备好模型；本地安装请使用文末的项目说明。

## 先准备什么

- 支持 Qwen Image 2.1 的 AI Toolkit 环境，以及对应的模型。
- 一组原始图片，以及与它们一一对应的目标图片。
- 准备一个用于表达转换目标的触发词或短语。视频中的例子是 `photo realistic`、`Live action`。

先决定自己要学习哪一种转换，再收集数据。例如目标是真人风格，目标图就应体现你想保留的真人质感；不要把明显不同的目标效果混在一起，却期待模型自动理解你偏好哪一种。

## 1. 把原图和目标图配对

AI Toolkit 中的两类图片承担不同的作用：

| 文件夹 | 放什么 | 本教程的例子 |
| --- | --- | --- |
| `control` | 编辑前的输入图片 | 二次元原图 |
| `targets` | 希望模型生成的目标图片 | 对应的真人效果图 |

**同一组图片的命名要对应。** 模型需要学习的是这张原图应该怎样变化，而不是任意两张图之间的关系。

目录可以按下面的示意整理，示例文件名可自行更换：

```text
dataset/
├── control/
│   ├── character_a.png
│   └── character_b.png
└── targets/
    ├── character_a.png
    └── character_b.png
```

把两个文件夹上传到数据集目录，刷新 AI Toolkit 的数据集页面，再打开图片抽查：原图与目标图是否配对、文件有没有放反、目标效果是不是你真正想学的。

## 2. 建立编辑训练任务

使用教程提供的已有任务时，先复制一份再修改。这样可以保留原配置，也更容易比较不同精度或参数的结果。

在任务中完成这些设置：

1. 选择 **Qwen Image 2.1**，确认这是本次要训练的模型。
2. 在数据集配置中，将目标图绑定到 `target`，原图绑定到 `control`。
3. 填入自己的触发词，并让测试采样也使用同样的转换描述。
4. 替换示例采样图片，使用自己的原图测试；否则看到的是别人的例图表现。

视频中的这套编辑配置没有为每张图片单独写 caption，而是使用统一的默认文字条件和触发词。因此，“没有逐张打标”不等于完全不需要提示词。你仍要告诉模型这组编辑任务希望完成什么转换。

## 3. 在精度、显存和速度之间选择

视频比较了两种运行方式：

| 方式 | 视频里的观察 | 选择时看什么 |
| --- | --- | --- |
| bf16 | 使用 4090 演示，作者更满意训练效果 | 显存是否够用，以及样片质量 |
| INT8／8bit 量化路径 | 提到了 3090 的使用方式，速度更快、显存压力更小，但该次测试效果较差 | 节省的资源是否值得这次效果损失 |

这是视频里那套模型、数据和配置的比较，不是单凭显卡型号就能判断能否运行。尤其要区分**训练占用**和**采样占用**：训练已经开始，后续生成样片时仍可能爆显存。

视频使用过 1280 分辨率，并在显存不足时调整 offloading。初次跑自己的数据时，先用能稳定完成采样的分辨率，再逐步提高。

## 4. 先跑采样，再跑长训练

启动任务后先观察起始采样。它能同时帮助你检查：数据绑定是否正确、提示词是否匹配、模型是否能在当前配置下生成图片。

如果采样时报显存不足，按这个顺序排查：

1. **降低训练／采样分辨率。** 不要在显存已经不足时继续坚持高分辨率。
2. **检查 offloading。** 视频里一次失败就发生在没有开启卸载的配置中。
3. **重新跑采样。** 确认问题消失后，再继续完整训练。
4. 若仍无法运行，再考虑量化路径，同时重新比较效果。

视频演示中曾把一个卸载相关设置调整到 30，但字幕没有保留准确字段名，不能据此把界面里任意百分比都设成 30。对应操作可直接看 [约 5 分 30 秒](https://www.bilibili.com/video/BV1GZhk6pEMw?t=330)。

## 5. 训练多少步，用哪个版本

视频中跑到了 5000 步，但作者在 500 步已经看见变化，在 1000 步和 1750 步附近已经得到不错的效果。因此这套数据不必为了跑满计划而一直训练。

实际使用时保留中途版本，用相同的测试原图和提示词对比：

- 目标风格是否已经出现？
- 需要保留的人物特征和构图有没有被改坏？
- 继续训练后，是否真的比前一个版本更好？

视频中的一次迭代约 5.44 秒，“大约两小时”描述的是该次训练的量级。自己的耗时还会随步数、分辨率、量化与卸载设置变化。

## 训练完成后怎么用

下载训练得到的 LoRA，在对应的 Qwen Image 2.1 编辑工作流里测试。也可以使用 AI Toolkit 自带的测试入口，选择模型和 LoRA 后直接生成，先确认效果，再搬到常用的 ComfyUI 工作流。

基础模型的文生图、编辑和透明底图用法见 [Qwen Image 2.1 使用笔记：文生图、图像编辑与透明底图](qwen-image-2-1.md)。

## 资源

- [原视频与配套说明](https://www.bilibili.com/video/BV1GZhk6pEMw)
- [AI Toolkit 项目](https://github.com/ostris/ai-toolkit)
- [视频配套云端镜像](https://www.compshare.cn/images/eQKSibd8FCio)
