---
id: qwen-image-2-1
title: Qwen Image 2.1 使用笔记：文生图、图像编辑与透明底图
topic: 图像模型
aliases:
- 千问2.1
- 透明底图
- 图像编辑
applicability: []
publish: true
---

Qwen Image 2.1 可以用文字生成图片，也能基于已有图片进行编辑。这篇教程按照视频里的两套 ComfyUI 工作流，说明提示词增强、采样步数、输出尺寸和分辨率预算怎么用，并整理实际测试中值得注意的问题。

对应 [9 月 21 日的视频教程](https://www.bilibili.com/video/BV1oahe6TE1P)。先从文生图跑通基础配置，再尝试编辑和透明底图，会更容易区分问题出在哪里。

## 两套工作流怎么选

| 你想做什么 | 使用哪套工作流 | 主要输入 |
| --- | --- | --- |
| 从零设计场景、海报、插画 | 文生图 | 创意描述 |
| 修改已有图片、生成角色三视图、上色 | 图像编辑 | 原图＋编辑要求 |
| 生成透明底素材，或处理已有图的背景 | 按是否已有原图选择 | 透明背景要求，以及可选的原图 |

视频使用 Qwen Image 2.1 生成模型、Qwen3-VL 文本编码器和对应 VAE。模型各部分要和工作流匹配，不能只换一个生成模型文件，就默认其余配置也都适配。

## 1. 文生图：先描述创意，再决定是否增强提示词

视频里的文生图工作流接入了官方提示词增强模型。它的作用是把较短的创意补充成更具体的画面描述，再把结果送入生成模型。

使用顺序：

1. 选择画面尺寸与分辨率。
2. 输入想表达的主体、场景或画面创意。
3. 需要补足描述时，经过提示词增强环节。
4. 将生成的描述交给图像模型，检查结果，再调整原始创意。

如果你已经写好了足够清楚的提示词，重点是看增强后是否仍符合原意，而不是只看文字有没有变长。官方分别提供文生图和编辑方向的增强模型，使用说明见 [Prompt Rewriting](https://github.com/QwenLM/Qwen-Image-2.1#prompt-rewriting)。

## 2. 步数和精度怎样设置

下面是视频中展示的选择，不同工作流仍应以自己的效果对比为准：

| 设置 | 视频中的用法 | 影响 |
| --- | --- | --- |
| 25 步 | 偏快速生成 | 更快看到结果 |
| 40–50 步 | 作者更偏向的高画质选择 | 花更多采样时间，观察细节和噪点是否改善 |
| bf16 | 显存允许时优先使用 | 视频中作者更满意这一精度的效果 |
| 较低精度的量化模型 | 用于降低资源要求 | 需要重新比较画质，不能只比较是否能运行 |

视频还指出，在它使用的 **CFG＝1** 配置下，负面提示词不会起到预期作用。因此遇到画面问题时，不要只往负面提示词里堆词；先看正面描述、采样设置和模型能力是否足够。

## 3. 图像编辑：分清“画布尺寸”和“分辨率预算”

这两件事在使用时容易混在一起。

**输出尺寸决定画面是什么形状。** 例如原图是竖图，而你希望生成横向角色三视图，就需要使用指定的输出宽高，而不是沿用原图比例。视频演示了从原图比例切换到横向画布的做法。

**分辨率预算影响参与处理的图像规模。** 视频展示了这些取值：

| 预算值 | 视频中的说明 |
| --- | --- |
| 1024 | 较低的处理分辨率 |
| 1536 | 作者常用的折中选择 |
| 2048 | 更高分辨率，也会增加资源需求 |
| 0 | 沿用图片原本的分辨率，需要留意输入图大小 |

如果原图很大，使用 0 可能把显存压力直接带进工作流。因此先确认输入图的尺寸，再决定是否沿用原尺寸。视频里的默认选择是 1536。

编辑任务中，先用清楚的普通指令说明“保留什么、改变什么”。视频的编辑工作流没有默认加提示词增强，作者认为多数演示任务已够用；需要更细的描述时，再把增强环节接入。

## 4. 透明底图怎么理解

这里的目标是输出带透明通道的图，而不是生成一张看起来像透明棋盘格的图片。文生图时写清楚透明背景要求；编辑时明确要去掉或修改哪个背景，并检查最终文件的透明通道。

视频演示了透明素材生成和抠图，官方项目也给出了 RGBA 生成的说明。具体例子见 [模型项目](https://github.com/QwenLM/Qwen-Image-2.1)。

## 实测中哪些地方表现好，哪些还要检查

- **场景和光影**：作者比较满意场景构图、光影，以及偏三维质感的画面。
- **海报**：整体排版可以很好看，但文字一多，仍可能出现局部乱码。出图后要逐处读文字。
- **人物**：手指和肢体仍可能出错，不能因为整体审美不错就跳过检查。
- **编辑**：角色三视图、漫画上色和风格转换都能尝试，但部分输入图仍可能处理不好。
- **提示词语言**：作者在本次测试中感觉英文更好用，可以将同一编辑要求写成中英文分别比较。

如果你需要持续稳定地完成一种编辑效果，例如二次元转真人，可以接着看 [Qwen Image 2.1 编辑 LoRA：二次元转真人](qwen-image-2-1-lora-training.md)。

## 资源

- [原视频](https://www.bilibili.com/video/BV1oahe6TE1P)
- [视频配套资源](https://pan.quark.cn/s/4ea44f1849f1)
- [Qwen Image 2.1 项目与使用说明](https://github.com/QwenLM/Qwen-Image-2.1)
- [当前模型许可](https://github.com/QwenLM/Qwen-Image-2.1/blob/main/LICENSE)：商用前确认授权范围。
