Qwen Image 2.1 可以用文字生成图片,也能基于已有图片进行编辑。这篇教程按照视频里的两套 ComfyUI 工作流,说明提示词增强、采样步数、输出尺寸和分辨率预算怎么用,并整理实际测试中值得注意的问题。
对应 9 月 21 日的视频教程。先从文生图跑通基础配置,再尝试编辑和透明底图,会更容易区分问题出在哪里。
两套工作流怎么选
| 你想做什么 | 使用哪套工作流 | 主要输入 |
|---|---|---|
| 从零设计场景、海报、插画 | 文生图 | 创意描述 |
| 修改已有图片、生成角色三视图、上色 | 图像编辑 | 原图+编辑要求 |
| 生成透明底素材,或处理已有图的背景 | 按是否已有原图选择 | 透明背景要求,以及可选的原图 |
视频使用 Qwen Image 2.1 生成模型、Qwen3-VL 文本编码器和对应 VAE。模型各部分要和工作流匹配,不能只换一个生成模型文件,就默认其余配置也都适配。
1. 文生图:先描述创意,再决定是否增强提示词
视频里的文生图工作流接入了官方提示词增强模型。它的作用是把较短的创意补充成更具体的画面描述,再把结果送入生成模型。
使用顺序:
- 选择画面尺寸与分辨率。
- 输入想表达的主体、场景或画面创意。
- 需要补足描述时,经过提示词增强环节。
- 将生成的描述交给图像模型,检查结果,再调整原始创意。
如果你已经写好了足够清楚的提示词,重点是看增强后是否仍符合原意,而不是只看文字有没有变长。官方分别提供文生图和编辑方向的增强模型,使用说明见 Prompt Rewriting。
2. 步数和精度怎样设置
下面是视频中展示的选择,不同工作流仍应以自己的效果对比为准:
| 设置 | 视频中的用法 | 影响 |
|---|---|---|
| 25 步 | 偏快速生成 | 更快看到结果 |
| 40–50 步 | 作者更偏向的高画质选择 | 花更多采样时间,观察细节和噪点是否改善 |
| bf16 | 显存允许时优先使用 | 视频中作者更满意这一精度的效果 |
| 较低精度的量化模型 | 用于降低资源要求 | 需要重新比较画质,不能只比较是否能运行 |
视频还指出,在它使用的 CFG=1 配置下,负面提示词不会起到预期作用。因此遇到画面问题时,不要只往负面提示词里堆词;先看正面描述、采样设置和模型能力是否足够。
3. 图像编辑:分清“画布尺寸”和“分辨率预算”
这两件事在使用时容易混在一起。
输出尺寸决定画面是什么形状。 例如原图是竖图,而你希望生成横向角色三视图,就需要使用指定的输出宽高,而不是沿用原图比例。视频演示了从原图比例切换到横向画布的做法。
分辨率预算影响参与处理的图像规模。 视频展示了这些取值:
| 预算值 | 视频中的说明 |
|---|---|
| 1024 | 较低的处理分辨率 |
| 1536 | 作者常用的折中选择 |
| 2048 | 更高分辨率,也会增加资源需求 |
| 0 | 沿用图片原本的分辨率,需要留意输入图大小 |
如果原图很大,使用 0 可能把显存压力直接带进工作流。因此先确认输入图的尺寸,再决定是否沿用原尺寸。视频里的默认选择是 1536。
编辑任务中,先用清楚的普通指令说明“保留什么、改变什么”。视频的编辑工作流没有默认加提示词增强,作者认为多数演示任务已够用;需要更细的描述时,再把增强环节接入。
4. 透明底图怎么理解
这里的目标是输出带透明通道的图,而不是生成一张看起来像透明棋盘格的图片。文生图时写清楚透明背景要求;编辑时明确要去掉或修改哪个背景,并检查最终文件的透明通道。
视频演示了透明素材生成和抠图,官方项目也给出了 RGBA 生成的说明。具体例子见 模型项目。
实测中哪些地方表现好,哪些还要检查
- 场景和光影:作者比较满意场景构图、光影,以及偏三维质感的画面。
- 海报:整体排版可以很好看,但文字一多,仍可能出现局部乱码。出图后要逐处读文字。
- 人物:手指和肢体仍可能出错,不能因为整体审美不错就跳过检查。
- 编辑:角色三视图、漫画上色和风格转换都能尝试,但部分输入图仍可能处理不好。
- 提示词语言:作者在本次测试中感觉英文更好用,可以将同一编辑要求写成中英文分别比较。
如果你需要持续稳定地完成一种编辑效果,例如二次元转真人,可以接着看 Qwen Image 2.1 编辑 LoRA:二次元转真人。
资源
- 原视频
- 视频配套资源
- Qwen Image 2.1 项目与使用说明
- 当前模型许可:商用前确认授权范围。