这篇教程讲 H3 的参考生视频训练:怎样先确定训练目标,再准备参考素材、目标图片或视频,并在 AI Toolkit 里建立任务。视频同时演示了复杂概念数据和“二次元转真人”的编辑数据,它们的准备方式并不相同。
对应 9 月 18 日的视频教程,操作基于视频配套的云端 AI Toolkit 环境。
1. 先决定要让 LoRA 学什么
| 目标 | 主要素材 | 需要注意的关系 |
|---|---|---|
| 角色 | 角色图片 | 外观特征是否一致 |
| 画风 | 同一风格的多种图片 | 不能只有单一人物、姿势和场景 |
| 编辑转换 | 原始素材+目标素材 | 输入与目标必须配对 |
| 复杂视频概念 | 参考素材+目标视频+描述 | 参考对应关系、帧数、动作描述要正确 |
H3 有不同的条件输入方式。文生视频、首尾帧一类任务与任意参考素材一类任务,要选择相应模型和训练模式。视频中的参考生视频任务使用 Ref2V 方向;不要沿用前一期文生/图生视频任务后,只更换数据集路径。
如果你的目标只是用图片学习番剧画风,可以直接参考 用 Musubi Tuner 训练 H3 番剧风格 LoRA。
2. 视频数据:先把帧数和参考素材整理好
视频里的复杂概念数据按帧数分组,每条目标视频都有对应的参考图。这样上传之后,可以明确知道当前 bucket 对应哪种视频长度,不必在训练时再猜素材属于哪一组。
H3 视频使用 17k+5 的帧数规则。视频举过 22、73、141、158 帧等例子;作者分支的 H3 文档也确认了这一网格。素材帧数不匹配时,可能导致训练报错。
AI Toolkit 在本期演示中提供了 auto frame counts,可以向下对齐到支持的帧数。它能处理帧数对齐,但不会替你检查参考图有没有配错,也不会判断视频描述是否准确。
打标时重点检查这三件事:
- 描述的是不是当前这一条视频?批量交给 AI 时可能串片。
- 动作、人物与画面是否真的存在?不要把 AI 编出的细节留在描述里。
- 参考图与目标视频的对应关系是否一致?
视频作者建议借助官方提示词规范组织复杂概念的描述,但仍要抽查。训练简单图片概念时,不必照搬复杂视频的整套打标流程。
3. 编辑数据:control 是输入,targets 是目标
视频中的另一个例子是把二次元素材转换成真人效果。准备方式是两套对应的数据:
control:原始输入,例如二次元图片。targets:希望生成的目标,例如对应的真人效果图。
作者把不同目标风格分成了不同组,一组更自然,另一组偏美颜效果。训练结果后来也会越来越倾向于数据里的风格,所以先看清楚目标数据是什么,再判断模型为什么学成那样。
这套图片编辑示例没有逐张单独打标,而是在任务中设置统一的 default caption,描述要做的转换。已有逐张描述的数据则使用自己的描述,不要把“没写旁边的文本文件”理解为“没有文字条件”。
4. 建立训练任务
上传完数据,在 AI Toolkit 中建立新任务,或复制教程已有任务后修改。按以下顺序检查:
- 模型和模式:选择当前要训练的 H3 参考生视频模型。
- 训练方法与适配器:确认是使用训练适配器,还是另一种训练方法。
- 数据绑定:把原始素材绑定到 control,目标素材绑定到 targets。
- 文字条件:填写默认转换描述,或使用已经准备好的逐条描述。
- 采样内容:替换示例路径和提示词,使用自己的素材检查效果。
图片和视频任务的配置也不同。视频演示的纯图片任务没有音频,frame count 使用 1;如果输入的是视频,不要把这一组图片设置原样套过去。参考图与参考视频对应的输入类型也要选择正确。
5. 训练适配器和保留能力的方法,不要混着开
视频比较了不同适配器及训练方法,也提到了使用教师模型保留原模型能力的方式。这些选项影响训练行为和耗时,不是越多越好。
其中 circlestone-labs 的图片训练适配器有明确限制:使用时不应同时开启 CFG 增强训练或 guidance preservation loss。作者资料的这个限制应优先于“把效果相关选项全部打开”的直觉。
第一次运行时,使用教程中同一套相互匹配的配置,先跑通数据与采样。更换适配器时,重新核对训练方法,而不只是替换一个文件路径。
6. Rank、步数和显存设置
| 项目 | 视频中的例子 | 怎么理解 |
|---|---|---|
| LoRA rank | 16 或 32 | 本期提供的候选值,按自己的任务比较 |
| 训练步数 | 示例设为 5000 | 是训练计划,不代表最佳版本一定在最后 |
| 检查点保留 | 演示保留 10 个 | 方便回看中途效果,避免只剩最新版本 |
| Offloading | 根据显卡调整 | 用时间和数据搬运换取显存空间 |
| 分辨率 | 显存不足时降低 | 图片、视频和参考输入都会影响占用 |
不要把视频里 H20 的迭代速度当作自己机器的预期。先用自己的素材跑一次缓存、采样和短训练,确认资源够用,再延长任务。
7. 下载 LoRA,并回看训练是否符合目标
训练开始后观察样片,完成后下载 LoRA。编辑任务重点检查转换是否实现,以及人物、姿势和内容是否保留;复杂视频概念还要看动作与参考约束是否学对。
如果结果逐渐变成了不想要的“美颜感”或其他固定风格,先回看目标素材。视频中已经出现过训练结果受到这类数据倾向影响的情况。
另一套配对编辑训练的具体操作见 Qwen Image 2.1 编辑 LoRA:二次元转真人;两者的数据组织思路可以对照,但模型与训练配置不能直接互换。