这篇教程讲 H3 的参考生视频训练:怎样先确定训练目标,再准备参考素材、目标图片或视频,并在 AI Toolkit 里建立任务。视频同时演示了复杂概念数据和“二次元转真人”的编辑数据,它们的准备方式并不相同。

对应 9 月 18 日的视频教程,操作基于视频配套的云端 AI Toolkit 环境。

1. 先决定要让 LoRA 学什么

目标主要素材需要注意的关系
角色角色图片外观特征是否一致
画风同一风格的多种图片不能只有单一人物、姿势和场景
编辑转换原始素材+目标素材输入与目标必须配对
复杂视频概念参考素材+目标视频+描述参考对应关系、帧数、动作描述要正确

H3 有不同的条件输入方式。文生视频、首尾帧一类任务与任意参考素材一类任务,要选择相应模型和训练模式。视频中的参考生视频任务使用 Ref2V 方向;不要沿用前一期文生/图生视频任务后,只更换数据集路径。

如果你的目标只是用图片学习番剧画风,可以直接参考 用 Musubi Tuner 训练 H3 番剧风格 LoRA。

2. 视频数据:先把帧数和参考素材整理好

视频里的复杂概念数据按帧数分组,每条目标视频都有对应的参考图。这样上传之后,可以明确知道当前 bucket 对应哪种视频长度,不必在训练时再猜素材属于哪一组。

H3 视频使用 17k+5 的帧数规则。视频举过 22、73、141、158 帧等例子;作者分支的 H3 文档也确认了这一网格。素材帧数不匹配时,可能导致训练报错。

AI Toolkit 在本期演示中提供了 auto frame counts,可以向下对齐到支持的帧数。它能处理帧数对齐,但不会替你检查参考图有没有配错,也不会判断视频描述是否准确。

打标时重点检查这三件事:

  • 描述的是不是当前这一条视频?批量交给 AI 时可能串片。
  • 动作、人物与画面是否真的存在?不要把 AI 编出的细节留在描述里。
  • 参考图与目标视频的对应关系是否一致?

视频作者建议借助官方提示词规范组织复杂概念的描述,但仍要抽查。训练简单图片概念时,不必照搬复杂视频的整套打标流程。

3. 编辑数据:control 是输入,targets 是目标

视频中的另一个例子是把二次元素材转换成真人效果。准备方式是两套对应的数据:

  • control:原始输入,例如二次元图片。
  • targets:希望生成的目标,例如对应的真人效果图。

作者把不同目标风格分成了不同组,一组更自然,另一组偏美颜效果。训练结果后来也会越来越倾向于数据里的风格,所以先看清楚目标数据是什么,再判断模型为什么学成那样。

这套图片编辑示例没有逐张单独打标,而是在任务中设置统一的 default caption,描述要做的转换。已有逐张描述的数据则使用自己的描述,不要把“没写旁边的文本文件”理解为“没有文字条件”。

4. 建立训练任务

上传完数据,在 AI Toolkit 中建立新任务,或复制教程已有任务后修改。按以下顺序检查:

  1. 模型和模式:选择当前要训练的 H3 参考生视频模型。
  2. 训练方法与适配器:确认是使用训练适配器,还是另一种训练方法。
  3. 数据绑定:把原始素材绑定到 control,目标素材绑定到 targets。
  4. 文字条件:填写默认转换描述,或使用已经准备好的逐条描述。
  5. 采样内容:替换示例路径和提示词,使用自己的素材检查效果。

图片和视频任务的配置也不同。视频演示的纯图片任务没有音频,frame count 使用 1;如果输入的是视频,不要把这一组图片设置原样套过去。参考图与参考视频对应的输入类型也要选择正确。

5. 训练适配器和保留能力的方法,不要混着开

视频比较了不同适配器及训练方法,也提到了使用教师模型保留原模型能力的方式。这些选项影响训练行为和耗时,不是越多越好。

其中 circlestone-labs 的图片训练适配器有明确限制:使用时不应同时开启 CFG 增强训练或 guidance preservation loss。作者资料的这个限制应优先于“把效果相关选项全部打开”的直觉。

第一次运行时,使用教程中同一套相互匹配的配置,先跑通数据与采样。更换适配器时,重新核对训练方法,而不只是替换一个文件路径。

6. Rank、步数和显存设置

项目视频中的例子怎么理解
LoRA rank16 或 32本期提供的候选值,按自己的任务比较
训练步数示例设为 5000是训练计划,不代表最佳版本一定在最后
检查点保留演示保留 10 个方便回看中途效果,避免只剩最新版本
Offloading根据显卡调整用时间和数据搬运换取显存空间
分辨率显存不足时降低图片、视频和参考输入都会影响占用

不要把视频里 H20 的迭代速度当作自己机器的预期。先用自己的素材跑一次缓存、采样和短训练,确认资源够用,再延长任务。

7. 下载 LoRA,并回看训练是否符合目标

训练开始后观察样片,完成后下载 LoRA。编辑任务重点检查转换是否实现,以及人物、姿势和内容是否保留;复杂视频概念还要看动作与参考约束是否学对。

如果结果逐渐变成了不想要的“美颜感”或其他固定风格,先回看目标素材。视频中已经出现过训练结果受到这类数据倾向影响的情况。

另一套配对编辑训练的具体操作见 Qwen Image 2.1 编辑 LoRA:二次元转真人;两者的数据组织思路可以对照,但模型与训练配置不能直接互换。

资源