想让 H3 生成的视频带有某部番剧的画风,可以先从图片数据集训练风格 LoRA。这篇教程以视频里的《芙莉莲》示例为线索,完整整理素材筛选、打标、训练适配器、低显存配置、缓存和采样检查。
对应 9 月 25 日的视频教程。演示使用的是带 H3 功能的 Musubi Tuner 分支及配套云端镜像;界面中的模型路径与预设是该镜像提供的,本地安装时需要换成自己的路径。
训练前先准备好这些
| 项目 | 需要准备的内容 |
|---|---|
| 训练工具 | 视频使用的 Musubi Tuner H3 分支 |
| 模型 | 与训练任务对应的 H3 模型、文本编码器和 VAE |
| 数据集 | 清洗后的番剧图片,以及对应的描述文本 |
| 训练适配器 | circlestone-labs 的 H3 图片训练适配器 |
| 测试内容 | 能比较画风、人物和动作表现的采样提示词 |
视频使用 4090 演示配置调整,完整训练还使用过 H20。作者更倾向在较充裕的显存下训练;如果你用的是 24GB 设备,后面的量化、分辨率与交换设置尤其重要。
1. 数据集要覆盖画风,而不是只堆同一个人物
视频里的数据集约有 400 张图片,作者给出的经验范围是 350–500 张。整理时比数量更重要的是:这些图片能不能代表这部作品的画风。
选图时覆盖不同的:
- 角色和人物组合;
- 近景、中景、远景;
- 人物姿势、表情和镜头角度;
- 室内、室外和没有人物的空镜。
从视频提取图片后,删除高度相似的连续帧,并去掉字幕文字等干扰。如果整批素材几乎都是同一个角色和构图,训练得到的结果容易把人物特征与画风绑在一起,换个场景就不好用了。
已有截图合集也要经过筛选。视频中这一步花了不少时间,不能因为图片已经下载好,就把“有数据”当成“数据整理完成”。
2. 打标:触发词在前,画面内容在后
本教程的做法是给每张图配一个描述,前面放风格 LoRA 的触发词,后面写图里有哪些人物、在做什么、是什么场景。
如果一张图中有多位角色,就把角色区分清楚。视频里的例子会分别描述人物,让模型能把角色名字与对应的外观关联起来。
训练特定番剧画风时,作者没有在每条描述里反复添加泛泛的“动漫风格”词,而是描述具体内容,让作品共同的风格由数据本身体现。这是本次风格训练采用的打标思路。
打标后抽查几组图片和文本,重点看角色是否串名、人物数量是否正确,以及描述里有没有图中不存在的东西。
3. 图片训练适配器是做什么的
H3 最终要生成视频,但本次使用图片学习画风。直接进行纯图片训练时,除了学到目标风格,也可能改变原有的视频表现,出现动作变弱、画面像幻灯片的问题。
circlestone-labs 的适配器就是为这一训练方向设计的。按照作者说明,训练前将它融入基础模型,再在其上训练 LoRA;推理使用训练结果时,不再带这个训练适配器。
使用它时,不要叠加 CFG 增强训练或 guidance preservation loss。它与这些方法的组合有限制,不能看到训练器里有开关就全部打开。作者也明确说过,对视频与图视频混合训练的测试较少。
4. 先把预设调整到自己的显存范围
视频中的默认配置来自 H20,直接拿到 4090 上会出现显存警告。需要分别检查数据集、缓存和训练三个部分。
数据集与分辨率
把图片和描述放到自己的数据集目录,并让训练任务指向它。不要保留示例素材路径。
显存紧张时先降低训练分辨率。视频演示了向 768 或 1024 级别调整的思路;这里先让缓存和采样完整运行,再逐步提高画面尺寸。
文本编码器与训练精度
文本编码器缓存和模型训练是两个阶段,一个阶段能放进显存,不代表另一个阶段也能运行。
视频在 24GB 环境下切换了低显存的文本编码器配置,并在训练端使用 INT8 相关选项。字幕中的格式名称经作者分支文档核对为 NVFP4;它不是需要照着误识别文字手工拼出来的模型名。具体格式与文件对应关系看分支的 H3 文档。
Block swap
Block swap 将部分模型权重在内存和显存之间交换,能降低权重的显存占用,但也有传输开销。视频中观察显存提示后,使用过 20 的交换数量;这不是所有数据都固定填写的值。
先确认模型和素材对应的预估占用,再调整交换数量。如果主要压力来自高分辨率或很长的序列,还需要降低这些输入规模,不能只增加交换。
5. 按顺序缓存,然后开始训练
准备完成后,按视频里的顺序执行:
- 缓存 latent:处理训练图片对应的潜空间数据。
- 缓存文本编码器输出:处理图片描述的文本条件。
- 启动训练:使用前两步生成的缓存。
其中一步失败时,先处理该阶段的路径或显存问题,再继续下一步。视频的界面可以分步执行,也提供连续启动的入口。
6. 在训练开始时就检查采样
生成样片还会额外占用显存。若直到训练中途保存时才第一次采样,可能前面的训练正常,到了采样环节才失败。
需要训练样片时,启用起始采样,先确认它能生成。采样提示词、宽高、帧数和种子都换成自己的测试内容;不要一直用预设里别人的测试题材。
如果不需要训练中采样,也可以关闭这一环节,训练后再到 ComfyUI 比较不同版本。
7. 不一定选最后一个检查点
视频设置了 20000 步,但作者观察到约 16000 步时已经可用,继续训练后反而削弱了动态。因此挑选 LoRA 时,要同时比较画风和运动表现,不能只看某张静帧越来越像原作。
保留中途版本,用同一组提示词比较不同检查点。视频使用很少的图片演示启动速度,那一段不能拿来估算完整数据集的训练耗时。
如果你要训练的是参考图、视频编辑或复杂概念,而不只是番剧画风,可以接着看 用 AI Toolkit 训练 H3 参考生视频与编辑 LoRA。