文章摘要
DiffSynth-WebUI是开源团队推出的可私有化部署的扩散模型LoRA训练可视化工具。它支持20+主流模型系列LoRA训练,数据和权重可留存本地。借助动态NF4量化技术,24GB显存设备就能训10B以上大模型。全流程覆盖图像、视频、音频三类生成任务,还介绍了部署、上手步骤及显存不足的云端方案。

DiffSynth-WebUI是一款可私有化部署的扩散模型LoRA训练可视化工具,由开源团队推出。该工具将成熟的AIGC训练引擎搬到本地,支持训练20+主流模型系列的LoRA,无需编写Python脚本、修改配置文件或记忆复杂命令行参数,所有训练数据全程留存本地,训练权重也可完全私有。当前该工具已支持100+套训练配方,可覆盖图像、视频、音频三类生成任务,同时凭借动态NF4量化技术,可在24GB显存的设备上完成10B以上大模型的LoRA训练。

项目开源相关地址:

  • 核心代码仓库:可通过开源社区搜索DiffSynth-WebUI获取
  • 训练引擎仓库:可通过开源社区搜索DiffSynth-Studio获取
  • 效果演示:可通过官方演示页面查看工具实际运行效果

为何需要本地化的LoRA训练工具

当前不少AIGC服务平台都提供了在线LoRA训练功能,用户只需选择底模、上传训练图片即可完成训练,门槛极低。但部分场景下,用户需要更强的本地掌控权:比如训练数据涉及涉密内容无法上传至云端,或是需要在自有显卡设备上完成训练,又或是希望训练权重留存本地以便反复迭代优化。DiffSynth-WebUI正是为满足这类需求而生,它将成熟的在线训练引擎移植到本地,让用户无需依赖云端服务即可完成全流程训练。

动态NF4量化:24GB显存训练10B+大模型

在24GB显存预算下训练10B以上模型的LoRA,同类工具较常见的做法是8-bit量化,而DiffSynth-WebUI支持做到4-bit量化。它基于diffsynth.core.quant量化框架,用bitsandbytes NF4对冻结底模做动态量化:权重以4-bit紧凑格式常驻显存,前向时按需反量化。量化层前向可微,梯度能穿过4-bit底模到达LoRA分支,因此无需精度补偿模块,直接注入LoRA即可训练,导出的LoRA权重仍为全精度。

此外用户可用exclude_modules精细控制量化范围,把调制、时间步嵌入、输入/输出投影等小而敏感的层排除在外、保留原精度,让4-bit压缩集中在占参数量大头的注意力和FFN层。在界面中,这一步只需勾选NF4复选框并填写要排除的模块名。

从数据集到LoRA:全流程覆盖

DiffSynth-Studio对新模型的支持会直接映射为WebUI里的可选项,20个模型系列、100+套配方覆盖图像、视频、音频三类生成任务:

  • 图像生成:Qwen-Image家族即有15+种配方(基础版、Edit版、Layered分层控制、Distill蒸馏版等),另有FLUX.2、Z-Image、ERNIE-Image、Boogu-Image;
  • 视频生成:Wan系列20+种配置,涵盖T2V/I2V/VACE/Animate/Dancer等文生视频、图生视频与可控生成,另有LTX-2、MiniMax-H3;
  • 音频生成:提供Ace-Step等音乐/音频模型。

每套配方预设了LoRA目标模块、分辨率、学习率与数据集字段,选模型→选数据集→其余保持默认即可跑通第一轮训练,需要深调时参数也都在页面上。

数据集与自动标注

支持图像、视频、音频三种数据集,以metadata.jsonl组织样本并支持自定义扩展字段,无需手动裁剪或缩放,训练时按配置分辨率自动处理。自动标注可接入任意OpenAI兼容的多模态模型,批量生成或改写样本描述,标注完直接进入训练,不必在标注工具与训练工具之间倒腾数据。

训练后即时采样

训练结束后,WebUI会自动用最新Checkpoint生成验证样本,采样参数已在配方中定义,只需填写Prompt,在任务详情页即可判断该轮LoRA是否值得保留。

快速上手

部署工具的命令如下:

git clone --recurse-submodules https://github.com/diffsynth/DiffSynth-WebUI.git
cd DiffSynth-WebUI
pip install -e DiffSynth-Studio/
pip install -e .
bash training_ui/launch.sh
# Windows: powershell -ExecutionPolicy Bypass -File .\training_ui\launch_windows.ps1

打开http://127.0.0.1:8100/dashboard,即可通过五步完成第一个LoRA训练:

  • 进入Datasets → Create Dataset,选Image,导入几十张图片
  • 点击Auto-Caption批量生成描述(需先在Settings里配好标注模型),或手写Prompt
  • 进入New Task:选模型→选GPU→选数据集→其余保持默认;按需勾选NF4并填写要排除的模块名
  • 点击Create Task,进详情页查看日志与Loss曲线
  • 训练完成后在页面底部下载*.safetensors,并查看采样结果

显存不足时的云端解决方案

Qwen-Image、MiniMax-H3等模型仅bf16权重就有数十GB,本地显存不足时可将训练放到云端。相关云端Notebook服务提供AMD GPU环境,单卡显存192GB,预装ROCm+PyTorch,无需自行配置驱动与依赖。参与相关联合开发者激励计划可获得100-1000小时限时免费AMD GPU算力。

使用路径为三步:领取AMD免费GPU资源,在云端Notebook创建实例并选择AMD GPU环境,启动后按前文命令部署DiffSynth-WebUI,或直接打开演示链接一键运行。

以上内容不代表本平台立场,仅供读者参考