DiffSynth-Studio开源:多LoRA模型提升图像生成能力

DiffSynth-Studio开源了三项基于LoRA的图像生成优化方案,通过不同维度的LoRA模块重组,全面提升了大模型的指令遵循、文本渲染以及稀有物种生成能力,部分场景下的生成精度甚至超越了部分闭源大模型。
团队围绕“多LoRA同时加载时如何分配”这一问题展开了系统性探索,最终形成核心判断:LoRA不仅是基础模型的轻量微调工具,更是拓展与重组模型能力的模块化组件,而决定模型能力上限的关键在于“如何科学分配LoRA”。
本次开源的两项重点工作分别为MultiAlign与TreeAdapter,二者均建立在前期验证路线可行性的ArtAug方案之上。
在正式讲解技术细节前,我们可以先直观感受三项方案带来的生成效果差异:
MultiAlign方案在长指令遵循、多物体场景布局以及画面内嵌文字渲染等综合场景中提升尤为明显。我们使用了三组包含复杂场景和内嵌英文的长提示词进行测试,对比基础模型与优化后的生成效果:
- 第一组提示词围绕地中海厨房场景,包含特定装饰细节与刺绣文字,优化后的方案能够更精准还原场景元素与文字细节
- 第二组提示词聚焦圣诞集市场景,优化后的方案可以更好还原摊位标识、灯光氛围与整体节日氛围感
- 第三组提示词描述阿尔卑斯山早餐场景,优化后的方案能够准确呈现标签文字与自然景观细节
TreeAdapter方案则专注于稀有物种生成,借助超过1万个LoRA模块组成的树形模型系统,能够精准还原不同物种的独特视觉特征,生成的稀有物种图像细节与真实度表现突出。
按时间步分配LoRA:MultiAlign全方位提升基础能力
图像生成模型经过多年发展,已经在基础能力上相比早期版本有了明显提升,ArtAug方案能够增强图像细节,但团队也意识到需要进一步优化多维度的综合能力,比如文字渲染、指令遵循能力等。
团队观察到,在扩散模型的去噪迭代过程中,从高斯随机噪声到清晰图像的生成过程中,不同阶段的模型承担的任务不同:高噪声含量阶段负责构建整体构图,低噪声含量阶段负责填充局部细节。基于这一观察,团队借鉴了多阶段模型的架构思路,设计了MoE LoRA方案。
该方案根据生成过程中的Timestep动态调整LoRA的权重,避免了为每个时间步单独训练LoRA带来的参数浪费问题。训练过程中设置了三个量化目标:指令遵循能力、文本渲染能力以及美学对齐能力,从多个维度全面提升模型的综合表现。相关技术细节将在后续公开。
按内容分类分配:TreeAdapter实现精准稀有物种生成
当前图像生成模型在稀有物种生成领域存在明显短板,这类数据服从长尾分布,每个物种都有独特的视觉特征,而现有模型难以精准还原这些细节。团队借鉴生物学中“界门纲目科属种”的分类体系,构建了一个树形LoRA模型系统,每个树形分类节点对应一个独立的LoRA模型。
在推理阶段,当需要生成某一物种的图像时,系统会根据该物种的分类路径检索对应的LoRA模块,将路径上的所有LoRA结合使用,即可精准还原该物种的全部视觉特征。团队构建的系统包含超过1万个LoRA模块,能够覆盖绝大多数生物物种,生成的稀有物种图像精准程度甚至超越了部分闭源大模型。相关技术细节已公开。
按数据维度优化:ArtAug增强图像细节渲染能力
图像生成模型的细节渲染质量高度依赖训练数据的质量,ArtAug方案的核心思路是让模型“照着更好的自己”学习。团队通过收集模型自身生成的图像数据对进行差分训练。
每个数据对包含两张图像,均由同一基础模型生成,其中第二张图像使用了耗时更长的分区提示词进行润色,细节更加丰富。随后通过差分训练的方式训练LoRA模型学习两张图像之间的差异:先用第一张图像训练LoRA A,再将LoRA A融入基础模型,基于融合后的模型用第二张图像训练LoRA B,最终LoRA B可以将第一张图像优化为第二张图像的细节水平。
团队将多个这样的LoRA模块融合,得到了细节渲染能力更强的增强模型,并通过迭代训练持续优化模型效果,最终生成的图像更加符合人类审美。相关技术细节已公开。
结语
三项方案分别从时间步、内容分类与数据维度三个不同方向探索了LoRA的优化潜力,证明了科学分配LoRA模块能够有效突破现有图像生成模型的能力上限。团队表示,未来将继续围绕LoRA的更多应用场景展开探索,并通过开源项目DiffSynth-Studio推动相关技术的创新与落地。


