文章摘要
这是2026版Stable Diffusion教程,介绍了从基础到进阶的AI绘画全流程。先讲解基础认知,包括概念、版本演进和硬件要求;再说明环境搭建,对比WebUI与ComfyUI;接着阐述核心操作,如模型选择、提示词工程等;还涉及ComfyUI工作流、ControlNet精准控制、生成质量优化等内容,最后给出常用模型与资源推荐及常见问题解答。

Stable Diffusion是2022年由Stability AI、CompVis和LAION等团队联合发布的开源文本生成图像模型。本Stable Diffusion教程将从基础概念、环境搭建、核心参数到进阶技巧进行系统讲解,帮助读者全面掌握这一AI绘画工具的使用方法。教程涵盖WebUI与ComfyUI两种主流操作界面,详解提示词工程、模型选择、采样方法及ControlNet精准控制等关键技能。

Stable Diffusion教程

第一节 Stable Diffusion基础认知

一、什么是Stable Diffusion

Stable Diffusion是一种基于扩散模型的深度学习算法,能够根据文本描述生成高质量图像。与早期的生成对抗网络(GAN)不同,Stable Diffusion通过逐步去噪的方式从随机噪声中构建出清晰的图像。其核心技术是变分自编码器(VAE) ,通过将图像压缩到潜空间(Latent Space)进行计算,大幅降低了硬件算力需求。这意味着普通消费级显卡即可流畅运行Stable Diffusion。

Stable Diffusion的核心功能包括:

  • 文生图(Text-to-Image) :输入文字提示词,模型根据描述生成对应图像
  • 图生图(Image-to-Image) :上传一张原图并配合文字提示,实现风格迁移或内容修改
  • 局部重绘(Inpainting)与外延扩图(Outpainting) :对图像特定区域进行修改或扩展画布边界
  • ControlNet精准控制:通过线条、景深、姿态等额外条件精确控制生成结果

二、Stable Diffusion的版本演进

截至2026年,Stable Diffusion已发布了多个重要版本。Stable Diffusion 1.5是目前兼容性最广、社区资源最丰富的经典版本。Stable Diffusion XL(SDXL) 在此基础上大幅提升了图像质量与分辨率。Stable Diffusion 3.5引入了MMDiT(Multimodal Diffusion Transformer)架构。Stable Diffusion 4于2026年正式发布,支持原生4K分辨率输出,并在Apache 2.0许可下完全开源免费商用。不同版本在硬件需求、图像质量与控制精度上各有侧重。

三、硬件配置要求

运行Stable Diffusion需要一定的硬件基础。以下是建议配置:

硬件组件 最低要求 推荐配置
显卡(GPU) 显存4GB以上(NVIDIA) RTX 3060或更高(8GB+显存)
系统内存 8GB 16GB或以上
存储空间 40GB(固态硬盘) 100GB-200GB(固态硬盘)
操作系统 Windows 10/11 64位 Windows 11

显存低于3GB的显卡可通过低显存模式运行,但生成速度会明显下降。Mac用户可利用M系列芯片的MPS加速。

第二节 Stable Diffusion环境搭建

一、WebUI整合包安装(推荐新手)

对于刚接触Stable Diffusion的新手,使用整合包是最便捷的入门方式。目前最流行的整合包由秋葉aaaki制作,版本为v4.11.1。

安装步骤

  1. 下载整合包压缩包(如sd-webui-aki-v4.11.1-cu128.zip
  2. 解压到本地目录(建议预留充足的硬盘空间)
  3. 安装启动依赖(dotnet-6.0.11.exe
  4. 将下载的模型文件放入\models\Stable-diffusion目录
  5. 双击A绘世启动器.exe,点击“一键启动”
  6. 等待依赖安装完成后,浏览器自动打开WebUI操作界面

首次启动可能需要10-30分钟(取决于网络状况)。

二、ComfyUI安装与配置

ComfyUI是基于节点的图形界面,适合需要精细化控制工作流的进阶用户。它的显存效率比WebUI高30%-50% ,但学习曲线较陡。

安装方式

git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI
python -m venv venv
# Windows: venv\Scripts\activate
pip install -r requirements.txt
python main.py

浏览器打开http://127.0.0.1:8188即可访问ComfyUI界面。也推荐使用秋葉整合包一键部署ComfyUI。

三、WebUI与ComfyUI横向对比

对比维度 WebUI(A1111) ComfyUI Fooocus
操作方式 图形表单界面 节点式工作流 极简开箱即用
上手难度 最低
灵活度 最高
显存效率 基准 省30%-50%
扩展性 丰富 自定义节点生态持续完善 有限
工作流复用 有限 JSON文件保存与分享 有限

选择建议:新手从WebUI入手,需要精细控制和批量自动化时转向ComfyUI。

第三节 Stable Diffusion核心操作

一、模型体系详解

Stable Diffusion的生成质量高度依赖模型选择。主要模型类型包括:

  • Checkpoint(大模型/底模) :决定画面整体风格与质量的基础模型,格式为CKPT或SAFETENSORS
  • VAE(变分自编码器) :相当于调色板,负责保持画面色彩和谐
  • LoRA(低秩适配) :轻量级模型插件,在大模型基础上微调特定风格或元素
  • ControlNet:控制插件,从参考图中提取线条、景深、姿态等信息
  • Embedding(文本嵌入) :用于固定特定概念或风格的文本向量

模型资源获取

资源平台 特点 适用人群
Civitai(C站) 全球最大SD模型社区,海量资源 所有用户
Hugging Face 官方模型发布平台 开发者
LiblibAI 国内热门社区,中文界面 国内用户

下载模型时需确认适配版本(SD1.5/SDXL/SD3),优先选择safetensors格式(安全性更高)。

二、提示词工程基础

提示词(Prompt)是与Stable Diffusion沟通的核心方式。提示词的质量直接决定生成效果。

正向提示词(Positive Prompt) 描述期望生成的内容。反向提示词(Negative Prompt) 描述不希望出现的内容。

CLIP文本编码器将提示词映射到高维向量空间,最长支持77个token。提示词越精准、越具体,生成结果越符合预期。

提示词的四层结构

  1. 主体层:画面核心对象(人物、物体、场景)
  2. 风格层:艺术风格、流派(摄影、插画、3D渲染)
  3. 细节层:材质、光照、色彩、构图
  4. 质量层:画质修饰词(如“高细节”“杰作”)

权重控制语法:

  • (关键词:1.2) — 将权重提升至1.2倍
  • [关键词] — 降低权重
  • 关键词1 | 关键词2 — 交替生成

三、核心参数设置

Stable Diffusion的生成参数需要联动调整。

采样步数(Steps) :步数越多图像质量越高但耗时更长。日常使用20-30步,高质量出图40-50步。快速预览可用15-20步。

采样方法(Sampler) :不同采样器适用不同场景:

采样器 特点 适用场景
DPM++ 2M Karras 20步收敛,稳定性高 结构清晰的图像
DPM++ SDE Karras 8步出形,随机性强 抽象、氛围型图像
Euler a 适合快速迭代 草图、多版本尝试
DDIM 需30+步稳定 精细控制场景

CFG Scale(提示词引导强度) :控制生成结果对提示词的遵循程度。默认值7.0。DPM++类采样器建议CFG 4-6,DDIM类建议7-9。CFG超过10时容易出现色彩溢出。

随机种子(Seed) :固定种子可重现相同结果。

四、文生图操作流程

在WebUI中执行文生图的基本流程:

  1. 在正向提示词框输入描述内容
  2. 在反向提示词框输入不希望出现的内容
  3. 选择Checkpoint模型
  4. 设置采样方法、步数、CFG Scale
  5. 设置图像宽高(SD1.5推荐512×512,SDXL推荐1024×1024)
  6. 点击生成按钮

五、图生图与局部重绘

图生图(Img2Img) :上传一张参考图,配合提示词实现风格迁移或内容修改。关键参数是去噪强度(Denoising Strength) :值越小越接近原图,值越大改动越激进。

局部重绘(Inpainting) :用蒙版标记需要修改的区域,Stable Diffusion仅在该区域内重新生成。适用于瑕疵修复、物体替换等场景。

第四节 ComfyUI工作流进阶

一、节点式工作流核心概念

ComfyUI将图像生成过程拆解为一系列可连接的节点。每个节点代表一个功能单元。

核心节点包括:

  • Load Checkpoint — 加载模型
  • CLIP Text Encode — 编码提示词(正向/反向)
  • KSampler — 采样生成
  • VAE Decode — 解码潜空间图像
  • Save Image — 保存结果

二、工作流搭建实战

最简文生图工作流:

Load Checkpoint → CLIP Text Encode (Positive) → KSampler → VAE Decode → Save Image
→ CLIP Text Encode (Negative) →

KSampler核心参数:

  • steps:20-30步
  • cfg:7-8
  • seed:固定可复现
  • denoise:1.0(文生图)

工作流可保存为JSON文件,便于复用和分享。

三、ComfyUI与WebUI模型共享

如果已安装WebUI并下载了模型,可将模型共享给ComfyUI以节省硬盘空间。在ComfyUI根目录找到extra_model_paths.yaml.example文件,配置WebUI的模型路径即可。

第五节 ControlNet精准控制

一、ControlNet原理

ControlNet是一组神经网络结构,通过额外的条件输入来控制Stable Diffusion的生成过程。它可以从参考图像中提取结构信息,引导模型生成符合特定构图要求的图像。

主流ControlNet类型

  • Canny边缘:提取线稿和轮廓
  • Depth深度图:提取3D结构信息
  • OpenPose姿态:提取人体骨骼关键点
  • Scribble涂鸦:手绘草图引导
  • Seg语义分割:区域语义控制

二、ControlNet实战应用

ControlNet在以下场景中尤为实用:

  • 线稿上色:上传线稿,Stable Diffusion自动上色
  • 姿态迁移:参考特定姿势生成角色
  • 构图控制:确保主体位置、比例符合预期
  • 风格转绘:保持原图结构的同时转换风格

Stable Diffusion 4已集成ControlNet 3,进一步提升了结构引导的精度和灵活性。

第六节 生成质量优化技巧

一、高清修复与放大

Stable Diffusion原生分辨率有限(SD1.5为512×512,SDXL为1024×1024)。可通过以下方式获得高分辨率图像:

  • 高清修复(Hires. fix) :先生成低分辨率图像,再放大并补充细节
  • Tiled Diffusion:分块采样生成任意分辨率图像
  • 外部放大工具:使用ESRGAN等超分辨率模型

二、性能优化建议

  • 采样步数从50降到20,速度提升约60%,质量损失小于5%
  • 使用DPM系列采样器在速度与质量间取得平衡
  • ComfyUI比WebUI节省30%-50%显存
  • 固态硬盘可显著加快模型加载速度

三、常见问题排查

生成图像模糊:检查采样步数是否过低(建议20步以上),或CFG Scale是否过高(超过10易出现伪影)。

人物畸形:在反向提示词中加入“deformed, extra limbs, bad anatomy”等负面词。

色彩异常:检查是否缺少VAE模型,或更换其他VAE试试。

显存不足:降低生成分辨率、减少批量大小,或使用ComfyUI的低显存模式。

第七节 常用模型与资源推荐

一、热门模型速览

模型名称 适用方向 特点
SDXL 通用创作 高分辨率基础模型
RealVisXL 写实摄影 照片级真实感
Juggernaut XL 电影质感 电影级光影
DreamShaper 奇幻插画 梦幻风格
Anything V5 二次元动漫 动漫风格
SD 3.5 新一代基础 MMDiT架构
Flux系列 高质量创作 细节丰富

二、学习资源推荐

  • Civitai:模型下载与社区交流
  • Hugging Face:官方模型发布
  • StableDiffusionBook:系统学习导航
  • LiblibAI:国内中文模型社区

常见问题解答(FAQ)

Q1:Stable Diffusion对电脑配置要求高吗?
Stable Diffusion可在显存4GB以上的消费级显卡上运行。推荐使用RTX 3060或更高配置。没有独立显卡也可用CPU模式运行,但生成速度会慢很多。

Q2:WebUI和ComfyUI应该选哪个?
新手建议从WebUI入手,操作直观、上手快。需要精细化控制、批量自动化或显存紧张时,推荐ComfyUI。

Q3:提示词怎么写效果更好?
提示词应遵循“主体→风格→细节→质量”的四层结构。关键词越具体越精准,善用括号调整权重。反向提示词同样重要,可有效避免畸形等常见问题。

Q4:生成的人物手部总画不好怎么办?
在反向提示词中加入“bad hands, extra fingers, deformed hands”等词。也可以使用ControlNet的OpenPose姿态控制来约束手部位置。

Q5:Stable Diffusion 4有什么新特性?
Stable Diffusion 4于2026年发布,支持原生4K分辨率输出,集成了ControlNet 3,并新增了原生视频生成能力(最长60秒)。在Apache 2.0许可下完全免费商用。

Q6:如何获取更多的Stable Diffusion模型?
推荐访问Civitai(全球最大SD模型社区)和Hugging Face(官方发布平台)。国内用户可使用LiblibAI。

Q7:采样步数设多少合适?
日常使用20-30步,快速预览15-20步,高质量出图40-50步。不同采样器对步数的敏感度不同。

Q8:CFG Scale是什么意思?怎么调?
CFG Scale控制生成结果对提示词的遵循程度,默认7.0。DPM++类采样器建议4-6,DDIM类建议7-9。超过10容易出现色彩溢出。

以上内容不代表本平台立场,仅供读者参考