Stable Diffusion教程:从零开始掌握AI绘画的全流程操作指南(2026版)

Stable Diffusion是2022年由Stability AI、CompVis和LAION等团队联合发布的开源文本生成图像模型。本Stable Diffusion教程将从基础概念、环境搭建、核心参数到进阶技巧进行系统讲解,帮助读者全面掌握这一AI绘画工具的使用方法。教程涵盖WebUI与ComfyUI两种主流操作界面,详解提示词工程、模型选择、采样方法及ControlNet精准控制等关键技能。

第一节 Stable Diffusion基础认知
一、什么是Stable Diffusion
Stable Diffusion是一种基于扩散模型的深度学习算法,能够根据文本描述生成高质量图像。与早期的生成对抗网络(GAN)不同,Stable Diffusion通过逐步去噪的方式从随机噪声中构建出清晰的图像。其核心技术是变分自编码器(VAE) ,通过将图像压缩到潜空间(Latent Space)进行计算,大幅降低了硬件算力需求。这意味着普通消费级显卡即可流畅运行Stable Diffusion。
Stable Diffusion的核心功能包括:
- 文生图(Text-to-Image) :输入文字提示词,模型根据描述生成对应图像
- 图生图(Image-to-Image) :上传一张原图并配合文字提示,实现风格迁移或内容修改
- 局部重绘(Inpainting)与外延扩图(Outpainting) :对图像特定区域进行修改或扩展画布边界
- ControlNet精准控制:通过线条、景深、姿态等额外条件精确控制生成结果
二、Stable Diffusion的版本演进
截至2026年,Stable Diffusion已发布了多个重要版本。Stable Diffusion 1.5是目前兼容性最广、社区资源最丰富的经典版本。Stable Diffusion XL(SDXL) 在此基础上大幅提升了图像质量与分辨率。Stable Diffusion 3.5引入了MMDiT(Multimodal Diffusion Transformer)架构。Stable Diffusion 4于2026年正式发布,支持原生4K分辨率输出,并在Apache 2.0许可下完全开源免费商用。不同版本在硬件需求、图像质量与控制精度上各有侧重。
三、硬件配置要求
运行Stable Diffusion需要一定的硬件基础。以下是建议配置:
| 硬件组件 | 最低要求 | 推荐配置 |
|---|---|---|
| 显卡(GPU) | 显存4GB以上(NVIDIA) | RTX 3060或更高(8GB+显存) |
| 系统内存 | 8GB | 16GB或以上 |
| 存储空间 | 40GB(固态硬盘) | 100GB-200GB(固态硬盘) |
| 操作系统 | Windows 10/11 64位 | Windows 11 |
显存低于3GB的显卡可通过低显存模式运行,但生成速度会明显下降。Mac用户可利用M系列芯片的MPS加速。
第二节 Stable Diffusion环境搭建
一、WebUI整合包安装(推荐新手)
对于刚接触Stable Diffusion的新手,使用整合包是最便捷的入门方式。目前最流行的整合包由秋葉aaaki制作,版本为v4.11.1。
安装步骤:
- 下载整合包压缩包(如
sd-webui-aki-v4.11.1-cu128.zip) - 解压到本地目录(建议预留充足的硬盘空间)
- 安装启动依赖(
dotnet-6.0.11.exe) - 将下载的模型文件放入
\models\Stable-diffusion目录 - 双击
A绘世启动器.exe,点击“一键启动” - 等待依赖安装完成后,浏览器自动打开WebUI操作界面
首次启动可能需要10-30分钟(取决于网络状况)。
二、ComfyUI安装与配置
ComfyUI是基于节点的图形界面,适合需要精细化控制工作流的进阶用户。它的显存效率比WebUI高30%-50% ,但学习曲线较陡。
安装方式:
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI
python -m venv venv
# Windows: venv\Scripts\activate
pip install -r requirements.txt
python main.py
浏览器打开http://127.0.0.1:8188即可访问ComfyUI界面。也推荐使用秋葉整合包一键部署ComfyUI。
三、WebUI与ComfyUI横向对比
| 对比维度 | WebUI(A1111) | ComfyUI | Fooocus |
|---|---|---|---|
| 操作方式 | 图形表单界面 | 节点式工作流 | 极简开箱即用 |
| 上手难度 | 低 | 高 | 最低 |
| 灵活度 | 中 | 最高 | 低 |
| 显存效率 | 基准 | 省30%-50% | 中 |
| 扩展性 | 丰富 | 自定义节点生态持续完善 | 有限 |
| 工作流复用 | 有限 | JSON文件保存与分享 | 有限 |
选择建议:新手从WebUI入手,需要精细控制和批量自动化时转向ComfyUI。
第三节 Stable Diffusion核心操作
一、模型体系详解
Stable Diffusion的生成质量高度依赖模型选择。主要模型类型包括:
- Checkpoint(大模型/底模) :决定画面整体风格与质量的基础模型,格式为CKPT或SAFETENSORS
- VAE(变分自编码器) :相当于调色板,负责保持画面色彩和谐
- LoRA(低秩适配) :轻量级模型插件,在大模型基础上微调特定风格或元素
- ControlNet:控制插件,从参考图中提取线条、景深、姿态等信息
- Embedding(文本嵌入) :用于固定特定概念或风格的文本向量
模型资源获取:
| 资源平台 | 特点 | 适用人群 |
|---|---|---|
| Civitai(C站) | 全球最大SD模型社区,海量资源 | 所有用户 |
| Hugging Face | 官方模型发布平台 | 开发者 |
| LiblibAI | 国内热门社区,中文界面 | 国内用户 |
下载模型时需确认适配版本(SD1.5/SDXL/SD3),优先选择safetensors格式(安全性更高)。
二、提示词工程基础
提示词(Prompt)是与Stable Diffusion沟通的核心方式。提示词的质量直接决定生成效果。
正向提示词(Positive Prompt) 描述期望生成的内容。反向提示词(Negative Prompt) 描述不希望出现的内容。
CLIP文本编码器将提示词映射到高维向量空间,最长支持77个token。提示词越精准、越具体,生成结果越符合预期。
提示词的四层结构:
- 主体层:画面核心对象(人物、物体、场景)
- 风格层:艺术风格、流派(摄影、插画、3D渲染)
- 细节层:材质、光照、色彩、构图
- 质量层:画质修饰词(如“高细节”“杰作”)
权重控制语法:
(关键词:1.2)— 将权重提升至1.2倍[关键词]— 降低权重关键词1 | 关键词2— 交替生成
三、核心参数设置
Stable Diffusion的生成参数需要联动调整。
采样步数(Steps) :步数越多图像质量越高但耗时更长。日常使用20-30步,高质量出图40-50步。快速预览可用15-20步。
采样方法(Sampler) :不同采样器适用不同场景:
| 采样器 | 特点 | 适用场景 |
|---|---|---|
| DPM++ 2M Karras | 20步收敛,稳定性高 | 结构清晰的图像 |
| DPM++ SDE Karras | 8步出形,随机性强 | 抽象、氛围型图像 |
| Euler a | 适合快速迭代 | 草图、多版本尝试 |
| DDIM | 需30+步稳定 | 精细控制场景 |
CFG Scale(提示词引导强度) :控制生成结果对提示词的遵循程度。默认值7.0。DPM++类采样器建议CFG 4-6,DDIM类建议7-9。CFG超过10时容易出现色彩溢出。
随机种子(Seed) :固定种子可重现相同结果。
四、文生图操作流程
在WebUI中执行文生图的基本流程:
- 在正向提示词框输入描述内容
- 在反向提示词框输入不希望出现的内容
- 选择Checkpoint模型
- 设置采样方法、步数、CFG Scale
- 设置图像宽高(SD1.5推荐512×512,SDXL推荐1024×1024)
- 点击生成按钮
五、图生图与局部重绘
图生图(Img2Img) :上传一张参考图,配合提示词实现风格迁移或内容修改。关键参数是去噪强度(Denoising Strength) :值越小越接近原图,值越大改动越激进。
局部重绘(Inpainting) :用蒙版标记需要修改的区域,Stable Diffusion仅在该区域内重新生成。适用于瑕疵修复、物体替换等场景。
第四节 ComfyUI工作流进阶
一、节点式工作流核心概念
ComfyUI将图像生成过程拆解为一系列可连接的节点。每个节点代表一个功能单元。
核心节点包括:
- Load Checkpoint — 加载模型
- CLIP Text Encode — 编码提示词(正向/反向)
- KSampler — 采样生成
- VAE Decode — 解码潜空间图像
- Save Image — 保存结果
二、工作流搭建实战
最简文生图工作流:
Load Checkpoint → CLIP Text Encode (Positive) → KSampler → VAE Decode → Save Image
→ CLIP Text Encode (Negative) →
KSampler核心参数:
- steps:20-30步
- cfg:7-8
- seed:固定可复现
- denoise:1.0(文生图)
工作流可保存为JSON文件,便于复用和分享。
三、ComfyUI与WebUI模型共享
如果已安装WebUI并下载了模型,可将模型共享给ComfyUI以节省硬盘空间。在ComfyUI根目录找到extra_model_paths.yaml.example文件,配置WebUI的模型路径即可。
第五节 ControlNet精准控制
一、ControlNet原理
ControlNet是一组神经网络结构,通过额外的条件输入来控制Stable Diffusion的生成过程。它可以从参考图像中提取结构信息,引导模型生成符合特定构图要求的图像。
主流ControlNet类型:
- Canny边缘:提取线稿和轮廓
- Depth深度图:提取3D结构信息
- OpenPose姿态:提取人体骨骼关键点
- Scribble涂鸦:手绘草图引导
- Seg语义分割:区域语义控制
二、ControlNet实战应用
ControlNet在以下场景中尤为实用:
- 线稿上色:上传线稿,Stable Diffusion自动上色
- 姿态迁移:参考特定姿势生成角色
- 构图控制:确保主体位置、比例符合预期
- 风格转绘:保持原图结构的同时转换风格
Stable Diffusion 4已集成ControlNet 3,进一步提升了结构引导的精度和灵活性。
第六节 生成质量优化技巧
一、高清修复与放大
Stable Diffusion原生分辨率有限(SD1.5为512×512,SDXL为1024×1024)。可通过以下方式获得高分辨率图像:
- 高清修复(Hires. fix) :先生成低分辨率图像,再放大并补充细节
- Tiled Diffusion:分块采样生成任意分辨率图像
- 外部放大工具:使用ESRGAN等超分辨率模型
二、性能优化建议
- 采样步数从50降到20,速度提升约60%,质量损失小于5%
- 使用DPM系列采样器在速度与质量间取得平衡
- ComfyUI比WebUI节省30%-50%显存
- 固态硬盘可显著加快模型加载速度
三、常见问题排查
生成图像模糊:检查采样步数是否过低(建议20步以上),或CFG Scale是否过高(超过10易出现伪影)。
人物畸形:在反向提示词中加入“deformed, extra limbs, bad anatomy”等负面词。
色彩异常:检查是否缺少VAE模型,或更换其他VAE试试。
显存不足:降低生成分辨率、减少批量大小,或使用ComfyUI的低显存模式。
第七节 常用模型与资源推荐
一、热门模型速览
| 模型名称 | 适用方向 | 特点 |
|---|---|---|
| SDXL | 通用创作 | 高分辨率基础模型 |
| RealVisXL | 写实摄影 | 照片级真实感 |
| Juggernaut XL | 电影质感 | 电影级光影 |
| DreamShaper | 奇幻插画 | 梦幻风格 |
| Anything V5 | 二次元动漫 | 动漫风格 |
| SD 3.5 | 新一代基础 | MMDiT架构 |
| Flux系列 | 高质量创作 | 细节丰富 |
二、学习资源推荐
- Civitai:模型下载与社区交流
- Hugging Face:官方模型发布
- StableDiffusionBook:系统学习导航
- LiblibAI:国内中文模型社区
常见问题解答(FAQ)
Q1:Stable Diffusion对电脑配置要求高吗?
Stable Diffusion可在显存4GB以上的消费级显卡上运行。推荐使用RTX 3060或更高配置。没有独立显卡也可用CPU模式运行,但生成速度会慢很多。
Q2:WebUI和ComfyUI应该选哪个?
新手建议从WebUI入手,操作直观、上手快。需要精细化控制、批量自动化或显存紧张时,推荐ComfyUI。
Q3:提示词怎么写效果更好?
提示词应遵循“主体→风格→细节→质量”的四层结构。关键词越具体越精准,善用括号调整权重。反向提示词同样重要,可有效避免畸形等常见问题。
Q4:生成的人物手部总画不好怎么办?
在反向提示词中加入“bad hands, extra fingers, deformed hands”等词。也可以使用ControlNet的OpenPose姿态控制来约束手部位置。
Q5:Stable Diffusion 4有什么新特性?
Stable Diffusion 4于2026年发布,支持原生4K分辨率输出,集成了ControlNet 3,并新增了原生视频生成能力(最长60秒)。在Apache 2.0许可下完全免费商用。
Q6:如何获取更多的Stable Diffusion模型?
推荐访问Civitai(全球最大SD模型社区)和Hugging Face(官方发布平台)。国内用户可使用LiblibAI。
Q7:采样步数设多少合适?
日常使用20-30步,快速预览15-20步,高质量出图40-50步。不同采样器对步数的敏感度不同。
Q8:CFG Scale是什么意思?怎么调?
CFG Scale控制生成结果对提示词的遵循程度,默认7.0。DPM++类采样器建议4-6,DDIM类建议7-9。超过10容易出现色彩溢出。

