AI绘画技巧教程:从提示词到精准控图的完整指南

这篇AI绘画技巧教程为你梳理从零上手到精准控图的核心方法。不堆砌工具名称,不复制粘贴参数,而是讲清楚“为什么这样写提示词”“什么时候该换工具”“怎样让光影听话”。无论你刚打开第一个生图页面,还是已经出了几百张废片,都能在这里找到下一张图变好的理由。

一、先搞清楚一件事:AI绘画的“画”到底是怎么来的
很多人对AI绘画的第一个误解,是以为它在“理解”你。实际上,它的工作方式是:把你输入的文字转换成一组视觉特征的概率分布,然后从随机噪声中逐步“去噪”,逼近这组特征所指向的图像。
这意味着什么呢?意味着你写的每一个词,都在收窄模型的猜测范围。你写“一只猫”,它画的是“所有猫的平均值”——一只很猫但没什么个性的猫。你写“一只蜷在窗台上晒太阳的橘猫,午后侧逆光,浅景深”,它才可能画出一只具体的猫。
这个底层逻辑决定了整篇教程的走向:你掌控画面的方式,不是学更多工具,而是学怎样把脑子里的画面翻译成模型能“猜”的文本。
二、提示词是AI绘画技巧教程里最值得花时间的东西
2.1 一个合格的提示词需要覆盖什么
新手最常见的写法是“一个女孩在海边”。这句话不是错,是太空。海边什么样?女孩什么状态?什么光?模型全得自己脑补,结果每次出来都不一样,而且大概率不是你想要的。
我习惯把提示词拆成六个层次,顺序就是权重顺序:
主体 → 细节 → 环境/背景 → 风格 → 画质/光影 → 构图/镜头
拿“女孩在海边”改一下:
一位短发女孩,穿米色针织衫,坐在海边礁石上侧脸看向远处,黄昏暖光,胶片质感,浅景深半身构图,背景虚化的海面。
拆开看——主体是“短发女孩”,细节是“米色针织衫”“侧脸看向远处”,环境是“海边礁石”,风格是“胶片质感”,光影是“黄昏暖光”,构图是“半身”“浅景深”。每一块都在收窄模型的猜测空间,你想要的画面就从这个空间里浮现出来。
2.2 词序即权重:核心信息必须前置
这是被最多人忽视的一个技巧。主流文生图工具里,越靠前的词,模型赋予的注意力越高。
我见过有人写“8k, ultra detailed, masterpiece, cinematic, …”铺了半行画质词,最后才提了一句“一个女孩”。结果模型的注意力全被前面那堆形容词吃掉了,主体反而糊成一团。
画质词是有用的,但它们是调味,不是主菜。把“我要画什么”放在最前面,把“我希望它看起来多精细”放在后面。
2.3 负面提示词:你不说的,模型会替你“脑补”
负面提示词的意思是“我不要在画面里看到什么”。很多人要么没用过这个参数,要么不知道它能用,等于白白丢了半个控制手柄。
它的价值在于:有些毛病你正着说很难说清,反着排除特别高效。出人像老是多手指、脸崩,你在正向词里写“手指正常”基本没用,但在负面词里丢一串“多余的手指、畸形的手、扭曲的脸、低分辨率”,废片率会明显下降。
我常备一套通用负面词模板,大意是:低质量、模糊、变形、多余肢体、水印文字、杂乱背景。具体每个工具认的词不完全一样,但这个思路是通的——把你反复看到的翻车特征,固定成一段负面词存起来,下次直接粘贴。
要注意的是,负面词不是越多越好。堆太多有时候会把画面往奇怪的方向拽,反而限制了模型的发挥空间。只放那些真正反复出现的问题词。
三、工具选择:什么样的画面用什么样的“笔”
没有哪个工具在所有维度上都最强。2026年的AI生图格局,更像是一支不同笔尖的画具组合,你需要根据手头要画的东西来换笔。
3.1 主流工具横向对比
| 维度 | Midjourney (v6–v7) | FLUX.1 | DALL·E 3 | Stable Diffusion (SDXL/ComfyUI) | Qwen-Image 2.0 |
|---|---|---|---|---|---|
| 最擅长 | 艺术性构图与氛围 | 写实人像与皮肤质感 | 英文文字与语义精准 | 极致自定义与精准控制 | 中英文字还原与多模态统一 |
| 提示词风格 | 关键词+参数 | 自然语言散文 | 自然语言描述 | 关键词+权重语法 | 自然语言描述 |
| 负面提示词支持 | 有限 | 不支持 | 不支持 | 完整支持 | 不支持 |
| 本地部署 | 不支持 | 支持 | 不支持 | 完整支持 | 不支持 |
| 上手门槛 | 中(Discord/网页) | 低(自然语言) | 最低 | 高(节点工作流) | 低 |
| 角色一致性 | 中等(参考图) | 中等 | 中等 | 最强(LoRA+ControlNet) | 较好 |
| 适合场景 | 概念氛围、艺术方向 | 写实肖像、产品渲染 | 快速原型、图文排版 | 系列化输出、精准控图 | 中文图文混合、快速交付 |
这张表的读法不是“谁分高谁好”,而是:你手头要解决什么问题,就用那一列对应的工具。
做一套角色形象统一的系列插画?Stable Diffusion加ControlNet是唯一能真正做到像素级可控的方案。临时要一张氛围感封面图?Midjourney的默认审美几乎不需要调。需要画面里出现准确的中文标题?Qwen-Image 2.0是目前少数能稳定做到中英文字同时还原的模型,在CVTG-2K基准上中文渲染准确率达到91.16%,而同期Midjourney和Stable Diffusion的中文文字准确率分别只有15%和18%。
3.2 一个容易被忽略的分水岭:自然语言 vs 关键词
FLUX.1和DALL·E 3对自然语言的偏好,和Stable Diffusion的关键词逻辑有本质区别。FLUX.1不支持负面提示词,也不吃关键词堆砌那一套,你得像写摄影简报一样写它——“一个穿亚麻衬衫的男人坐在窗前,下午四点的侧光打在他左脸上,皮肤纹理清晰,50mm镜头,浅景深”。
这意味着你从Stable Diffusion迁移到FLUX的时候,不能把原来的提示词直接复制过去。格式对了,工具才听得懂。
四、进阶控制:让AI画出你“指定”的东西
提示词能控制到“大概”,但控制不到“精确”。当你的需求从“一张好看的人像”变成“这个角色在第三个分镜里必须穿同一件外套、站在同一角度、有同一束光”时,就需要更硬的控制手段。
4.1 角色一致性:从“像”到“是”
角色一致性是AI绘画技巧教程里最让人头疼的问题,也是区分“玩一玩”和“认真做项目”的分界线。
最基础的做法是固定特征描述:把角色最关键的外貌特征——发型、瞳孔颜色、脸型、标志性服饰——写成一段固定文本,每次生成时原封不动地粘贴进去。
但真正稳定的做法是建“角色视觉档案”:给每个主要角色建一份独立文档,包含标准像、外貌锚点描述、负面排除词,以及一个固定的种子或参考图。
长期项目中最可靠的方式是训练角色LoRA。用一组包含不同角度、不同光照的角色图片训练一个专用模型,之后每次生成都以这个LoRA为基础,角色的一致性从“概率上像”变成“结构上是同一个人”。
这里有一个容易被忽略的细节:角色的“没有什么”和“有什么”一样重要。如果你不写“没有头带”,模型每次都会自己补一顶上去。把“排除项”也写进角色档案里。
4.2 ControlNet:精确控制每一处细节
ControlNet的工作方式,是把一张参考图“翻译”成模型能理解的几何或结构约束信号,然后在生成过程中持续施加这个约束,让输出在保持参考图空间结构的前提下,用提示词的内容去填充画面。
不同类型的控制信号解决不同的问题:
Canny边缘控制保留物体轮廓和品牌标识细节,适合高对比度的产品静物图。Depth深度控制保障空间透视一致性,让前景、中景、背景的层次关系不乱,适合室内设计和建筑渲染。OpenPose姿态控制锁定人物动作和手势,时装画册和角色替换场景里几乎是标配。Normal法线图控制控制光影方向和立体感,是让画面“看起来有物理逻辑”的关键。
控制权重是一个需要反复调试的参数。0.4到0.6的权重保真度中等但纹理自然度高,适合保留背景结构、重绘主体材质的创意延展场景;0.8到1.2的权重构图保真度高但纹理自然度下降,适合珠宝官网图、汽车配置器这类需要严格还原的交付场景。
4.3 光影控制:不要只写“好看的光”
光影是画面情绪的第一载体。但“电影感光影”这种写法太泛了,模型会给你一个平均值,而不是你想要的那个方向。
有效的光影提示词需要拆成三块:光源方向 + 光质 + 色温。
“侧逆光”告诉模型光从哪里来,“柔光”告诉它光的软硬程度,“黄昏暖光”告诉它色温倾向。组合起来——“侧逆柔光,黄昏色温,主体边缘有轮廓光”——比单独一个“cinematic lighting”精确得多。
在Stable Diffusion体系里,你还可以用ControlNet的Depth或Normal图来锁定光影的空间逻辑,让光的方向和物体的立体感保持物理一致,而不是各画各的。
五、工作流:从“出一张好图”到“稳定出一批好图”
单张图的技巧掌握了,下一步是让这个过程可重复、可批量、可调整。
5.1 为什么需要节点式工作流
2023年WebUI的“一键生成”降低了门槛,但到了2025年之后,它的局限暴露得很清楚:一次只能改一个参数,没法把“加载模型→注入LoRA→施加ControlNet→采样→精修→放大”做成一条流水线;别人想复现你的图,得手动抄二十几个参数;批量出图只能一张一张点按钮。
ComfyUI用节点式工作流解决了这三个问题。每个节点是一个“积木”,你可以任意插拔、并行、条件分支。一条典型的工作流是这样的:
文本编码 → 潜空间噪声 → KSampler去噪 → LoRA注入 → ControlNet施加约束 → VAE解码 → 放大与修复
每个节点都有对应的参数面板,改一个参数不影响其他节点。更关键的是,整个工作流可以存成JSON文件,别人加载后就能复现你的全部生成条件。
5.2 批量出图的实用思路
批量不是把同一套参数跑十遍,而是用变量去驱动变化。ComfyUI的Prompt Iterator类节点允许你连接最多20组不同的提示词源,每次运行自动切换到下一组,同时生成对应的文件名,方便后续整理。
更实用的做法是“分变量测试”:固定角色描述和风格词,只改变环境词或构图词,一次性生成8到12张候选图,快速判断哪个方向更对。这比手动一张一张改参数快得多,也比“凭感觉调”更有系统性。
六、常见误区与FAQ
提示词写得越长越好吗?
不是。堆砌大量无效形容词(“绝美、史诗级、超高清”)不如写清楚一个具体的场景细节。有效信息密度才是关键,无效的词只是在稀释模型的注意力。
为什么我复制了别人的提示词,出来的图完全不一样?
你复制的只是文字部分。原图可能还用了风格参考图、固定的种子值、特定的负面提示词模板、或者ControlNet参考图。光复制文字等于只拿到了半张配方。
FLUX.1为什么不支持负面提示词?那我该怎么排除不想要的东西?
FLUX的设计哲学是“只描述你想要的”。与其说“不要模糊”,不如直接写“清晰锐利的细节,皮肤纹理分明”。用正向描述去覆盖你想要的画面特征,而不是用负面词去堵住不想要的东西。这和Stable Diffusion的逻辑是相反的,但效果同样有效。
角色LoRA训练需要多少张图?
质量比数量重要。10到20张不同角度、不同光照、背景干净的角色图,标注时把“身份特征”和“背景元素”分开描述,效果通常好过50张角度单一的图。
ControlNet权重调到多高合适?
看你想要“参考图说了算”还是“提示词说了算”。权重0.4到0.6偏向提示词主导,适合保留大概构图但重绘内容;权重0.8到1.2偏向参考图主导,适合需要严格还原结构的场景。
一张图里有多个人物,角色特征总是“串”怎么办?
用区域掩码把不同角色的生成区域分开,同时降低适配器的权重或者缩短它的有效采样范围,让每个角色只在各自的区域内生效。
光影提示词写了“电影感”但效果很平,怎么改?
把“电影感”拆成三个具体维度:光从哪来(侧光/逆光/顶光)、光有多硬(硬光/柔光/漫射光)、光是什么色调(暖光/冷光/中性光)。越具体,模型越有方向感。
七、写在最后
这篇AI绘画技巧教程想传递的核心观点只有一个:AI绘画的“技巧”,本质上是你对画面的描述能力和对控制工具的调用能力,而不是对某个工具的熟练度。
工具会变,模型会迭代,今天好用的参数明天可能就过时了。但“把脑子里的画面拆解成主体、细节、环境、光影、构图”这件事的能力,以及“知道什么时候该用提示词、什么时候该上ControlNet、什么时候该训一个LoRA”的判断力,会一直有用。
先想清楚你要画什么,再决定用什么工具去画。这个顺序反过来,你永远都在追工具。

