AI绘图人物提示词终极指南:从写出一张好脸开始


为什么你的AI绘图人物提示词总是“差点意思”?
先说一个反直觉的事实:提示词写得越长,效果不一定越好。
SDXL模型的CLIP编码器对提示词长度有天然限制,超出处理范围的内容会被截断或稀释。这意味着你精心堆砌的后半段描述,AI可能根本没“看到”。
更常见的问题有三种:
第一,结构混乱。 “赛博朋克风格的女孩穿红色连衣裙站在雨中的霓虹灯下微笑” —— 这句话同时包含了风格、主体、服装、环境、表情和光照,但AI不知道哪个更重要。不同的排列顺序会产出截然不同的结果。
第二,特征冲突。 写“蓝色短发”又写“长发及腰”,AI会尝试平均化处理,最后得到一个不蓝不白、不长不短的模糊结果。SDXL在多角色场景中还特别容易出现“特征混淆”——两个角色的发色、服装互相串染。
第三,缺少“锚点”。 AI绘图人物提示词的核心挑战不是“描述一个人”,而是“描述一个特定的人”。没有锚点的描述会让AI调用训练数据中的“平均值”,产出千人一面的结果。
解决这三个问题的关键,是建立一套结构化的提示词思维模型。
AI绘图人物提示词的核心结构公式
基础公式:适合快速上手
最简单的AI绘图人物提示词只需要三个要素:
提示词 = 主体 + 场景 + 风格
主体是画面的核心表现对象——性别、年龄、身份、外貌。场景是主体所处的环境——室内室外、季节天气、光线氛围。风格决定画面的视觉调性——写实、动漫、油画、水彩。
这个公式够用,但只适合灵感探索阶段。当你需要精确控制人物形象时,需要进阶版本。
进阶公式:精确控制画面的六层结构
提示词 = 主体描述 + 场景描述 + 风格定义 + 镜头语言 + 氛围词 + 细节修饰
这六层从宏观到微观,逐层递进。主体描述确定“画谁”,场景描述确定“在哪”,风格定义确定“怎么画”,镜头语言确定“从哪个角度看”,氛围词确定“什么感觉”,细节修饰确定“精致到什么程度”。
深度结构:九段式人像模板
对于需要高度复用的角色创作,可以使用九段式结构:
人物 → 面容 → 妆容 → 身材 → 装饰 → 动作 → 服装 → 环境 → 摄像
前四段(人物、面容、妆容、身材)是“真实感内核”,可以跨图复用。后五段按每张图的需求自由填充。这种结构的优势在于:当你需要同一角色出现在不同场景中时,只需更换后五段,前四段保持不变,角色的核心辨识度就能稳定维持。
人物特征的分层描述技巧
面部特征的微观控制
“好看的脸”是无效描述。AI需要具体的视觉线索。
脸型: 鹅蛋脸(oval face)、圆脸(round face)、方脸(square face)、心形脸(heart-shaped face)、长方脸(oblong face)。阿里Wan2.7-Image模型的“捏脸”功能就支持通过提示词灵活更换脸型,实现“千人千面”的效果。
眼睛: 杏仁眼(almond eyes)、丹凤眼(phoenix eyes)、圆眼(round eyes)、深邃眼窝(deep-set eyes)。眼睛是人物辨识度最高的特征之一,建议至少用两个词描述——一个定形状,一个定神态。
眉毛: 柳叶眉(willow eyebrows)、剑眉(straight thick eyebrows)、挑眉(arched eyebrows)。
嘴唇: 薄唇(thin lips)、厚唇(full lips)、微笑唇(smiling lips)。
肤色与肤质: 白皙(fair skin)、小麦色(wheatish complexion)、蜜色(honey skin)。肤质方面,写实风格建议加“真实皮肤纹理”(realistic skin texture)和“细微毛孔”(subtle pores)。
发型与发色的精确表达
发型是AI绘图人物提示词中最容易出效果的部分,也是最容易“翻车”的部分。
发色要具体:不要写“金发”,写“铂金色”(platinum blonde)或“蜂蜜金”(honey blonde)。不要写“红发”,写“铜红色”(copper red)或“酒红色”(burgundy)。
发型要精确:丸子头(bun)、低马尾(low ponytail)、波波头(bob cut)、大波浪(loose waves)、脏辫(dreadlocks)、双马尾(twin tails)。
一个实用技巧:当角色一致性要求高时,把发型描述简化为“发色 + 发长 + 基本形态”三个要素。过多的修饰词会让AI在不同生成中产生波动。
服装与配饰的描述策略
服装描述遵循“类型 + 材质 + 颜色 + 细节”的顺序。例如:“丝绸质地的墨绿色旗袍,领口有金色盘扣”比“穿旗袍”有效十倍。
配饰要克制。每增加一个配饰,AI分配到面部细节的注意力就会减少。除非配饰是角色辨识度的核心(比如标志性的眼镜或耳环),否则建议不超过两个。
2026年主流AI绘图工具人物提示词横向对比
不同平台对AI绘图人物提示词的理解方式差异很大。同一段提示词在不同工具中的表现可能天差地别。
| 对比维度 | Midjourney V8.2 | Stable Diffusion 3.5 | Flux | Nano Banana Pro | Wan2.7-Image |
|---|---|---|---|---|---|
| 提示词风格偏好 | 关键词+参数混合 | 标签式+自然语言 | 自然语言 | 自然语言 | 自然语言+结构化 |
| 人物写实能力 | 极强,皮肤质感优秀 | 人物美感好,皮肤细腻 | 写实度最高 | 场景还原最真实 | “活人感”突出 |
| 多角色处理 | 一般 | 较弱,易特征混淆 | 中等 | 较强 | 较强 |
| 角色一致性 | Omni Reference(–oref) | 需配合LoRA/ControlNet | 需分步编辑 | 参考图+锁定描述 | 捏脸功能 |
| 提示词长度上限 | 中等 | 受CLIP限制 | 32K tokens | 较长 | 较长 |
| 独特优势 | 艺术感最强 | 开源生态最丰富 | 图像质量和细节 | 精确文字渲染 | 色彩控制与“捏脸” |
| 适合人物场景 | 艺术肖像、概念设计 | 二次元/写实角色 | 高精度写实人像 | 角色设定图 | 虚拟形象、多样面孔 |
关键发现: 2026年9月的一项受控实测显示,三个模型在写实人像任务上都通过了基础质检,但差异落在“审美解释”上——GPT Image 2和Midjourney V8.2的成片取景更近、更精致,而Nano Banana Pro的环境取景最宽。这意味着选择工具时,先想清楚你需要的是“面部特写”还是“带环境的中景”。
各工具的提示词策略要点
Midjourney V8.2: 2026年7月发布的V8.2对美学关键词的响应更敏感。提示词中应更多使用“cinematic”“moody”“editorial”“filmic grain”等风格化描述词。注意:V8.x系列不再支持Character Reference和Omni Reference参数,角色一致性需要依赖提示词描述本身。
Stable Diffusion 3.5: 倾向于自然语言提示词,不再像SD1.5时代那样依赖标签堆砌。人物特写的皮肤质感优秀,但手指精度不如Flux。
Flux: 支持高达32K tokens的提示词长度,建议从“图像类型+主体”开始,然后依次添加风格和光照。具体语言优于抽象描述——“三十多岁的女性,肩长赤褐色头发”比“一个人”效果好得多。
Nano Banana Pro: 擅长“还原真实场景”,提示词风格偏向自然语言描述。角色设定图任务中表现最贴近要求。
Wan2.7-Image: 2026年4月发布的阿里模型,核心突破是“捏脸”功能——支持在提示词中精确指定脸型和眼部特征,让AI生成的人物告别同质化。
写实风格 vs 二次元风格:提示词策略差异
写实风格的提示词要点
写实人像的核心是“真实感”。但“真实感”不是一个词能解决的问题。
光照是写实感的基石。 “柔和侧光”(soft side lighting)、“自然窗光”(natural window light)、“黄金时段光照”(golden hour lighting)——不同光照方案直接影响面部立体感和皮肤质感。Flux在写实人像中对光照提示词的响应尤为精准。
皮肤质感需要正向引导。 加入“真实皮肤纹理”(realistic skin texture)和“细微胶片颗粒”(subtle film grain)可以有效避免AI生成的“塑料感”皮肤。不要写“光滑皮肤”——那会让AI过度磨皮。
镜头参数增强真实感。 “85mm镜头”(shot on 85mm lens)、“浅景深”(shallow depth of field)、“f/1.8光圈”这类摄影术语能显著提升写实度。
二次元风格的提示词要点
二次元风格的关键词体系与写实风格完全不同。
风格标签要精确。 “anime style, cel-shaded, vibrant colors”适合日系动画风;“Chinese fantasy 3D animation, cinematic quality”适合国漫3D写实。
面部特征可以夸张化。 大眼睛(large expressive eyes)、小嘴巴(small mouth)、精致的鼻子(delicate nose)——二次元审美对五官比例的要求与写实不同,可以大胆使用风格化描述。
质量标签有实际作用。 “masterpiece, best quality, highly detailed”这类标签在二次元模型中确实能提升输出质量,但在写实模型中的作用相对有限。
镜头语言与光影氛围的提示词技巧
景别控制
景别直接决定人物在画面中的占比和细节呈现。
| 景别类型 | 提示词示例 | 适用场景 |
|---|---|---|
| 特写 | close-up shot, face focus | 面部表情展示 |
| 近景 | medium close-up, chest up | 半身肖像 |
| 中景 | medium shot, waist up | 服装+姿态展示 |
| 全身 | full body shot | 角色设定图 |
| 远景 | wide shot, full scene | 人物与环境关系 |
视角选择
视角决定观众与角色的关系。
平视(eye level): 中性、客观的呈现,适合角色设定图。仰视(low angle): 角色显得高大、有力量感,适合英雄式构图。俯视(high angle): 角色显得脆弱或渺小,适合叙事性画面。侧面(side view): 强调面部轮廓和身体姿态。
光影氛围的层次
光照是区分“普通”和“专业”AI绘图人物提示词的分水岭。
光源类型: 自然光(natural light)、棚拍光(studio lighting)、伦勃朗光(Rembrandt lighting)、轮廓光(rim light)。
光照方向: 顺光(front lighting)、侧光(side lighting)、逆光(backlighting)、顶光(top lighting)。
氛围色调: 暖色调(warm tones)、冷色调(cool tones)、高对比度(high contrast)、柔和漫射(soft diffused)。
一个值得记住的经验:逆光+轮廓光组合是让AI生成人像“高级感”最有效的单一技巧。Nano Banana Pro的侧脸肖像示例中,强轮廓光勾勒下颌线和鼻梁,配合深色极简背景,效果远胜于平铺直叙的光照描述。
负面提示词:让AI画“对”的关键
负面提示词的工作原理
负面提示词的本质是“做减法”。在扩散模型中,正向提示词和负面提示词同时参与引导——模型一边朝正向方向“前进”,一边从负面方向“后退”,两者的差值决定最终方向。
打个比方:正向提示词是油门,负面提示词是刹车。模型一边踩油门驶向目标,一边踩刹车远离雷区。
人物场景的负面词清单
画质修复类: low quality, worst quality, blurry, pixelated, jpeg artifacts, noisy
人体结构类: extra fingers, missing fingers, deformed hands, extra limbs, bad anatomy, mutated, disfigured, long neck
画面干扰类: watermark, text, signature, logo, date stamp, border
风格排除类: cartoon, 3d, realistic, anime, painting(按需选用)
手部崩坏的专项修复
AI画手是翻车重灾区。修复策略分两步:
正向提示词中精确描述手部: “五指清晰可数,拇指与其余四指分开,手背朝向镜头”。注意不要写“perfect hands”——这个词会触发AI过度优化导致手掌僵硬变形。
负面提示词中全面堵漏: extra fingers, fused fingers, deformed hands, missing fingers, mutated hands, poorly drawn hands。
如果生成后仍有问题,建议使用局部重绘(inpainting)功能,只对手部区域重新生成,而不是整张图重来。描述词只写手的数量和朝向,不要添加肤色等冗余信息。
负面提示词的使用原则
负面提示词不是越多越好。堆砌超过15个词反而会削弱模型表现力。建议保存3-4套常用模板,按场景切换:人物生成用一套、场景图用一套、写实风格用一套。
角色一致性:让同一张脸出现在不同画面
为什么一致性这么难?
AI绘图人物提示词的根本矛盾在于:每次生成都是一次独立的“从噪声到图像”的过程。模型没有“记忆”,它不会记住上一次生成了什么。角色一致性需要通过外部手段来“锚定”。
方法一:锁定描述模板
最基础也最可靠的方法。先写一段“锁定描述”,涵盖年龄、性别、发型(颜色+长度+形态)、眼睛颜色、脸型、标志性特征。每次生成时,把这段描述原封不动地放在提示词最前面,然后再添加场景细节。
关键原则:锁定描述中的词一个都不要改。哪怕你觉得“深邃的蓝色眼睛”换成“深蓝色的眼睛”意思一样——AI不这么认为。
方法二:参考图+权重控制
Midjourney用户: V7及以上版本使用Omni Reference(–oref)功能。上传角色参考图后,通过–ow参数(0-1000,默认100)控制参考强度。注意V8.x系列目前不支持此参数。
Stable Diffusion用户: 可以使用IP-Adapter或LoRA来锁定角色特征。LoRA的优势在于可以将特定角色的特征“训练”进模型,生成时只需在提示词中加入触发词即可。
通用方法: 使用img2img模式,上传角色参考图作为底图,设置较低的重绘强度(0.3-0.5),让AI在保持角色特征的前提下更换场景。
方法三:种子值固化
每次生成时记录seed值,后续生成使用相同seed。Seed决定了初始噪声的分布,固定seed可以让画面的基础结构保持一致。
但要注意:seed并非万能。改变场景、服装、姿态等变量时,即使seed相同,角色面部也可能发生漂移。建议配合锁定描述模板一起使用。
多角色同框:避免“特征混淆”的实战方法
问题诊断
当提示词中出现两个及以上角色时,AI倾向于“平均化”所有描述。红色头发和蓝色头发的两个角色,可能生成两个紫发角色。
区域分离语法
SDXL用户可以使用区域语法(regional prompting)将画布分割为左右两个区域,每个区域只接收对应角色的描述。LoRA权重建议压低到0.65左右,以平衡两个角色的特征强度。
互动词的优先级
多角色场景中,互动词必须紧跟在人数声明之后。推荐写法:“2girls, duo, holding each other’s hands”,然后才开始分别描述每个角色的容貌和服装。如果把互动词放在角色描述之后,AI可能无法正确建立角色之间的空间关系。
通用建议
如果频繁需要多角色场景,考虑使用基于DiT架构的模型(如Tsubaki、Serin),这些架构在多角色构图上的表现比SDXL更稳定。
关于AI绘图人物提示词的常见问题
提示词写中文还是英文效果更好?
目前主流模型的训练数据以英文为主,英文提示词的识别精度普遍高于中文。但2025-2026年发布的新模型(如Wan2.7-Image、SD3.5)对中文的支持已有显著提升。实用建议:关键特征词用英文,场景和氛围描述可以用中文。
提示词越长越好吗?
不是。SDXL的CLIP编码器对长度有限制,超长提示词的后半段可能被截断。Flux虽然支持32K tokens,但过多的描述词会稀释每个词的权重。建议:核心人物提示词控制在75-150个英文词以内,分层次组织。
为什么AI总是画出“AI脸”?
“AI脸”是训练数据平均化的产物。解决方案:在提示词中加入具体而独特的特征描述——特定的脸型、眼型、面部标记(如痣、疤痕、雀斑)。Wan2.7-Image的“捏脸”功能就是针对这个问题设计的,支持通过提示词精确控制骨相和五官细节。
Midjourney的–cref和–oref有什么区别?
–cref是V6时代的角色参考参数,通过–cw(0-100)控制参考强度。V7及以上版本用Omni Reference(–oref)替代,通过–ow(0-1000)控制,且不仅能参考角色,还能参考物体、动物等。V8.x系列目前不支持这两个参数。
负面提示词应该写多少?
建议控制在10-15个词以内。超过这个数量,模型的注意力会被分散,正面提示词的效果也会被削弱。可以建立多套模板按场景切换,而不是每次都写一长串。
如何让AI画的人物更像真人?
三个关键:光照描述要具体(侧光、逆光、轮廓光),皮肤质感要正向引导(真实皮肤纹理、细微毛孔),镜头参数要加入(85mm、浅景深)。另外,Flux和Midjourney V8.2在写实人像上的表现目前处于第一梯队。
角色一致性有没有“万能方法”?
没有。最可靠的是“组合拳”:锁定描述模板 + 固定seed + 参考图(如果工具支持)。三者叠加的效果远好于单一方法。另外,尽量减少每次生成中的变量数量——如果同时改变场景、服装、姿态和光照,AI维持角色一致性的难度会急剧上升。
AI绘图人物提示词不是一门玄学,而是一套可以系统学习的技能。从理解结构公式开始,到掌握特征描述的分层技巧,再到根据工具特性调整策略——每一步都有明确的逻辑可循。
最重要的心法只有一条:AI不是在“理解”你的描述,而是在“解码”你的指令。 每一个词的位置、权重和精确度都在影响输出。写提示词的过程,本质上是在用AI能理解的语言,把脑海中的画面“翻译”出来。
翻译得越精确,画面就越接近你的想象。

