文章摘要
讲解AI绘图人物提示词指南,指出提示词过长效果未必更好,梳理出提示词常见问题:结构混乱、特征冲突、缺少锚点;给出了从基础入门到深度创作的多层结构化提示词框架,讲解了人物各特征的精确描述技巧,对比了2026年主流AI绘图工具的提示词适配策略,还分享了各类实战技巧与常见问题解答。

AI绘图人物提示词终极指南

为什么你的AI绘图人物提示词总是“差点意思”?

先说一个反直觉的事实:提示词写得越长,效果不一定越好。

SDXL模型的CLIP编码器对提示词长度有天然限制,超出处理范围的内容会被截断或稀释。这意味着你精心堆砌的后半段描述,AI可能根本没“看到”。

更常见的问题有三种:

第一,结构混乱。 “赛博朋克风格的女孩穿红色连衣裙站在雨中的霓虹灯下微笑” —— 这句话同时包含了风格、主体、服装、环境、表情和光照,但AI不知道哪个更重要。不同的排列顺序会产出截然不同的结果。

第二,特征冲突。 写“蓝色短发”又写“长发及腰”,AI会尝试平均化处理,最后得到一个不蓝不白、不长不短的模糊结果。SDXL在多角色场景中还特别容易出现“特征混淆”——两个角色的发色、服装互相串染。

第三,缺少“锚点”。 AI绘图人物提示词的核心挑战不是“描述一个人”,而是“描述一个特定的人”。没有锚点的描述会让AI调用训练数据中的“平均值”,产出千人一面的结果。

解决这三个问题的关键,是建立一套结构化的提示词思维模型。

AI绘图人物提示词的核心结构公式

基础公式:适合快速上手

最简单的AI绘图人物提示词只需要三个要素:

提示词 = 主体 + 场景 + 风格

主体是画面的核心表现对象——性别、年龄、身份、外貌。场景是主体所处的环境——室内室外、季节天气、光线氛围。风格决定画面的视觉调性——写实、动漫、油画、水彩。

这个公式够用,但只适合灵感探索阶段。当你需要精确控制人物形象时,需要进阶版本。

进阶公式:精确控制画面的六层结构

提示词 = 主体描述 + 场景描述 + 风格定义 + 镜头语言 + 氛围词 + 细节修饰

这六层从宏观到微观,逐层递进。主体描述确定“画谁”,场景描述确定“在哪”,风格定义确定“怎么画”,镜头语言确定“从哪个角度看”,氛围词确定“什么感觉”,细节修饰确定“精致到什么程度”。

深度结构:九段式人像模板

对于需要高度复用的角色创作,可以使用九段式结构:

人物 → 面容 → 妆容 → 身材 → 装饰 → 动作 → 服装 → 环境 → 摄像

前四段(人物、面容、妆容、身材)是“真实感内核”,可以跨图复用。后五段按每张图的需求自由填充。这种结构的优势在于:当你需要同一角色出现在不同场景中时,只需更换后五段,前四段保持不变,角色的核心辨识度就能稳定维持。

人物特征的分层描述技巧

面部特征的微观控制

“好看的脸”是无效描述。AI需要具体的视觉线索。

脸型: 鹅蛋脸(oval face)、圆脸(round face)、方脸(square face)、心形脸(heart-shaped face)、长方脸(oblong face)。阿里Wan2.7-Image模型的“捏脸”功能就支持通过提示词灵活更换脸型,实现“千人千面”的效果。

眼睛: 杏仁眼(almond eyes)、丹凤眼(phoenix eyes)、圆眼(round eyes)、深邃眼窝(deep-set eyes)。眼睛是人物辨识度最高的特征之一,建议至少用两个词描述——一个定形状,一个定神态。

眉毛: 柳叶眉(willow eyebrows)、剑眉(straight thick eyebrows)、挑眉(arched eyebrows)。

嘴唇: 薄唇(thin lips)、厚唇(full lips)、微笑唇(smiling lips)。

肤色与肤质: 白皙(fair skin)、小麦色(wheatish complexion)、蜜色(honey skin)。肤质方面,写实风格建议加“真实皮肤纹理”(realistic skin texture)和“细微毛孔”(subtle pores)。

发型与发色的精确表达

发型是AI绘图人物提示词中最容易出效果的部分,也是最容易“翻车”的部分。

发色要具体:不要写“金发”,写“铂金色”(platinum blonde)或“蜂蜜金”(honey blonde)。不要写“红发”,写“铜红色”(copper red)或“酒红色”(burgundy)。

发型要精确:丸子头(bun)、低马尾(low ponytail)、波波头(bob cut)、大波浪(loose waves)、脏辫(dreadlocks)、双马尾(twin tails)。

一个实用技巧:当角色一致性要求高时,把发型描述简化为“发色 + 发长 + 基本形态”三个要素。过多的修饰词会让AI在不同生成中产生波动。

服装与配饰的描述策略

服装描述遵循“类型 + 材质 + 颜色 + 细节”的顺序。例如:“丝绸质地的墨绿色旗袍,领口有金色盘扣”比“穿旗袍”有效十倍。

配饰要克制。每增加一个配饰,AI分配到面部细节的注意力就会减少。除非配饰是角色辨识度的核心(比如标志性的眼镜或耳环),否则建议不超过两个。

2026年主流AI绘图工具人物提示词横向对比

不同平台对AI绘图人物提示词的理解方式差异很大。同一段提示词在不同工具中的表现可能天差地别。

对比维度 Midjourney V8.2 Stable Diffusion 3.5 Flux Nano Banana Pro Wan2.7-Image
提示词风格偏好 关键词+参数混合 标签式+自然语言 自然语言 自然语言 自然语言+结构化
人物写实能力 极强,皮肤质感优秀 人物美感好,皮肤细腻 写实度最高 场景还原最真实 “活人感”突出
多角色处理 一般 较弱,易特征混淆 中等 较强 较强
角色一致性 Omni Reference(–oref) 需配合LoRA/ControlNet 需分步编辑 参考图+锁定描述 捏脸功能
提示词长度上限 中等 受CLIP限制 32K tokens 较长 较长
独特优势 艺术感最强 开源生态最丰富 图像质量和细节 精确文字渲染 色彩控制与“捏脸”
适合人物场景 艺术肖像、概念设计 二次元/写实角色 高精度写实人像 角色设定图 虚拟形象、多样面孔

关键发现: 2026年9月的一项受控实测显示,三个模型在写实人像任务上都通过了基础质检,但差异落在“审美解释”上——GPT Image 2和Midjourney V8.2的成片取景更近、更精致,而Nano Banana Pro的环境取景最宽。这意味着选择工具时,先想清楚你需要的是“面部特写”还是“带环境的中景”。

各工具的提示词策略要点

Midjourney V8.2: 2026年7月发布的V8.2对美学关键词的响应更敏感。提示词中应更多使用“cinematic”“moody”“editorial”“filmic grain”等风格化描述词。注意:V8.x系列不再支持Character Reference和Omni Reference参数,角色一致性需要依赖提示词描述本身。

Stable Diffusion 3.5: 倾向于自然语言提示词,不再像SD1.5时代那样依赖标签堆砌。人物特写的皮肤质感优秀,但手指精度不如Flux。

Flux: 支持高达32K tokens的提示词长度,建议从“图像类型+主体”开始,然后依次添加风格和光照。具体语言优于抽象描述——“三十多岁的女性,肩长赤褐色头发”比“一个人”效果好得多。

Nano Banana Pro: 擅长“还原真实场景”,提示词风格偏向自然语言描述。角色设定图任务中表现最贴近要求。

Wan2.7-Image: 2026年4月发布的阿里模型,核心突破是“捏脸”功能——支持在提示词中精确指定脸型和眼部特征,让AI生成的人物告别同质化。

写实风格 vs 二次元风格:提示词策略差异

写实风格的提示词要点

写实人像的核心是“真实感”。但“真实感”不是一个词能解决的问题。

光照是写实感的基石。 “柔和侧光”(soft side lighting)、“自然窗光”(natural window light)、“黄金时段光照”(golden hour lighting)——不同光照方案直接影响面部立体感和皮肤质感。Flux在写实人像中对光照提示词的响应尤为精准。

皮肤质感需要正向引导。 加入“真实皮肤纹理”(realistic skin texture)和“细微胶片颗粒”(subtle film grain)可以有效避免AI生成的“塑料感”皮肤。不要写“光滑皮肤”——那会让AI过度磨皮。

镜头参数增强真实感。 “85mm镜头”(shot on 85mm lens)、“浅景深”(shallow depth of field)、“f/1.8光圈”这类摄影术语能显著提升写实度。

二次元风格的提示词要点

二次元风格的关键词体系与写实风格完全不同。

风格标签要精确。 “anime style, cel-shaded, vibrant colors”适合日系动画风;“Chinese fantasy 3D animation, cinematic quality”适合国漫3D写实。

面部特征可以夸张化。 大眼睛(large expressive eyes)、小嘴巴(small mouth)、精致的鼻子(delicate nose)——二次元审美对五官比例的要求与写实不同,可以大胆使用风格化描述。

质量标签有实际作用。 “masterpiece, best quality, highly detailed”这类标签在二次元模型中确实能提升输出质量,但在写实模型中的作用相对有限。

镜头语言与光影氛围的提示词技巧

景别控制

景别直接决定人物在画面中的占比和细节呈现。

景别类型 提示词示例 适用场景
特写 close-up shot, face focus 面部表情展示
近景 medium close-up, chest up 半身肖像
中景 medium shot, waist up 服装+姿态展示
全身 full body shot 角色设定图
远景 wide shot, full scene 人物与环境关系

视角选择

视角决定观众与角色的关系。

平视(eye level): 中性、客观的呈现,适合角色设定图。仰视(low angle): 角色显得高大、有力量感,适合英雄式构图。俯视(high angle): 角色显得脆弱或渺小,适合叙事性画面。侧面(side view): 强调面部轮廓和身体姿态。

光影氛围的层次

光照是区分“普通”和“专业”AI绘图人物提示词的分水岭。

光源类型: 自然光(natural light)、棚拍光(studio lighting)、伦勃朗光(Rembrandt lighting)、轮廓光(rim light)。

光照方向: 顺光(front lighting)、侧光(side lighting)、逆光(backlighting)、顶光(top lighting)。

氛围色调: 暖色调(warm tones)、冷色调(cool tones)、高对比度(high contrast)、柔和漫射(soft diffused)。

一个值得记住的经验:逆光+轮廓光组合是让AI生成人像“高级感”最有效的单一技巧。Nano Banana Pro的侧脸肖像示例中,强轮廓光勾勒下颌线和鼻梁,配合深色极简背景,效果远胜于平铺直叙的光照描述。

负面提示词:让AI画“对”的关键

负面提示词的工作原理

负面提示词的本质是“做减法”。在扩散模型中,正向提示词和负面提示词同时参与引导——模型一边朝正向方向“前进”,一边从负面方向“后退”,两者的差值决定最终方向。

打个比方:正向提示词是油门,负面提示词是刹车。模型一边踩油门驶向目标,一边踩刹车远离雷区。

人物场景的负面词清单

画质修复类: low quality, worst quality, blurry, pixelated, jpeg artifacts, noisy

人体结构类: extra fingers, missing fingers, deformed hands, extra limbs, bad anatomy, mutated, disfigured, long neck

画面干扰类: watermark, text, signature, logo, date stamp, border

风格排除类: cartoon, 3d, realistic, anime, painting(按需选用)

手部崩坏的专项修复

AI画手是翻车重灾区。修复策略分两步:

正向提示词中精确描述手部: “五指清晰可数,拇指与其余四指分开,手背朝向镜头”。注意不要写“perfect hands”——这个词会触发AI过度优化导致手掌僵硬变形。

负面提示词中全面堵漏: extra fingers, fused fingers, deformed hands, missing fingers, mutated hands, poorly drawn hands。

如果生成后仍有问题,建议使用局部重绘(inpainting)功能,只对手部区域重新生成,而不是整张图重来。描述词只写手的数量和朝向,不要添加肤色等冗余信息。

负面提示词的使用原则

负面提示词不是越多越好。堆砌超过15个词反而会削弱模型表现力。建议保存3-4套常用模板,按场景切换:人物生成用一套、场景图用一套、写实风格用一套。

角色一致性:让同一张脸出现在不同画面

为什么一致性这么难?

AI绘图人物提示词的根本矛盾在于:每次生成都是一次独立的“从噪声到图像”的过程。模型没有“记忆”,它不会记住上一次生成了什么。角色一致性需要通过外部手段来“锚定”。

方法一:锁定描述模板

最基础也最可靠的方法。先写一段“锁定描述”,涵盖年龄、性别、发型(颜色+长度+形态)、眼睛颜色、脸型、标志性特征。每次生成时,把这段描述原封不动地放在提示词最前面,然后再添加场景细节。

关键原则:锁定描述中的词一个都不要改。哪怕你觉得“深邃的蓝色眼睛”换成“深蓝色的眼睛”意思一样——AI不这么认为。

方法二:参考图+权重控制

Midjourney用户: V7及以上版本使用Omni Reference(–oref)功能。上传角色参考图后,通过–ow参数(0-1000,默认100)控制参考强度。注意V8.x系列目前不支持此参数。

Stable Diffusion用户: 可以使用IP-Adapter或LoRA来锁定角色特征。LoRA的优势在于可以将特定角色的特征“训练”进模型,生成时只需在提示词中加入触发词即可。

通用方法: 使用img2img模式,上传角色参考图作为底图,设置较低的重绘强度(0.3-0.5),让AI在保持角色特征的前提下更换场景。

方法三:种子值固化

每次生成时记录seed值,后续生成使用相同seed。Seed决定了初始噪声的分布,固定seed可以让画面的基础结构保持一致。

但要注意:seed并非万能。改变场景、服装、姿态等变量时,即使seed相同,角色面部也可能发生漂移。建议配合锁定描述模板一起使用。

多角色同框:避免“特征混淆”的实战方法

问题诊断

当提示词中出现两个及以上角色时,AI倾向于“平均化”所有描述。红色头发和蓝色头发的两个角色,可能生成两个紫发角色。

区域分离语法

SDXL用户可以使用区域语法(regional prompting)将画布分割为左右两个区域,每个区域只接收对应角色的描述。LoRA权重建议压低到0.65左右,以平衡两个角色的特征强度。

互动词的优先级

多角色场景中,互动词必须紧跟在人数声明之后。推荐写法:“2girls, duo, holding each other’s hands”,然后才开始分别描述每个角色的容貌和服装。如果把互动词放在角色描述之后,AI可能无法正确建立角色之间的空间关系。

通用建议

如果频繁需要多角色场景,考虑使用基于DiT架构的模型(如Tsubaki、Serin),这些架构在多角色构图上的表现比SDXL更稳定。

关于AI绘图人物提示词的常见问题

提示词写中文还是英文效果更好?

目前主流模型的训练数据以英文为主,英文提示词的识别精度普遍高于中文。但2025-2026年发布的新模型(如Wan2.7-Image、SD3.5)对中文的支持已有显著提升。实用建议:关键特征词用英文,场景和氛围描述可以用中文。

提示词越长越好吗?

不是。SDXL的CLIP编码器对长度有限制,超长提示词的后半段可能被截断。Flux虽然支持32K tokens,但过多的描述词会稀释每个词的权重。建议:核心人物提示词控制在75-150个英文词以内,分层次组织。

为什么AI总是画出“AI脸”?

“AI脸”是训练数据平均化的产物。解决方案:在提示词中加入具体而独特的特征描述——特定的脸型、眼型、面部标记(如痣、疤痕、雀斑)。Wan2.7-Image的“捏脸”功能就是针对这个问题设计的,支持通过提示词精确控制骨相和五官细节。

Midjourney的–cref和–oref有什么区别?

–cref是V6时代的角色参考参数,通过–cw(0-100)控制参考强度。V7及以上版本用Omni Reference(–oref)替代,通过–ow(0-1000)控制,且不仅能参考角色,还能参考物体、动物等。V8.x系列目前不支持这两个参数。

负面提示词应该写多少?

建议控制在10-15个词以内。超过这个数量,模型的注意力会被分散,正面提示词的效果也会被削弱。可以建立多套模板按场景切换,而不是每次都写一长串。

如何让AI画的人物更像真人?

三个关键:光照描述要具体(侧光、逆光、轮廓光),皮肤质感要正向引导(真实皮肤纹理、细微毛孔),镜头参数要加入(85mm、浅景深)。另外,Flux和Midjourney V8.2在写实人像上的表现目前处于第一梯队。

角色一致性有没有“万能方法”?

没有。最可靠的是“组合拳”:锁定描述模板 + 固定seed + 参考图(如果工具支持)。三者叠加的效果远好于单一方法。另外,尽量减少每次生成中的变量数量——如果同时改变场景、服装、姿态和光照,AI维持角色一致性的难度会急剧上升。

AI绘图人物提示词不是一门玄学,而是一套可以系统学习的技能。从理解结构公式开始,到掌握特征描述的分层技巧,再到根据工具特性调整策略——每一步都有明确的逻辑可循。

最重要的心法只有一条:AI不是在“理解”你的描述,而是在“解码”你的指令。 每一个词的位置、权重和精确度都在影响输出。写提示词的过程,本质上是在用AI能理解的语言,把脑海中的画面“翻译”出来。

翻译得越精确,画面就越接近你的想象。

以上内容不代表本平台立场,仅供读者参考