文章摘要
AI绘画真人提示词是决定写实人像成败的核心变量。同样的模型,同一组参数,有人生成的照片能骗过专业摄影师的眼睛,有人却只能得到一张皮肤像塑料、眼神空洞的“蜡像”。差距不在工具,在于你写下的每一个词。从提示词公式、真实感技巧、工具适配到常见问题,系统拆解让AI画出真人级人像的实操方法。

AI绘画真人提示词是决定写实人像成败的核心变量。同样的模型,同一组参数,有人生成的照片能骗过专业摄影师的眼睛,有人却只能得到一张皮肤像塑料、眼神空洞的“蜡像”。差距不在工具,在于你写下的每一个词。从提示词公式、真实感技巧、工具适配到常见问题,系统拆解让AI画出真人级人像的实操方法。

AI绘画真人提示词

为什么你的AI真人提示词总是“翻车”?

大多数人在写AI绘画真人提示词时,习惯性地堆叠“超高清”“杰作”“绝世容颜”这类形容词。这些词对模型来说几乎没有有效信息,反而会触发过度的美颜处理,让人物皮肤变得光滑如瓷器,光影扁平如证件照。更隐蔽的问题是:很多人把“漂亮”当成指令来用,但“漂亮”是一个审美判断,模型需要的是可渲染的物理特征——颧骨高度、鼻梁角度、眼型轮廓、皮肤纹理的密度。

另一个高频失误是负面提示词写得太“狠”。为了防止画面模糊,有人会写“no blur”,为了防止噪点,会写“no noise”。但真实摄影中的皮肤质感恰恰依赖微小的噪点和自然的颗粒感来建立真实感。把“瑕疵”全部抹掉,AI就只能用塑料般的光滑表面来填充空白。

中英提示词的语义错位陷阱

中文AI绘画真人提示词有一个容易被忽略的陷阱:模型对中文的“摄影语言”理解深度远不如英文。写“伦勃朗光”和写“Rembrandt lighting”,在后端嵌入空间中的激活强度可能相差数倍。这不是说中文不能写,而是当涉及专业光学参数和摄影术语时,英文原词往往能获得更精确的响应。如果你用中文描述主体特征,用英文锚定摄影参数,通常在写实人像上能得到更稳定的结果。

AI绘画真人提示词的核心公式

不管用哪个模型,写实人像提示词都有一个经得起验证的底层结构。基础版是“主体 + 场景 + 风格”三段式,适合快速出图。真正能稳定产出摄影级效果的是进阶结构:主体描述 + 场景细节 + 镜头语言 + 光影逻辑 + 真实感锚点 + 负面约束。

主体描述不是写“一个女孩”,而是写“28岁东亚女性,鹅蛋脸,颧骨微高,单眼皮,鼻梁挺直但鼻头圆润,嘴角自然微收”。五官越具体,模型越不需要“猜”,输出的面部结构就越稳定。

场景细节要包含三层空间信息:前景(如果有)、人物所处的中景位置、背景的环境关系。只写“在咖啡馆”太过笼统,写“午后咖啡馆窗边,桌面有半杯拿铁,背景虚化中有书架轮廓和暖色吊灯”才能让模型建立空间纵深。

镜头语言是区分“AI感”和“摄影感”的分水岭。写“85mm f/1.8,半身构图,视线略偏镜头左侧”比写“好看的人像”有效得多。焦距决定了面部压缩的程度和背景虚化的形态,光圈决定了景深的深度,视角决定了人物与镜头的心理距离。

六段式结构 vs 九段式结构

2026年的实践中,提示词结构出现了两种主流框架。六段式:主体 + 场景 + 风格 + 光线 + 镜头 + 细节,适合Midjourney和Flux这类对自然语言友好的模型。九段式:成立点 → 场景 → 气质 → 动作 → 妆造 → 成像 → 镜头 → 随机 → 护栏,更适合需要批量生产、要求高度结构化的GPT Image 2工作流。

两者的核心差异在于“成立点”这个概念。九段式要求你先回答一个问题:这张照片为什么成立?是一张杂志封面?一次街头抓拍?一个纪录片采访的定格?不同的成立点,决定了后续所有参数的选择逻辑。如果你写的是“杂志封面”,光线应该是蝴蝶光或伦勃朗光,构图应该留出标题空间;如果写的是“街头抓拍”,光线应该是自然光,构图应该带有轻微的倾斜和不完美感。

摄影级人像提示词的分层拆解

一张稳定的写实人像,从提示词的第一行到最后一行,信息密度应该逐层递增:

第一层(身份锚点):年龄 + 族裔 + 面部骨骼特征 + 皮肤底色。这一层决定“这个人长什么样”。

第二层(情绪与气质):眼神方向 + 嘴角状态 + 微表情 + 头部姿态。这一层决定“这个人此刻在想什么”。

第三层(场景逻辑):室内/室外 + 时间 + 天气 + 空间层次。这一层决定“这张照片为什么被拍下来”。

第四层(光学参数):焦距 + 光圈 + 相机型号 + 胶片模拟。这一层决定“这张照片是谁拍的”。

第五层(真实感细节):毛孔 + 绒毛 + 肤色不均 + 眼白微红 + 唇纹。这一层决定“这是不是真人”。

第六层(负面约束):结构错误 + 风格漂移 + 光影污染 + 构图干扰。这一层决定“什么不该出现”。

真实感锚点词库

以下词库按“正向激活”和“负向排除”两个方向组织,可直接嵌入你的AI绘画真人提示词中:

正向真实感锚点:真实皮肤纹理、可见毛孔、细小绒毛、脸颊轻微泛红、肤色自然不均匀、鼻翼自然油光反射、眼白微红血丝、唇纹自然、眼下轻微细纹、面部不对称、耳朵半透明感、发丝边缘碎发。

负向排除词:塑料皮肤、蜡像感、过度磨皮、光滑无毛孔、完美无瑕肌肤、喷枪修图效果、CG渲染、3D模型感、插画风、油画笔触。

让AI画出“真人感”的六个关键维度

皮肤真实感的底层逻辑

真人的皮肤不是均匀的。它有毛孔的微小凹陷,有T区和脸颊不同的油脂分布,有毛细血管在表皮下的隐约透色。AI模型默认倾向于“平均化”处理,因为训练数据中的大量图像经过了美颜和磨皮。要对抗这种倾向,必须在提示词中主动注入“不完美”的信息。

“次表面散射”是让皮肤从塑料变成血肉的关键技术词。人体皮肤是半透明的,光线穿透表皮后在真皮层散射,形成一种温暖的通透感。在提示词中加入“次表面散射”或英文“subsurface scattering”,能让模型在渲染皮肤时计算光线穿透效果,而不是仅仅在表面叠加高光。

毛孔的处理需要分层。不是简单地写“可见毛孔”,而是描述毛孔在不同光线下的表现:侧光下鼻翼和脸颊的毛孔阴影,正面柔光下T区的自然油光与毛孔的交互,逆光时面部绒毛在皮肤表面形成的细密轮廓。这些细节组合起来,才能构建出经得起放大查看的皮肤质感。

光影控制的实操方法

写实人像的光影不是“亮”和“暗”的二元对立,而是光线如何与面部骨骼结构交互。伦勃朗光的核心是暗侧脸颊上的三角形光斑,这个光斑的位置、大小和边缘软硬,决定了人像的立体感和情绪基调。

在实际写AI绘画真人提示词时,不要只写“伦勃朗光”,要写清楚光源位置和效果:“主光源从人物右上方45度角打入,在左侧颧骨下方形成三角形光斑,暗部保留层次不压死黑,高光区有柔和的过渡。”这比一个笼统的风格词有效得多。

自然光的处理逻辑不同。窗光的特征是光线从一侧进入,在面部形成从亮到暗的渐变,靠近窗户的一侧有柔和的亮部,远离窗户的一侧逐渐过渡到阴影。写“柔和窗光,面部光影从左侧向右侧自然过渡,阴影边缘柔和无硬边”比写“自然光”精确得多。

镜头参数的注入技巧

相机型号和镜头参数不是装饰性词汇,而是向模型注入光学约束。85mm焦段会压缩面部比例,让五官更紧凑、背景更压缩;35mm焦段会夸张近大远小的透视,适合环境人像;50mm是最接近人眼视角的焦段,适合自然感强的抓拍风格。

光圈值影响景深和散景形态。f/1.4的大光圈会产生极浅的景深,只有眼睛所在的平面清晰,鼻尖和耳廓开始虚化。f/5.6的中等光圈则能让整个面部保持在焦点范围内,适合需要展示面部全貌的肖像。在提示词中同时指定焦距和光圈,比如“85mm f/2.0”,模型会据此计算景深衰减曲线和背景虚化的形状。

胶片模拟是另一个有效的真实感锚点。“Kodak Portra 400”会带来暖调和柔和的颗粒过渡,“Fujifilm Pro 400H”偏向冷调和通透的肤色表现,“CineStill 800T”则带有明显的钨丝灯色彩偏移和强烈的光晕感。这些具体的胶片型号比“胶片感”三个字有效得多。

微表情与面部细节的精确控制

AI生成的人像最常见的“翻车”不是结构错误,而是表情空洞。眼神没有焦点,嘴角没有细微的肌肉牵动,整个面部处于一种“静止的假笑”状态。解决这个问题需要从微表情的肌肉层面来描述。

眼神光的处理是关键。真实的眼球表面会反射环境光源,形成一个小而亮的反射点。如果光源在人物左前方,眼神光应该出现在瞳孔的左上象限;如果是窗光,反射可能是一个横向的矩形亮斑。写“眼中带有与主光源方向一致的清晰眼神光反射”比写“明亮的眼睛”有效得多。

嘴角的微表情需要区分“微笑”的层次。真实的笑不是嘴角同时上扬,而是先有一侧嘴角的轻微牵动,然后扩展到眼轮匝肌的收缩(鱼尾纹),最后才是双颊的提升。在提示词中写“嘴角右侧先有轻微上扬,眼轮匝肌自然收缩形成细微鱼尾纹”能让表情从“标准笑脸”变成“有故事的微笑”。

发丝与边缘细节的真实化处理

头发的真实感问题往往出现在两个地方:发根与头皮的过渡,以及发丝边缘的碎发处理。AI倾向于把头发渲染成一块光滑的色块,缺少发丝之间的层次和透光感。

在提示词中加入“发根与头皮自然过渡,头顶有碎发翘起,发丝边缘有逆光形成的透光轮廓”能显著改善头发的质感。如果人物有刘海或鬓角,写“鬓角处有细碎毛发自然垂落,与面部皮肤形成柔和的边界过渡”可以避免头发像一顶帽子扣在头上的感觉。

肢体与手部的写实策略

手部一直是写实人像的难点。2026年的主流模型在手部生成上有了明显进步,但依然需要在提示词中主动约束。有效的手部提示不是“完美的双手”,而是“自然的手部姿态,手指关节有自然的弯曲弧度,指甲有轻微的月牙白,手背可见浅层静脉” 。

如果人物有肢体动作,要在描述中同时包含“动作方向”和“重心分布” 。写“右手轻扶桌面边缘,重心放在左腿,身体略微前倾”比写“站在桌边”更能让模型理解人体的力学逻辑,减少肢体扭曲和比例失调。

主流工具适配AI绘画真人提示词的差异

不同模型对提示词的解析逻辑不同,同一组词在不同工具上的表现可能差异显著。以下表格从提示词结构偏好、写实优势、参数控制和典型适用场景四个维度进行横向对比。

模型 提示词结构偏好 写实优势 关键参数 典型适用场景
Midjourney v7/v8 自然语言短语,少堆关键词,强调氛围和风格描述 电影级光影、时尚编辑感,面部美学稳定 --style raw降低美化,--s 50-100控制风格化,--v 8 杂志封面、电影感肖像、氛围写真
Flux Pro / Flux 2 自然语言+摄影术语混合,对相机参数响应精确 皮肤纹理细腻,复杂光线下的色彩还原准确 API调用,无内置参数但支持极高分辨率输出 商业人像、产品级写实、多光源场景
Stable Diffusion XL 关键词堆叠+权重标注,需要精确的负面提示词 可通过LoRA精细控制面部特征,社区资源丰富 DPM++ 2M Karras采样器,CFG 5.5-7,步数28-30 批量人像、角色一致性要求高的项目
GPT Image 2 自然语言分段描述,偏好“任务模式”先行的结构化写法 对语言语义理解强,面部结构稳定不易崩坏 9:16竖图建议1024×1824,自然语言优先于关键词堆叠 结构化提示词工作流、角色锁定
即梦 / Seedream 中文自然语言友好,支持关系型语境描述 中文语义理解准确,肤色和东亚面孔表现好 需指定输出尺寸,负面提示词支持度因版本而异 中文创作者、东亚人像、快速出图

Midjourney的优势在于“美学直觉”。它的训练数据中高质量摄影和时尚编辑内容占比较高,所以即使你的提示词写得不够精确,它也能“猜”出不错的画面。但这也意味着你需要用--style raw和较低的--s值来抑制它的美化倾向,否则人物会偏向“网红脸”的过度精致。

Flux Pro的核心竞争力是光学还原。它对相机参数和胶片模拟的响应比Midjourney更精确,在混合光源和复杂光影场景下的色彩准确性更高。如果你需要的是“像用真实相机拍出来的照片”,Flux系列目前是写实人像的第一梯队。

Stable Diffusion XL的优势在于“可调性”。通过不同的checkpoint和LoRA,你可以精确控制面部特征、皮肤质感和光影风格。但代价是需要更多的技术投入,包括采样器选择、CFG调参和负面提示词的精细管理。community默认的写实人像参数是DPM++ 2M Karras采样器配合CFG 5.5-7和28-30步。

GPT Image 2的独特之处在于对“意图”的理解。用自然语言写一段完整的人物描述,它比关键词堆叠的模型更能把握你想要的氛围和叙事感。九段式结构在GPT Image 2上的表现尤其稳定,因为它的语言模型层面对段落逻辑的理解更深。

进阶技巧:让同一张脸在不同提示词中保持一致

角色一致性是写实人像中的一个深层问题。同一个AI绘画真人提示词在不同时间运行,可能得到面部结构差异明显的结果。解决这个问题需要从三个层面入手。

第一层是文本锚点的固化。将面部特征描述拆解为不可变的“身份锚点”和可变的“场景变量”。身份锚点包括:脸型(鹅蛋/方/圆/心形)、颧骨高度、眼型(杏眼/丹凤/圆眼)、鼻梁形态、唇形、肤色底调。这些描述在每次生成中保持完全一致。场景变量包括:光线、镜头、动作、服装、背景,这些可以自由变化。

第二层是工具层面的锁定。Midjourney v7引入了--face refined参数,可以对面部进行更精细的控制。Stable Diffusion可以通过LoRA训练锁定特定面部特征,但需要准备15-20张同一人物的多角度照片进行训练。GPT Image 2支持参考图模式,上传一张基准面部照片后,后续提示词中的面部描述会以此为锚点。

第三层是负面约束的强化。在负面提示词中加入“面部特征漂移、五官比例不一致、左右脸不对称变化”等词,可以在生成阶段抑制面部结构的大幅波动。

不同场景的AI绘画真人提示词实战模板

手机前置自拍风格

手机自拍的视觉特征是广角畸变、自然光、略带噪点的画质和“随手拍”的构图不完美感。提示词的核心是模拟前置摄像头的物理特性:24mm等效焦距带来的轻微面部透视变形,f/2.2左右的手机光圈产生的适中景深,以及手机算法处理后的色彩风格——偏暖、对比度略高、有轻微的锐化痕迹。

一个有效的结构是:“24岁东亚女性,鹅蛋脸,皮肤有自然纹理和可见毛孔,手机前置摄像头自拍,上半身构图,面部占据画面约40%,略微俯视角度,室内柔和自然光,背景是居家环境,轻微过曝,手机算法色彩处理,清晰度自然不过锐。”

专业摄影棚人像

棚拍的视觉特征是精确的光线控制、干净的背景和高级的质感表现。提示词的重点在于光源的位置、形状和方向,以及人物与光线的关系。

推荐结构:“时尚编辑人像,28岁东亚女性模特,高颧骨,丹凤眼,裸色唇釉,穿象牙白真丝衬衫,正面面对镜头,表情平静微带笑意,蝴蝶光从正上方打入在鼻下形成对称蝶形阴影,背景纯灰,85mm f/2.0,浅景深,皮肤纹理清晰可见,次表面散射,专业修图但不过度磨皮。”

自然光环境人像

环境人像的核心是人物与环境的互动关系,以及自然光的不可控美感。提示词需要同时处理空间纵深、光线方向和人物在空间中的位置。

推荐结构:“年轻女性,短发,穿米色亚麻衬衫,坐在老式图书馆的木质长桌旁,侧身面向窗户,午后自然光从左侧窗户进入,在面部右侧形成柔和的阴影过渡,背景有书架和阅读灯的暖色散景,35mm镜头,f/2.8,肤色自然不均匀,脸颊有淡雀斑,画面有轻微胶片颗粒感。”

负面提示词的正确写法

负面提示词的目的是“排除模型容易生成但你不需要的内容”,而不是“列出所有可能出错的东西”。写得越长、越杂,模型反而可能在负面空间中随机采样,产生意想不到的畸变。

按照功能分类来组织负面提示词是最有效的方式:结构类(deformed, extra fingers, missing fingers, bad anatomy, extra limbs)、画质类(low quality, worst quality, blurry, pixelated, jpeg artifacts)、风格类(cartoon, illustration, 3D render, CGI, painting)、干扰类(watermark, text, signature, logo) 。

对于写实人像,风格类负面词尤其重要。加入“cartoon, anime, illustration, painting, 3D render”可以防止模型在面部结构生成失败时退回到插画风格。加入“plastic skin, smooth skin, airbrushed, beauty filter”可以抑制过度磨皮倾向。

常见问题解答

问:为什么我的AI绘画真人提示词生出来的人总是“一个样”?

答:你的提示词中缺少可变的“面部锚点”。如果主体描述只写了“年轻女性”,模型会从训练数据中取一个“平均脸”作为默认值。需要加入具体的面部特征词,比如“颧骨微高、眼距略宽、鼻头圆润、下颌线柔和”等。每个描述词都在缩小模型的采样空间,让它从“所有年轻女性的平均”逐渐收敛到“这一个具体的人”。

问:写实人像应该用中文还是英文写提示词?

答:混合使用效果最好。主体特征、场景描述和情绪氛围用中文(因为你的母语表达更精确),摄影参数、胶片型号、光影术语用英文原词(因为模型对这些术语的英文嵌入理解更深)。比如:“28岁东亚女性,鹅蛋脸,皮肤有自然纹理,Rembrandt lighting,85mm f/1.8,Kodak Portra 400。”

问:加了“8K”“超高清”这些词,人物反而更假了,为什么?

答:这些质量词会让模型倾向于“过度渲染”。它们不是真实感指令,而是“渲染精度指令”。模型会把“8K”理解为“把所有细节都强化到极致”,包括把毛孔渲染成深坑、把皮肤纹理变成浮雕效果,结果就是过锐化的塑料感。写实人像不需要这些词,需要的是“自然”“真实”“不过度处理”这类约束。

问:如何让生成的人像看起来不像“AI画的美女”,而像一个真实存在的人?

答:核心策略是主动引入“不完美” 。真实的人有不对称的眉毛、轻微的眼袋、脸颊上淡淡的雀斑或痣、鼻翼的自然油光、眼下的一两条细纹。这些“瑕疵”在AI的默认输出中会被美颜逻辑抹掉,你需要在提示词中把它们“要回来”。在负面提示词中排除“beauty filter, retouched, smooth skin, plastic skin, airbrushed”,同时在正向提示词中加入“natural skin texture, visible pores, slight asymmetry, natural blemishes”。

问:同一组提示词在不同工具上效果差异很大,需要为每个工具重新写吗?

答:不需要从零重写,但需要做结构适配。核心原则是:Midjourney和Flux偏好自然语言段落,Stable Diffusion偏好关键词列表+权重标注,GPT Image 2偏好分段结构化的任务描述。你可以保留提示词的“内容层”(人物特征、场景、光线),只调整“格式层”(表述方式、参数注入方式)。把同一组内容用三种格式各写一遍,作为你的基础模板库,后续替换变量即可。

问:写实人像的提示词长度,是越长越好吗?

答:不是。提示词的有效长度取决于信息密度,而不是字数。一段150字但每个词都在缩小模型采样空间的提示词,比500字堆满同义词和空洞形容词的提示词有效得多。判断标准很简单:删掉一个词,生成的画面是否明显变化?如果不会变化,这个词就是冗余的。写实人像的理想提示词长度通常在80-200个有效词之间,具体取决于模型和场景复杂度。

问:为什么人物的手总是画不好?

答:手部是当前所有扩散模型的结构性弱点,因为手的关节角度、手指遮挡关系和透视变化极其复杂,训练数据中的高质量手部样本相对稀缺。缓解策略包括:在提示词中加入手部细节描述(“手部自然放松,手指关节有轻微弯曲”)、在负面提示词中强化结构排除(“extra fingers, fused fingers, malformed hands”)、以及如果工具支持的话,使用手部修复的二次处理(如Stable Diffusion的ADetailer扩展或inpainting)。最根本的解决方式是减少手部在画面中的权重——如果人物动作允许,让手部部分遮挡或处于画面边缘。

以上内容不代表本平台立场,仅供读者参考