AI绘图卡通人物提示词怎么写?2026年7套公式与6款工具实测指南

ai绘图卡通人物提示词的核心不是堆砌形容词,而是一套结构化的人设翻译系统。本文拆解7种经过实测的提示词公式,对比6款主流工具对卡通角色的还原能力,并给出可直接复制的场景模板,帮你从“生成随机卡通脸”进阶到“稳定产出目标角色”。

一、为什么你写的ai绘图卡通人物提示词,总出“随机路人脸”
先抛出一个经过大量实践验证的判断:AI不是不会画卡通人物,而是你没有告诉它“不要画什么”和“画成什么样才算对”。
大多数人的提示词写作过程是这样的:打开工具,输入“可爱的卡通女孩,大眼睛,微笑”,点击生成,得到一张看起来还行但跟脑子里想的完全不一样的图。然后反复重写,反复失望。
问题出在两个地方。
第一,把“卡通”当成了一个风格词来用。 实际上“卡通”在AI的训练数据里同时对应着至少七种视觉体系——日式赛璐璐动画、美式粗线条漫画、迪士尼3D渲染、皮克斯风格、Q版盲盒手办、扁平矢量插画、儿童绘本水彩。你只说“卡通”,AI就从这七种里随机选一个,每次选的还不一样。
第二,缺乏“人设锚点”。 一套好用的角色提示词,核心公式是:核心主体 + 品类风格 + 差异化细节 + 材质光影 + 画质参数。缺了“差异化细节”这一环,生成的角色就会无限趋近于训练数据里出现频率最高的那张“平均脸”。
要解决这个问题,需要把提示词从“描述性文字”升级为“结构化规格书”。接下来的内容,会从公式、层级、工具、场景四个维度逐一拆解。
二、7套ai绘图卡通人物提示词公式:从入门到精准控制
2.1 六段公式:主体+动作+环境+画风+细节+画质
PixAI官方博客提出了一套被广泛验证的六段公式,适合大多数动漫和卡通角色生成场景。核心逻辑是:模型会大致按照重要性顺序读取提示词,越靠前的内容权重越大。
六个栏位的具体分工如下:
主体:角色是谁。包括性别计数标签(1girl/1boy)、发型、发色、眼色、年龄感。这是最重要的栏位,因为其他一切建立在这上面。范例:1girl, black hair, blue eyes。诀窍是先设定基本场景,再加2-3个有辨识度的特征。
动作:角色在做什么。姿势、表情、视线方向。这是让主体“活起来”的栏位。
环境:角色在哪里。室内/室外、时间、天气、背景元素。
画风:整体视觉风格。anime style、cel-shaded、flat vector、chibi style等。
细节:材质、光影、特殊效果。soft shading、dramatic lighting、fluffy texture等。
画质:masterpiece, best quality, high detail等质量强化词。
完整范例(日系卡通少女):
1girl, long silver hair with blue highlights, amber eyes, wearing a white sailor uniform with red ribbon; standing and looking over shoulder, gentle smile; cherry blossom garden, soft afternoon light; anime style, cel-shaded, soft illustration; detailed fabric texture, soft shadows; masterpiece, best quality, high detail
2.2 四段精简公式:适合Stable Diffusion的“主体→画风→细节→质量”结构
Stable Diffusion对前置词权重更高,把最重要的特征放在最前面——比如你想要“蓝发双马尾少女”,就不能写成“少女,蓝发,双马尾”,而要写成“blue hair, twin tails, young girl”。否则模型可能优先理解“young girl”为泛泛的少女,再叠加蓝发和双马尾时已偏离核心意图。
四段结构的具体要求:
主体段必须包含性别、年龄感、发型发色、服饰类型。缺任一都可能触发默认模板——不写年龄常出成熟脸,不写发色则随机分配。
画风段在提示词开头加“anime style, ”或“Japanese animation still, ”,能快速压制写实倾向。
细节段要求五官和表情必须显式声明。不能依赖“cute”这种模糊词,要写“large sparkling eyes, small nose, blushing cheeks, gentle smile”——SD没有“可爱”的内置定义,“cute”可能触发婴儿脸、动物耳或过度腮红。肢体比例用标准术语:写“chibi proportion (1.5 head tall)”比“small body”可靠。
质量段在末尾固定添加“masterpiece, best quality, official art, extremely detailed”,这组词已被大量动漫训练集高频绑定。
2.3 五层分层架构:画质基底→画风锁定→人物细节→场景构图→光影氛围
这是量产场景中使用的一套工程化结构,各层级权重独立、功能隔离。建议权重分配:画质基底1.0(作为全局基础),画风锁定0.9-1.0(需要强势锁定风格),人物细节0.7-0.8,场景构图0.6-0.7,光影氛围0.5-0.6。
这种结构的优势在于:当你需要调整角色服装但不改变画风时,只需修改“人物细节”层,其他层保持不动,输出风格不会漂移。
2.4 三件套公式:人设标签+视觉风格+专属记忆点
这套公式更适合IP角色设计。核心思路是:做IP角色本质是搭一套完整的人设体系,提示词只是把这套体系翻译成AI能听懂的话。
“专属记忆点”是这套公式中最关键也最容易被忽略的一环。它指的是角色身上那个“一眼就能认出是谁”的视觉符号。比如:
- 左脸颊上的闪电形伤疤
- 头顶永远歪戴的贝雷帽
- 脖子上挂着的破旧胶片相机
- 异色瞳(左金右蓝)
PixAI与NovelAI的对比测试中,角色设定包含了“左颊闪电形伤疤”“红色补丁的芥末黄夹克”“颈间破旧胶片相机”等具体锚点,这些特征让角色在跨场景生成时的辨识度显著提升。
2.5 中文提示词四段式:主体特征+动作姿态+环境氛围+艺术风格
如果你使用的是支持中文提示词的工具(如Z-Image-Turbo、即梦、通义万相等),可以采用这套四段式结构:
| 段落 | 作用 | 关键要素 |
|---|---|---|
| 主体特征 | 定义角色核心形象 | 性别、发型、服装、面部特征 |
| 动作/姿态 | 赋予动态表现力 | 站姿、坐姿、战斗动作、表情情绪 |
| 环境与氛围 | 增强画面叙事性 | 场景设定、天气、光影、时间 |
| 风格与质量 | 控制输出视觉效果 | 艺术流派、分辨率、细节等级 |
中文范例:一位银发少女,身穿未来感机甲裙,站在城市废墟中仰望星空,赛博朋克风格,霓虹灯光效,精细线条,8K分辨率。
2.6 Niji模式三段式:主体描述+风格锚点+画面控制
使用Midjourney的Niji模型时,提示词结构需要调整。必须加--niji 6或--niji 7,禁用--v参数和--style raw,采用“主体描述+风格锚点+画面控制”三段式结构,并避开写实类、主观形容词及连词“and”。
Niji 7于2026年1月发布,对提示词的理解更“literal”(字面),过于氛围化、模糊的“vibe”提示可能效果不如以往。这意味着Niji 7时代需要写得更具体、更直接。
范例:a quirky inventor in oversized goggles, dynamic exaggerated pose, bold ink lines, vibrant flat colors --ar 1:1 --niji 6 --style expressive --s 350。
2.7 负向提示词公式:三组固定组合
负向提示词不是可有可无的补充,它是保证卡通角色“不崩”的关键防线。以下是三组经实测验证的固定组合:
通用画质类(所有卡通角色必加):
lowres, bad anatomy, extra fingers, mutated hands, poorly drawn face, blurry, deformed, disfigured, gross proportions, malformed limbs, missing arms, missing legs, extra arms, extra legs, fused fingers, too many fingers, long neck
风格保护类(防止卡通被写实化):
photorealistic, 3D render, realistic skin texture, photographic, hyperrealistic
构图保护类(防止画面被多余元素填充):
text, watermark, signature, logo, cropped, out of frame, multiple views, merged views
三、六个提示词层级:从“能画出来”到“画得准”的递进逻辑
3.1 第一层:身份定位——告诉AI“这是谁”
这一层的核心是性别计数标签加基本身份。1girl/1boy/2girls先设定基本场景,然后加2-3个有辨识度的特征——发色、眼色、年龄层。身份定位越具体,后续层级的效果越好。如果第一层模糊,后面所有层级都会在模糊的基础上叠加。
3.2 第二层:外貌锚定——用“具体数字+位置”替代模糊形容词
“左耳戴三枚星形耳钉”比“耳朵上有饰品”可靠十倍,“裙摆右侧裂开至大腿”比“飘逸裙摆”可控。AI没有“可爱”的共识标准,写“可爱”大概率生成模糊光影或泛滥柔焦;写“很多”“一些”这种量词,AI会随机塞进七八个路人或杂乱道具。
3.3 第三层:服饰材质——从“school uniform”到“pleated skirt, white blouse, red ribbon”
“school uniform”太宽泛,要写成“pleated skirt, white blouse, red ribbon, knee-high socks”;若需光泽感,追加“satin texture, soft fabric drape”。漏掉材质词,衣服常呈现塑料反光或纸片般僵硬。
3.4 第四层:姿态情绪——用面部肌肉物理运动指令替代情绪词
AI往往无法理解抽象的“悲伤”或“愤怒”,而是需要具体的面部肌肉物理运动指令。把“悲伤地站在雨中”改成“站在倾盆大雨里,左手紧握断裂的信封,雨水顺发梢滴落”——动作和道具才是AI的锚点。
3.5 第五层:场景氛围——环境不是背景板,是叙事的一部分
环境描述需要同时包含空间信息、时间信息和情绪信息。例如“悬浮樱花岛边缘,仰望双月”比“樱花树下”多出了空间关系和动作指向。
3.6 第六层:画质风格——最后锁定的“视觉保险”
在提示词末尾加英文分号,再补一句风格指令,例如:少女,红瞳,猫耳发箍,黑色哥特裙,手持破损怀表;日式插画,赛璐璐上色,9:16手机壁纸。分号前的内容决定画面内容,分号后的内容锁定画风和比例,两者互不干扰。不加分号时,AI容易把“9:16”当成构图描述,生成一堆横幅图。
四、6款工具提示词适配对比
不同AI绘图工具对提示词的“理解方式”差异很大。同一组ai绘图卡通人物提示词,在A工具里可能效果惊艳,在B工具里可能完全跑偏。以下对比基于2026年各工具的最新版本。
| 工具 | 提示词格式偏好 | 卡通角色风格优势 | 中文支持 | 角色一致性方案 | 适合的场景 |
|---|---|---|---|---|---|
| Midjourney Niji 7 | 自然语言+短标签,需--niji 7参数 |
日系动漫、赛璐璐、夸张表情 | 较弱(英文优先) | --cref角色参考 + --sref风格参考 |
追求单张视觉品质的插画 |
| Stable Diffusion XL + LoRA | Tag逗号分隔,前置词权重最高 | 精细控制、可训练专属角色LoRA | 中文社区版支持 | LoRA固定角色特征 + ControlNet控姿态 | 需要批量产出同一角色的场景 |
| PixAI | Tag格式或自然语言均可 | 动漫角色、韩漫风格、角色三视图 | 界面支持中文 | 参考图功能 + Tsubaki系列模型 | 动漫角色设计与迭代 |
| 即梦图片生成 | 中文自然语言最友好 | 国风角色、人像面部质感 | 最强(原生中文) | 参考图上传 + 风格锁定 | 中文创作者的日常卡通角色需求 |
| 文心一格 | 中文结构化提示词 | 国风、水墨、三视图“暴力约束” | 强 | 多视角强制约束词 | 国风IP与东方美学角色 |
| SeaArt | Tag格式,兼容SD生态 | 动漫风格、丰富模型库 | 界面中文 | 参考图 + LoRA + 角色资产 | 需要灵活切换模型的创作者 |
一条重要提醒: 中文提示词在中英混输时容易出问题。写“蓝眼睛”就行,别写“blue eyes”,混合输入会让AI优先响应英文词导致角色变欧美系。如果工具支持中文,统一用中文;如果必须用英文Tag,统一用英文。
五、五种卡通角色提示词实战模板
以下模板可直接复制使用,方括号内为可替换变量。
5.1 日系赛璐璐少女
适用工具:Midjourney Niji 7 / Stable Diffusion / PixAI
提示词:
[1girl], [long straight black hair with blunt bangs], [crimson eyes], wearing [navy sailor uniform with white trim], standing in [a sunlit classroom], [gentle smile, looking at viewer], anime style, cel-shaded, vibrant colors, expressive eyes, soft lighting, clean lineart, masterpiece, best quality
负向:photorealistic, 3d render, bad anatomy, extra fingers, blurry, watermark
关键技巧:Niji 7版本对“looking at viewer”的响应比Niji 6更强,能有效避免角色视线飘移。如果生成的脸型偏成熟,在主体段加入teenage, youthful face。
5.2 Q版盲盒手办风
适用工具:即梦 / 文心一格 / Midjourney
提示词:
泡泡玛特盲盒手办,Q版人物,[灰发男孩],[高冷表情],[印字白T恤、黑色牛仔短裤、腰间系黄格衬衫、黄色工装靴],[墨镜、耳环、项链、手表],3D,C4D渲染,8K,纯白干净背景,工作室灯光,光滑塑料质感
关键技巧:先定品类——“泡泡玛特盲盒手办”直接把整体风格框住,AI就不会跑偏成二次元插画。穿搭细节分层描述,层次感立刻就出来了。
5.3 扁平矢量卡通IP
适用工具:文心一格 / 通义万相 / Canva
提示词:
((multiple views of the same cartoon character, front view, side view, back view, character sheet, clean white background, flat vector style, bold outlines, bright saturated colors, no shading, no texture)), [一只戴红领巾的圆脸熊猫IP,戴圆框眼镜,胖乎乎的身体,憨笑表情,极简设计]
关键技巧:这套“多视角强制约束”方案可以在文心一格中实现三视图效果。如果首图未达要求,保持提示词不变,更换随机种子重绘即可。
5.4 治愈系水彩绘本
适用工具:即梦 / Midjourney / Stable Diffusion
提示词:
a slice-of-life illustration of a [tiny girl with braided brown hair] making breakfast in a sunlit kitchen, everything slightly oversized for her—spatula, egg, pan—determined expression, soft watercolor warmth, gentle grain texture, muted pastel with warm highlights, [Studio Ghibli inspired warmth]
关键技巧:治愈系方向里越是“认真做小事”越可爱。水彩质感的关键词是“soft watercolor warmth”和“gentle grain texture”,不要用“watercolor painting”这种过于泛化的表述。
5.5 国漫3D写实角色
适用工具:即梦 / 通义万相 / Stable Diffusion
提示词:
Chinese fantasy 3D animation, cinematic quality, high detail, dynamic lighting, [少年剑客,黑色高马尾,左眉一道剑痕,玄色交领长袍,腰间佩青色玉佩,右肩覆银色轻甲],站在[悬崖边],[衣摆被山风扬起,手握剑柄,侧目远眺],[远处群山云雾缭绕,金色夕阳逆光],unified color palette, same rendering engine quality
关键技巧:国漫风的核心是“材质冲突”——水墨晕染的衣摆配上金属质感的甲片。用“×”在提示词中强制材质对比,比如“水墨晕染衣摆 × 金属甲片”。
六、三个最容易翻车的提示词写法
6.1 用主观形容词当核心描述
“可爱的”“帅气的”“唯美的”——这三个词在AI的语义空间里几乎没有锚定能力。AI对“cute”的响应可能是婴儿脸、动物耳、过度腮红中的任意一个。替代方案:把主观形容词拆解成具体的视觉特征。不说“可爱”,说“圆脸,大眼睛占脸三分之一,腮红,微笑”。
6.2 中英关键词混输
中文和英文在同一个提示词里混用时,模型会优先响应英文词。写“蓝眼睛”别写“blue eyes”,否则角色会偏向欧美系面孔。规则很简单:用一个语言就统一到底,中途不要切换。
6.3 负面提示词写太长
有人习惯把几十个负面词全堆上去,结果发现画面反而变“空”了。负面词的作用是“排除干扰”,不是“删除画面元素”。通用的画质类负面词6-8个就够,风格保护类和构图保护类各3-4个即可。写太多会让模型过度压制细节,导致线条变细、色彩变淡、质感流失。
七、FAQ
Q1:ai绘图卡通人物提示词用中文好还是英文好?
取决于工具。即梦、通义万相、文心一格等国产工具对中文提示词的理解已经很好,中文输入即可。Midjourney和Stable Diffusion的原始模型对英文Tag的响应更精准。如果工具同时支持中英文,选一种语言统一用到底,不要混输。
Q2:为什么我写的“可爱卡通女孩”生成出来每次风格都不一样?
因为“可爱卡通”不是一个具体风格。你需要指定“日式赛璐璐”“扁平矢量”“Q版盲盒手办”“迪士尼3D”中的具体一种。风格越具体,输出越稳定。
Q3:怎么让同一个卡通角色在不同图片里长得一样?
三条路径:Stable Diffusion用角色LoRA锁定特征;Midjourney用--cref角色参考图;PixAI和即梦用参考图功能。最可靠的方式是LoRA,但需要训练。最快速的方式是--cref或参考图上传。
Q4:提示词写多长比较合适?
最好控制在75个单词以内,关键词超过这个数量对整体画面影响比较少了。重点是把前三个层级写扎实——身份、外貌、服饰,后面的层级作为补充。
Q5:负向提示词里有哪些是卡通角色场景下容易误伤的?
Photorealistic和3D——如果你加这两个词是为了“避免写实”,但有时会连带动漫风格的丰富质感一起削弱。Blurred background——如果你加这个词是为了“不要背景模糊”,但有时会连景深效果一起消除。建议只加你最确定不想要的具体词。
Q6:卡通角色提示词里的权重语法怎么用?
Stable Diffusion用(word:1.5)表示1.5倍权重,(word)默认1.1倍。Midjourney用word::2表示2倍。建议核心主体权重设置在1.3-1.5,风格锁定词1.0-1.2,装饰性细节不超过1.0。权重不要超过2.0,否则容易导致画面崩坏。
写ai绘图卡通人物提示词这件事,本质上是在做一件事:把脑子里的角色形象,翻译成AI能精确执行的规格书。 翻译的质量,决定了输出的质量。
从今天开始,把你习惯的“可爱的卡通女孩”改写成六段公式的完整结构,把主观形容词换成具体的位置和数字,把中英混输统一成一种语言。你会发现,AI不是不会画卡通人物,它只是在等你把话说清楚。

