AI动作提示词大全:让AI人物从僵尸变活人的完整指南

很多人写ai动作提示词时只写“他在走路”,结果生成的人物像太空漫步。本文整理了一份可直接套用的ai动作提示词大全,涵盖站坐走跑跳及手部细节,附横向对比表格与常见误区解析,帮你把模糊动作翻译成AI能执行的精准指令,让人物真正“活”起来。

一、为什么你写的动作,AI总是理解不了
先说一个很多人踩过的坑。
你输入“一个女生坐在咖啡店里”,AI给你一张画面——女生端端正正坐着,表情空洞,手不知道放哪里,整个人像蜡像馆里搬出来的。你换一句“她在走路”,更糟,人物迈着僵硬的步子,关节像上了生锈的发条。
问题不在于模型不够强。问题在于:“走路”和“坐在”对AI来说,信息量几乎为零。
AI没有“生活经验”。它不知道“自然”长什么样,不知道“随意”是什么感觉。它只知道你写的那些词所对应的视觉模式。你写“坐着”,它就找训练数据里最典型的“坐”——笔直、对称、静止。你写“走路”,它就调用最标准的“走”——均匀步幅、摆臂机械、地面接触生硬。
真正有效的ai动作提示词,本质上是在做一件事: 把人类凭直觉完成的动作,拆解成AI能识别的身体部位、方向、力度和节奏。
举个例子。Kling AI的官方文档把“跑步”拆成了几个维度:快速跑要用sprinting、dashing、bolting,同时描述前倾、摆臂驱动、快速触地、镜头跟随节奏;轻松跑则用jogging、trotting,配以小步幅、放松的肩膀、稳定的节奏和较轻的地面接触;情绪化的跑——逃离、冲刺、突进——还要写出面部表情、紧迫感、方向、障碍物和移动的原因。
你看,一个“跑”字,拆出了速度、姿态、触地方式和情绪动机四个层面。这才是ai动作提示词该有的颗粒度。
另一个来自实战的教训:越慢的动作越稳,越快的动作越容易崩。 这不是玄学,是因为快速动作对AI来说意味着更大的帧间变化,模型需要在极短时间内保持角色一致性,容错窗口窄得多。所以如果你追求稳定性,宁可把动作写“慢”一点,让模型有空间去渲染每一帧的细节。
理解了这层逻辑,下面进入正题。
二、一个公式,解决80%的动作描述问题
不管你是做图还是做视频,不管用的是哪家模型,人物动作提示词有一个通用骨架:
主体 + 身体姿态 + 肢体动作细节 + 表情状态 + 场景氛围 + 画质风格
拿“女生坐咖啡店”举例。30分的写法是“年轻女生坐在咖啡店窗边”。90分的写法是:
年轻女生坐在咖啡店窗边,双腿轻轻交叠,一只手托着下巴,另一只手食指无意识地轻敲桌面,视线落在窗外某处,表情若有所思。暖黄自然光从窗户斜照进来,浅景深虚化背景,电影质感。
区别在哪?在于你替AI回答了“具体怎么动”这个问题。托下巴的是哪只手,另一只手在干什么,视线朝哪个方向,表情是什么状态——每一个细节都在缩小AI的自由发挥空间,同时也在提高画面的一致性。
这里有一条容易忽略的原则:一个镜头里,主要动词不超过两个。 跨平台的研究反复验证了这个结论——两个以上动词,模型会自己“选一个”来执行,结果就是动作混乱或部分动作丢失。如果你需要多步骤动作,用“然后”“接着”这类词显式地划分时间线,或者分镜头来写。
三、站姿:不是所有“站着”都一样
站姿是动作提示词的起点,也是最容易写废的一类。很多人写“a person standing”,AI就给一个笔直站立、双手垂放、正面朝向镜头的“证件照姿态”。问题不在于AI不会站,而在于你没告诉它重心在哪、手在干什么、视线往哪看。
下面的表格横向对比了四种常见站姿的提示词写法。注意看每一行里,哪些关键词决定了“这个站姿和那个站姿不一样”。
| 站姿类型 | 核心身体机制 | 关键提示词(中文示例) | 关键提示词(英文对应) | 最容易翻车的点 |
|---|---|---|---|---|
| 自信站姿 | 双脚与肩同宽,重心均匀,肩部后展 | 双脚与肩同宽站立,双手自然垂放身体两侧,肩部后展,下巴微抬 | feet shoulder-width apart, shoulders back, chin slightly lifted | 写成“挺胸抬头”会变成军训站姿,太硬 |
| 放松站姿 | 重心偏移到一条腿,脊柱有自然弧度 | 重心放在一条腿上,一只手随意插兜,脊柱有轻微弧度而非笔直 | weight shifted to one foot, slight curve to the spine | 写“放松”但不写重心偏移,AI不知道“松”在哪 |
| 倚靠站姿 | 靠墙、单脚踩墙、视线不直视镜头 | 靠在水泥墙上,双臂松松交叉,一只脚平踩墙面,视线看向侧方 | leaning against wall, one foot flat against wall, eyes looking sideways | 视线直视镜头就变成“到此一游照” |
| 双手叉腰站姿 | 手肘微外弯,重心均匀,头微侧 | 双手叉腰,手肘微向外弯,重心均匀,头微侧,嘴角半笑 | hands on hips, elbows slightly bent outward, head tilted at a slight angle | 手肘完全外展会显得凶,微弯才有气场 |
这张表的核心信息其实只有一句话:站姿的“性格”藏在重心和视线里,不在“站”这个动词里。 你把重心写在哪个脚上、视线朝哪,AI才知道这个人在“等车”还是在“面试”。
一个独到的观察:手部是最能区分“活人感”和“AI感”的部位。 大多数AI生成的人物,手要么僵硬垂放,要么做出一个过于完整的“手势造型”。真实的人在站立时,手往往处于“半活动状态”——拇指无意识摩挲、手指轻敲、手半插兜露出手腕。这些微动作不会改变大姿态,但会让人物从“摆拍”变成“被抓拍”。
四、坐姿与行走:让身体产生“叙事感”
坐姿和行走是日常场景中使用频率最高的两类动作,也是最容易写出“AI味”的两类。
坐姿的秘诀:不是“坐着”,是“怎么坐着”
“坐着”本身几乎不产生任何视觉信息。真正让坐姿变得生动的,是腿的摆放、手的去向和脊柱的角度。
三种有效的坐姿写法:
交叉腿+单手托腮:适合“沉思”“等待”“观察”的场景。双腿在膝盖处交叉,一只手托下巴或脸颊,另一只手放在大腿或桌面上。这个姿态的自然感来自一个事实——人的手在无意识中会“找地方放”,托腮是最常见的自我安抚动作。
前倾+手肘撑桌:适合“专注”“交谈”“阅读”的场景。上半身前倾约15到20度,手肘支撑在桌面上,双手交叠或自然分开。前倾的幅度是“兴趣程度”的视觉信号,前倾越多,投入感越强。
后靠+单脚点地:适合“放松”“无所谓”“疲倦”的场景。背部靠在椅背上,一条腿伸直、另一条腿的脚尖点地,双手放松地搭在椅子扶手或腿上。后靠的姿态传达的是“我不需要证明什么”的状态。
行走的秘诀:触地和速度比“走”重要
行走提示词的核心不在“walk”,而在脚怎么触地、身体怎么前移、手臂怎么摆。
参考Kling AI的分类方法,把走路拆成三种速度层级来写:
慢走(shuffling / strolling) :小步幅,肩膀放松,节奏稳定,地面接触轻。适合“闲逛”“下班回家”“夜色中散步”的氛围。关键词是“smaller steps, relaxed shoulders, lighter ground contact”。
中速走(walking at a steady pace) :正常步幅,手臂自然摆动,身体有轻微的前后晃动。这是最通用的行走写法,但一定要加一个“扰动因素”防止僵化——比如“一只手拿着咖啡杯,走路时杯口有轻微晃动”或“风吹动外套下摆”。
快速走(striding / marching) :身体前倾,手臂驱动明显,脚触地节奏快而有力。写的时候必须搭配镜头关系:“镜头以相同速度跟随”,否则人物会“跑出画面”或“原地踏步”。
一个很多教程不会告诉你的细节:行走动作最大的失败模式是“滑步感”。 人物在走,但脚看起来像在冰面上滑。解决办法是在提示词里明确“地面接触”——比如“脚掌落地时有轻微停顿感”或“鞋底与地面有可见的摩擦反馈”。这听起来很细微,但它是区分“真走”和“假走”的关键。
五、跑、跳、打:高难度动作的降维写法
跑、跳、打斗是动作提示词里难度最高的三类,因为它们的帧间变化大、身体力学复杂、角色一致性容易崩。但有一个降维的思路:不写“跑”,写跑的“准备动作”和“身体痕迹”。
跑步:写“前倾”不写“跑”
AI对“跑”的理解很容易滑向“快速移动的模糊人影”。有效的写法是锁定三个视觉锚点:
前倾角度 + 摆臂幅度 + 触地反馈。
“短跑冲刺”的写法可以是:“身体明显前倾,双臂有力地前后摆动,脚掌快速蹬地,每一步都有轻微的地面扬尘或水花溅起,低角度跟拍镜头保持与人物同速。”这里“前倾角度”决定了速度感,“摆臂”决定了真实感,“触地反馈”决定了物理感。三者缺一,画面就会飘。
跳跃:写“蓄力”和“落地”不写“跳”
跳跃动作最容易被AI简化为“悬浮”。人物跳到半空,然后悬在那里,没有重力感。
有效的写法是把跳跃拆成四个阶段:蓄力(下蹲、手臂后摆)、起跳(腿部伸展、手臂上摆)、空中(身体伸展或团身,根据跳跃类型决定)、落地(膝盖缓冲、身体微沉)。跳跃提示词的价值不在“跳得多高”,而在“落地的时候身体怎么接住自己”。一个完整的跳跃描述,落地阶段至少占三分之一的篇幅。
打斗:写“因果链”不写“出招”
打斗提示词是最高阶的应用场景。如果只是写“一个人出拳”,AI会给你一个“摆拍出拳”的静态感。真正有效的打斗提示词需要写出攻击的因果链:
重心变化 → 腰胯发力 → 武器或肢体加速 → 命中反馈 → 惯性收势。
这是一套来自实战的力学描述框架。核心逻辑是:人的任何有力动作都不是“手臂在动”,而是“身体在驱动手臂”。你写“右拳击出”,AI可能只动拳头;你写“右脚蹬地,重心前移,腰胯旋转带动右肩,右拳沿直线轨迹加速击出,击中目标后拳部有短暂的停滞感,身体因惯性微微前倾”,AI才有可能生成一个有“重量感”的动作。
还有一个反直觉的建议:打斗提示词里,负面约束比正面描述更重要。 明确写出“禁止”什么,往往比写“要什么”更能稳定输出。常见的负面约束包括:武器不得复制或变形、角色面部不得漂移、单秒主要动作不超过三个、禁止无来源的爆炸或特效。
六、动作提示词的横向对比:生图 vs. 视频 vs. 多步骤
同一个动作,在不同生成任务里的写法策略完全不同。下面的表格横向对比了三种典型场景的提示词设计差异。
| 维度 | 生图(图像生成) | 单镜头视频 | 多步骤/长视频 |
|---|---|---|---|
| 动词数量 | 1个主要动词即可,可加静态修饰 | 1-2个动词,必须明确时间关系 | 按时间线分镜头,每个镜头1个动词 |
| 身体细节 | 关节角度、空间关系(如“左腿在前”) | 重心变化、触地反馈、衣物动态 | 每个镜头的起止姿态要写清楚 |
| 镜头语言 | 构图、景别、视角(全身/中景/侧视) | 镜头运动方式(跟随/推进/环绕) | 分镜切换方式(Cut to / 然后) |
| 风格描述 | 篇幅占比高,可详细描述画质、光影、风格 | 风格描述精简,让位给动作细节 | 风格在首尾镜头锁定,中间以动作驱动 |
| 典型失败模式 | 姿态僵硬、手部畸形 | 动作模糊、角色漂移、滑步感 | 前后镜头角色不一致、动作断裂 |
| 提示词长度 | 可较长,短语堆叠 | 适中,一句话说清一个动作 | 分段落,每个段落对应一个镜头 |
这张表的核心结论是:生图追求“这个瞬间看起来对不对”,单镜头视频追求“这个动作动起来对不对”,多步骤视频追求“这套动作连起来顺不顺”。 三种目标对应三种完全不同的提示词策略,混用必然出问题。
一个容易被忽略的细节:生图提示词习惯用逗号分隔的短语,因为图像模型对短语的权重分配更均匀;但视频提示词里,句号反而有用,因为它帮模型拆分镜头、动作和场景的层次。逗号和句号在提示词里的作用完全不同,别混着用。
七、动作提示词的五个常见误区
以下五个误区,几乎每一个写动作提示词的人都踩过至少两个。
误区一:用“自然”“流畅”“生动”这种词。 AI不知道什么叫“自然”。它只知道你写的具体身体部位和具体方向。把“自然地坐着”翻译成“一只手托下巴,另一只手放在大腿上,脊柱有轻微侧弯”,才算完成翻译工作。
误区二:一个镜头写太多动作。 “他站起来,走到门口,拿起外套,转身说再见”——四个动作挤在一起,模型要么全做但每个都做不好,要么只做前两个。一个镜头一个主要动作,是动作提示词的第一纪律。
误区三:只写“做什么”不写“怎么做”。 “挥手”和“手肘微弯、手掌打开、手腕有轻微旋转的挥手”是两个完全不同的动作。前者是机器人,后者是人。
误区四:忽略负面约束。 正面描述告诉你“要什么”,负面约束告诉你“不要什么”。在动作场景里,负面约束往往比正面描述更能稳定输出——因为AI的“自由发挥”通常发生在你没有明确禁止的地方。
误区五:风格词淹没动作词。 很多人的提示词前半段是“电影质感、8K、超写实、赛博朋克风格”,后半段才提一句动作。视频模型对提示词的“注意力”是有限的,把风格词放前面会挤占动作描述的空间。动作提示词的写法应该是动作先行,风格收尾。
八、进阶思路:把“动作”当成“微叙事”来写
如果你已经掌握了上面的基础框架,下面这个视角可能会改变你对动作提示词的理解。
动作的本质不是“身体在动”,而是“身体在回应一个情境”。
一个人“伸手拿杯子”,如果只写“伸手拿杯子”,就是一个孤立动作。但如果写“杯子在桌沿摇摇欲坠,人物快速伸手去接,手指在杯沿即将滑落的瞬间碰到杯壁”——同一个“伸手”动作,因为情境的加入,变成了一个有张力的瞬间。
这个视角的实践意义在于:在写动作提示词之前,先问自己一个问题——这个人为什么做这个动作? 是因为冷所以抱臂?是因为紧张所以手指在桌面敲击?是因为听到声音所以转头?“为什么”决定了“怎么做”的细节选择。
一个真正有效的动作提示词,读起来应该像电影剧本里的一句表演指示,而不是一份身体部位的清单。它让看的人(和AI)能“看到”动作发生之前的那个瞬间,以及动作完成之后身体的状态。这种前后延伸,才是动作从“执行指令”变成“表演”的分界线。
九、FAQ
问:动作提示词用中文写还是英文写?
主要看模型。Seedance、Kling、可灵等国产模型对中文提示词的理解已经相当好,中文写反而更自然。Sora、Runway、Pika等以英文训练为主的模型,英文提示词的控制精度更高。如果你用英文写,注意中英文名词的对应要准确——“托腮”不是“support chin”,而是“chin resting on hand”;“叉腰”是“hands on hips”不是“hands on waist”。
问:为什么我写了详细的动作描述,AI还是只动了一点点?
两个可能原因。一是动词太模糊——“移动”“改变姿势”这类词AI不知道具体要动哪里。二是动作幅度写得太小——“轻微转头”“微微抬手”在视频生成里可能被模型理解为“不需要动”。解决办法:把动作幅度量化,比如“转头约45度”“手臂从体侧抬起到水平位置”。
问:多个人物同时做不同动作,提示词怎么写?
这是目前所有模型最难处理的情况。如果必须写多主体动作,建议用“分镜”或“分区域”的方式写,不要在一句话里塞多个主体的独立动作。比如“画面左侧的男子在打电话,画面右侧的女子在看手机”,比“男子打电话的同时女子在看手机”更稳定。但即使这样,一致性仍然是挑战,建议尽量用单主体分镜头来构建叙事。
问:动作提示词里要不要写表情?
要,但不要写太多。表情是动作的“情绪注脚”,一个词就够——“专注的表情”“放松的嘴角”“眉头微皱”。写多了会抢占动作描述的权重,而且表情描述在视频生成里的稳定性远低于姿态描述。
问:为什么我写的“微笑”在视频里变成了“咧嘴”?
视频模型对“笑”的默认幅度往往偏大。解决办法是在提示词里用“嘴角轻扬”“半笑”“微笑但不露齿”来控制幅度,同时在负面约束里加“不露齿”“不夸张表情”。中文提示词里的“微笑”本身是一个幅度较大的概念,用“嘴角微微上扬”更精确。
问:动作提示词的理想长度是多少?
没有固定标准,但有一个经验值:单镜头动作提示词,动作描述部分占60%以上,风格和画质描述控制在40%以内。 如果你发现自己写了一大段风格词却只用五个字描述动作,说明动作信息密度不够。反过来,如果动作描述超过150字还没有说清楚“谁在做什么”,说明你写得太散了。
回顾整篇内容,ai动作提示词的核心逻辑其实只有一条:把人类凭直觉完成的动作,翻译成AI能识别的身体部位、方向、力度和节奏。 站姿看重心和视线,坐姿看手和脊柱,行走看触地和速度,跑步看前倾和摆臂,跳跃看落地和缓冲,打斗看因果链和重量感。
每一个动作都值得被拆成“准备—执行—收束”三个阶段来写。当你开始用这种方式思考动作时,你会发现你写的已经不只是提示词,而是一份给AI的表演指导。而AI给出的,也会从“一个在走路的3D模型”,变成“一个正在穿过街道的人”。

