文章摘要
AI生成人物动作僵硬、缺乏活人感的问题,整理了涵盖站、坐、走、跑、跳等各类动作的可直接套用提示词大全,讲解了动作提示词的通用撰写公式、拆解逻辑,区分不同生成场景的撰写策略,梳理常见误区并解答相关疑问,指导用户将模糊动作拆解为AI可识别的精准细节,优化生成效果。

很多人写ai动作提示词时只写“他在走路”,结果生成的人物像太空漫步。本文整理了一份可直接套用的ai动作提示词大全,涵盖站坐走跑跳及手部细节,附横向对比表格与常见误区解析,帮你把模糊动作翻译成AI能执行的精准指令,让人物真正“活”起来。

AI动作提示词大全

一、为什么你写的动作,AI总是理解不了

先说一个很多人踩过的坑。

你输入“一个女生坐在咖啡店里”,AI给你一张画面——女生端端正正坐着,表情空洞,手不知道放哪里,整个人像蜡像馆里搬出来的。你换一句“她在走路”,更糟,人物迈着僵硬的步子,关节像上了生锈的发条。

问题不在于模型不够强。问题在于:“走路”和“坐在”对AI来说,信息量几乎为零。

AI没有“生活经验”。它不知道“自然”长什么样,不知道“随意”是什么感觉。它只知道你写的那些词所对应的视觉模式。你写“坐着”,它就找训练数据里最典型的“坐”——笔直、对称、静止。你写“走路”,它就调用最标准的“走”——均匀步幅、摆臂机械、地面接触生硬。

真正有效的ai动作提示词,本质上是在做一件事: 把人类凭直觉完成的动作,拆解成AI能识别的身体部位、方向、力度和节奏。

举个例子。Kling AI的官方文档把“跑步”拆成了几个维度:快速跑要用sprinting、dashing、bolting,同时描述前倾、摆臂驱动、快速触地、镜头跟随节奏;轻松跑则用jogging、trotting,配以小步幅、放松的肩膀、稳定的节奏和较轻的地面接触;情绪化的跑——逃离、冲刺、突进——还要写出面部表情、紧迫感、方向、障碍物和移动的原因。

你看,一个“跑”字,拆出了速度、姿态、触地方式和情绪动机四个层面。这才是ai动作提示词该有的颗粒度。

另一个来自实战的教训:越慢的动作越稳,越快的动作越容易崩。 这不是玄学,是因为快速动作对AI来说意味着更大的帧间变化,模型需要在极短时间内保持角色一致性,容错窗口窄得多。所以如果你追求稳定性,宁可把动作写“慢”一点,让模型有空间去渲染每一帧的细节。

理解了这层逻辑,下面进入正题。

二、一个公式,解决80%的动作描述问题

不管你是做图还是做视频,不管用的是哪家模型,人物动作提示词有一个通用骨架:

主体 + 身体姿态 + 肢体动作细节 + 表情状态 + 场景氛围 + 画质风格

拿“女生坐咖啡店”举例。30分的写法是“年轻女生坐在咖啡店窗边”。90分的写法是:

年轻女生坐在咖啡店窗边,双腿轻轻交叠,一只手托着下巴,另一只手食指无意识地轻敲桌面,视线落在窗外某处,表情若有所思。暖黄自然光从窗户斜照进来,浅景深虚化背景,电影质感。

区别在哪?在于你替AI回答了“具体怎么动”这个问题。托下巴的是哪只手,另一只手在干什么,视线朝哪个方向,表情是什么状态——每一个细节都在缩小AI的自由发挥空间,同时也在提高画面的一致性。

这里有一条容易忽略的原则:一个镜头里,主要动词不超过两个。 跨平台的研究反复验证了这个结论——两个以上动词,模型会自己“选一个”来执行,结果就是动作混乱或部分动作丢失。如果你需要多步骤动作,用“然后”“接着”这类词显式地划分时间线,或者分镜头来写。

三、站姿:不是所有“站着”都一样

站姿是动作提示词的起点,也是最容易写废的一类。很多人写“a person standing”,AI就给一个笔直站立、双手垂放、正面朝向镜头的“证件照姿态”。问题不在于AI不会站,而在于你没告诉它重心在哪、手在干什么、视线往哪看。

下面的表格横向对比了四种常见站姿的提示词写法。注意看每一行里,哪些关键词决定了“这个站姿和那个站姿不一样”。

站姿类型 核心身体机制 关键提示词(中文示例) 关键提示词(英文对应) 最容易翻车的点
自信站姿 双脚与肩同宽,重心均匀,肩部后展 双脚与肩同宽站立,双手自然垂放身体两侧,肩部后展,下巴微抬 feet shoulder-width apart, shoulders back, chin slightly lifted 写成“挺胸抬头”会变成军训站姿,太硬
放松站姿 重心偏移到一条腿,脊柱有自然弧度 重心放在一条腿上,一只手随意插兜,脊柱有轻微弧度而非笔直 weight shifted to one foot, slight curve to the spine 写“放松”但不写重心偏移,AI不知道“松”在哪
倚靠站姿 靠墙、单脚踩墙、视线不直视镜头 靠在水泥墙上,双臂松松交叉,一只脚平踩墙面,视线看向侧方 leaning against wall, one foot flat against wall, eyes looking sideways 视线直视镜头就变成“到此一游照”
双手叉腰站姿 手肘微外弯,重心均匀,头微侧 双手叉腰,手肘微向外弯,重心均匀,头微侧,嘴角半笑 hands on hips, elbows slightly bent outward, head tilted at a slight angle 手肘完全外展会显得凶,微弯才有气场

这张表的核心信息其实只有一句话:站姿的“性格”藏在重心和视线里,不在“站”这个动词里。 你把重心写在哪个脚上、视线朝哪,AI才知道这个人在“等车”还是在“面试”。

一个独到的观察:手部是最能区分“活人感”和“AI感”的部位。 大多数AI生成的人物,手要么僵硬垂放,要么做出一个过于完整的“手势造型”。真实的人在站立时,手往往处于“半活动状态”——拇指无意识摩挲、手指轻敲、手半插兜露出手腕。这些微动作不会改变大姿态,但会让人物从“摆拍”变成“被抓拍”。

四、坐姿与行走:让身体产生“叙事感”

坐姿和行走是日常场景中使用频率最高的两类动作,也是最容易写出“AI味”的两类。

坐姿的秘诀:不是“坐着”,是“怎么坐着”

“坐着”本身几乎不产生任何视觉信息。真正让坐姿变得生动的,是腿的摆放、手的去向和脊柱的角度。

三种有效的坐姿写法:

交叉腿+单手托腮:适合“沉思”“等待”“观察”的场景。双腿在膝盖处交叉,一只手托下巴或脸颊,另一只手放在大腿或桌面上。这个姿态的自然感来自一个事实——人的手在无意识中会“找地方放”,托腮是最常见的自我安抚动作。

前倾+手肘撑桌:适合“专注”“交谈”“阅读”的场景。上半身前倾约15到20度,手肘支撑在桌面上,双手交叠或自然分开。前倾的幅度是“兴趣程度”的视觉信号,前倾越多,投入感越强。

后靠+单脚点地:适合“放松”“无所谓”“疲倦”的场景。背部靠在椅背上,一条腿伸直、另一条腿的脚尖点地,双手放松地搭在椅子扶手或腿上。后靠的姿态传达的是“我不需要证明什么”的状态。

行走的秘诀:触地和速度比“走”重要

行走提示词的核心不在“walk”,而在脚怎么触地、身体怎么前移、手臂怎么摆。

参考Kling AI的分类方法,把走路拆成三种速度层级来写:

慢走(shuffling / strolling) :小步幅,肩膀放松,节奏稳定,地面接触轻。适合“闲逛”“下班回家”“夜色中散步”的氛围。关键词是“smaller steps, relaxed shoulders, lighter ground contact”。

中速走(walking at a steady pace) :正常步幅,手臂自然摆动,身体有轻微的前后晃动。这是最通用的行走写法,但一定要加一个“扰动因素”防止僵化——比如“一只手拿着咖啡杯,走路时杯口有轻微晃动”或“风吹动外套下摆”。

快速走(striding / marching) :身体前倾,手臂驱动明显,脚触地节奏快而有力。写的时候必须搭配镜头关系:“镜头以相同速度跟随”,否则人物会“跑出画面”或“原地踏步”。

一个很多教程不会告诉你的细节:行走动作最大的失败模式是“滑步感”。 人物在走,但脚看起来像在冰面上滑。解决办法是在提示词里明确“地面接触”——比如“脚掌落地时有轻微停顿感”或“鞋底与地面有可见的摩擦反馈”。这听起来很细微,但它是区分“真走”和“假走”的关键。

五、跑、跳、打:高难度动作的降维写法

跑、跳、打斗是动作提示词里难度最高的三类,因为它们的帧间变化大、身体力学复杂、角色一致性容易崩。但有一个降维的思路:不写“跑”,写跑的“准备动作”和“身体痕迹”。

跑步:写“前倾”不写“跑”

AI对“跑”的理解很容易滑向“快速移动的模糊人影”。有效的写法是锁定三个视觉锚点:

前倾角度 + 摆臂幅度 + 触地反馈。

“短跑冲刺”的写法可以是:“身体明显前倾,双臂有力地前后摆动,脚掌快速蹬地,每一步都有轻微的地面扬尘或水花溅起,低角度跟拍镜头保持与人物同速。”这里“前倾角度”决定了速度感,“摆臂”决定了真实感,“触地反馈”决定了物理感。三者缺一,画面就会飘。

跳跃:写“蓄力”和“落地”不写“跳”

跳跃动作最容易被AI简化为“悬浮”。人物跳到半空,然后悬在那里,没有重力感。

有效的写法是把跳跃拆成四个阶段:蓄力(下蹲、手臂后摆)、起跳(腿部伸展、手臂上摆)、空中(身体伸展或团身,根据跳跃类型决定)、落地(膝盖缓冲、身体微沉)。跳跃提示词的价值不在“跳得多高”,而在“落地的时候身体怎么接住自己”。一个完整的跳跃描述,落地阶段至少占三分之一的篇幅。

打斗:写“因果链”不写“出招”

打斗提示词是最高阶的应用场景。如果只是写“一个人出拳”,AI会给你一个“摆拍出拳”的静态感。真正有效的打斗提示词需要写出攻击的因果链:

重心变化 → 腰胯发力 → 武器或肢体加速 → 命中反馈 → 惯性收势。

这是一套来自实战的力学描述框架。核心逻辑是:人的任何有力动作都不是“手臂在动”,而是“身体在驱动手臂”。你写“右拳击出”,AI可能只动拳头;你写“右脚蹬地,重心前移,腰胯旋转带动右肩,右拳沿直线轨迹加速击出,击中目标后拳部有短暂的停滞感,身体因惯性微微前倾”,AI才有可能生成一个有“重量感”的动作。

还有一个反直觉的建议:打斗提示词里,负面约束比正面描述更重要。 明确写出“禁止”什么,往往比写“要什么”更能稳定输出。常见的负面约束包括:武器不得复制或变形、角色面部不得漂移、单秒主要动作不超过三个、禁止无来源的爆炸或特效。

六、动作提示词的横向对比:生图 vs. 视频 vs. 多步骤

同一个动作,在不同生成任务里的写法策略完全不同。下面的表格横向对比了三种典型场景的提示词设计差异。

维度 生图(图像生成) 单镜头视频 多步骤/长视频
动词数量 1个主要动词即可,可加静态修饰 1-2个动词,必须明确时间关系 按时间线分镜头,每个镜头1个动词
身体细节 关节角度、空间关系(如“左腿在前”) 重心变化、触地反馈、衣物动态 每个镜头的起止姿态要写清楚
镜头语言 构图、景别、视角(全身/中景/侧视) 镜头运动方式(跟随/推进/环绕) 分镜切换方式(Cut to / 然后)
风格描述 篇幅占比高,可详细描述画质、光影、风格 风格描述精简,让位给动作细节 风格在首尾镜头锁定,中间以动作驱动
典型失败模式 姿态僵硬、手部畸形 动作模糊、角色漂移、滑步感 前后镜头角色不一致、动作断裂
提示词长度 可较长,短语堆叠 适中,一句话说清一个动作 分段落,每个段落对应一个镜头

这张表的核心结论是:生图追求“这个瞬间看起来对不对”,单镜头视频追求“这个动作动起来对不对”,多步骤视频追求“这套动作连起来顺不顺”。 三种目标对应三种完全不同的提示词策略,混用必然出问题。

一个容易被忽略的细节:生图提示词习惯用逗号分隔的短语,因为图像模型对短语的权重分配更均匀;但视频提示词里,句号反而有用,因为它帮模型拆分镜头、动作和场景的层次。逗号和句号在提示词里的作用完全不同,别混着用。

七、动作提示词的五个常见误区

以下五个误区,几乎每一个写动作提示词的人都踩过至少两个。

误区一:用“自然”“流畅”“生动”这种词。 AI不知道什么叫“自然”。它只知道你写的具体身体部位和具体方向。把“自然地坐着”翻译成“一只手托下巴,另一只手放在大腿上,脊柱有轻微侧弯”,才算完成翻译工作。

误区二:一个镜头写太多动作。 “他站起来,走到门口,拿起外套,转身说再见”——四个动作挤在一起,模型要么全做但每个都做不好,要么只做前两个。一个镜头一个主要动作,是动作提示词的第一纪律。

误区三:只写“做什么”不写“怎么做”。 “挥手”和“手肘微弯、手掌打开、手腕有轻微旋转的挥手”是两个完全不同的动作。前者是机器人,后者是人。

误区四:忽略负面约束。 正面描述告诉你“要什么”,负面约束告诉你“不要什么”。在动作场景里,负面约束往往比正面描述更能稳定输出——因为AI的“自由发挥”通常发生在你没有明确禁止的地方。

误区五:风格词淹没动作词。 很多人的提示词前半段是“电影质感、8K、超写实、赛博朋克风格”,后半段才提一句动作。视频模型对提示词的“注意力”是有限的,把风格词放前面会挤占动作描述的空间。动作提示词的写法应该是动作先行,风格收尾。

八、进阶思路:把“动作”当成“微叙事”来写

如果你已经掌握了上面的基础框架,下面这个视角可能会改变你对动作提示词的理解。

动作的本质不是“身体在动”,而是“身体在回应一个情境”。

一个人“伸手拿杯子”,如果只写“伸手拿杯子”,就是一个孤立动作。但如果写“杯子在桌沿摇摇欲坠,人物快速伸手去接,手指在杯沿即将滑落的瞬间碰到杯壁”——同一个“伸手”动作,因为情境的加入,变成了一个有张力的瞬间。

这个视角的实践意义在于:在写动作提示词之前,先问自己一个问题——这个人为什么做这个动作? 是因为冷所以抱臂?是因为紧张所以手指在桌面敲击?是因为听到声音所以转头?“为什么”决定了“怎么做”的细节选择。

一个真正有效的动作提示词,读起来应该像电影剧本里的一句表演指示,而不是一份身体部位的清单。它让看的人(和AI)能“看到”动作发生之前的那个瞬间,以及动作完成之后身体的状态。这种前后延伸,才是动作从“执行指令”变成“表演”的分界线。

九、FAQ

问:动作提示词用中文写还是英文写?

主要看模型。Seedance、Kling、可灵等国产模型对中文提示词的理解已经相当好,中文写反而更自然。Sora、Runway、Pika等以英文训练为主的模型,英文提示词的控制精度更高。如果你用英文写,注意中英文名词的对应要准确——“托腮”不是“support chin”,而是“chin resting on hand”;“叉腰”是“hands on hips”不是“hands on waist”。

问:为什么我写了详细的动作描述,AI还是只动了一点点?

两个可能原因。一是动词太模糊——“移动”“改变姿势”这类词AI不知道具体要动哪里。二是动作幅度写得太小——“轻微转头”“微微抬手”在视频生成里可能被模型理解为“不需要动”。解决办法:把动作幅度量化,比如“转头约45度”“手臂从体侧抬起到水平位置”。

问:多个人物同时做不同动作,提示词怎么写?

这是目前所有模型最难处理的情况。如果必须写多主体动作,建议用“分镜”或“分区域”的方式写,不要在一句话里塞多个主体的独立动作。比如“画面左侧的男子在打电话,画面右侧的女子在看手机”,比“男子打电话的同时女子在看手机”更稳定。但即使这样,一致性仍然是挑战,建议尽量用单主体分镜头来构建叙事。

问:动作提示词里要不要写表情?

要,但不要写太多。表情是动作的“情绪注脚”,一个词就够——“专注的表情”“放松的嘴角”“眉头微皱”。写多了会抢占动作描述的权重,而且表情描述在视频生成里的稳定性远低于姿态描述。

问:为什么我写的“微笑”在视频里变成了“咧嘴”?

视频模型对“笑”的默认幅度往往偏大。解决办法是在提示词里用“嘴角轻扬”“半笑”“微笑但不露齿”来控制幅度,同时在负面约束里加“不露齿”“不夸张表情”。中文提示词里的“微笑”本身是一个幅度较大的概念,用“嘴角微微上扬”更精确。

问:动作提示词的理想长度是多少?

没有固定标准,但有一个经验值:单镜头动作提示词,动作描述部分占60%以上,风格和画质描述控制在40%以内。 如果你发现自己写了一大段风格词却只用五个字描述动作,说明动作信息密度不够。反过来,如果动作描述超过150字还没有说清楚“谁在做什么”,说明你写得太散了。

回顾整篇内容,ai动作提示词的核心逻辑其实只有一条:把人类凭直觉完成的动作,翻译成AI能识别的身体部位、方向、力度和节奏。 站姿看重心和视线,坐姿看手和脊柱,行走看触地和速度,跑步看前倾和摆臂,跳跃看落地和缓冲,打斗看因果链和重量感。

每一个动作都值得被拆成“准备—执行—收束”三个阶段来写。当你开始用这种方式思考动作时,你会发现你写的已经不只是提示词,而是一份给AI的表演指导。而AI给出的,也会从“一个在走路的3D模型”,变成“一个正在穿过街道的人”。

以上内容不代表本平台立场,仅供读者参考