文章摘要
针对AI生成人物动作常僵硬呆板如僵尸的问题,指出核心原因是用户仅笼统描述动作,未将抽象的“自然”拆解为AI可理解的具体身体部位状态,提示词本质是给模型的运动指令而非笼统描写。文章分图像、视频场景给出通用提示词公式,针对不同动作提供写法规范,还附上词库、避坑指南与FAQ,帮助用户生成自然生动的AI人物动作。

ai人物动作提示词的核心在于把“自然”翻译成AI能理解的身体部位与运动机制描述。本文从站姿、坐姿、行走、手部动作等场景出发,提供可直接使用的公式、对比表格与避坑指南,帮你在图像与视频生成中让人物真正“活”过来。

AI人物动作提示词

为什么你的ai人物动作提示词总让角色像僵尸?

核心判断

问题不在模型不够强,在于绝大多数人只告诉了AI“他在走路”,没告诉它“他怎么走”。单帧画面看着还行,一跑视频就崩:人物走路像太空漫步,转头像机器人,拿杯子的手扭成麻花,坐在椅子上的人只会眨眼。

这不是个别现象。当你输入“一个女生坐在咖啡店里”,AI得到的信息量约等于零。它不知道她坐在哪里、腿怎么放、手在做什么、视线落在何处。于是它从训练数据里抓取了一个“最平均的坐姿”给你,结果就是标准化的、毫无个性的、像被摆放在展示柜里的假人。

ai人物动作提示词的本质不是“描写”,而是“编程”。你在用自然语言给扩散模型写运动指令,每一个身体部位的状态都需要被显式声明。

一个被忽略的事实

AI不知道什么叫“自然”。它只知道“重心偏左”“脊柱有12度弧度”“左手拇指扣在口袋边缘”。你写“自然地站着”,它给你一个军训站姿;你写“重心放在右腿上,左膝微屈,脊柱保持轻微S形弧度”,它才可能给你一个像在等公交车的活人。

核心公式:ai人物动作提示词的通用结构

生图场景的六段式公式

主体 + 身体姿态 + 肢体动作细节 + 表情状态 + 场景氛围 + 画质风格

这个公式的六段各有不可省略的理由。“主体”让模型确定人物类型和基本外观。“身体姿态”是整个公式的骨架,决定重心、朝向和整体轮廓。“肢体动作细节”是最容易偷懒但也最关键的一段,它把“坐着”升级为“一只手托下巴,另一只手指尖无意识轻敲桌面”。“表情状态”给出面部肌肉的运动方向。“场景氛围”和“画质风格”负责光影和质感。

一段90分的ai人物动作提示词长这样:

年轻女生坐在咖啡店窗边,双腿轻轻交叠,一只手托着下巴,另一只手食指无意识地轻敲桌面,视线落在窗外某处,表情若有所思。暖黄自然光从窗户斜照进来,浅景深虚化背景,电影质感,4K。

视频场景的递进式公式

视频比生图多了一个时间维度。ai人物动作提示词在视频场景下需要额外交代运动的起始状态、过程节奏和结束姿态。

主体参考 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件

动作细节段需要写成连续的时间线:“从站立姿态开始,重心缓缓前移,右脚迈出约40厘米,身体随之转过15度,手臂自然摆动后落定”。每一个“然后”都在告诉模型下一帧该发生什么。

公式在两种场景下的差异

维度 图像生成 视频生成
时间维度 单帧,无需交代过程 需要时间线,交代起始—过程—结束
动作描述颗粒度 身体部位的状态 身体部位的连续运动轨迹
镜头语言 可选,影响构图 必备,决定运动方向和节奏
常见失败模式 肢体扭曲、手指崩坏 动作跳跃、速度突变、身份漂移
约束条件侧重 解剖结构约束 运动幅度约束、镜头连续性约束

视频场景下有一个容易被忽视的约束:优先选用缓慢、轻柔、连贯的细微动作,尽量规避狂奔、大跳、剧烈翻滚等高爆发姿态,因为当前视频模型在高动态场景下的身份保持能力仍然有限。

站姿:五种场景,五种重心逻辑

为什么“站着”是最容易翻车的动作

站姿看起来最简单,实际最难写好。因为人类站立时的“自然感”来自微妙的失衡——重心永远不完全均匀,脊柱永远不会笔直。ai人物动作提示词如果不交代这些微失衡,模型就会给你一个几何意义上的完美站姿,像橱窗模特。

场景对照

面试/演讲场景: 双脚与肩同宽,双手自然垂放身体两侧,重心均匀分布,肩部后展但不耸肩,下巴微抬,表情自信但不紧绷。关键点是“肩部后展”而非“挺胸”,后者容易生成夸张的体态。

日常等车/闲聊场景: 重心放在一条腿上,另一只手随意插兜,脊柱保持轻微弧度而非笔直。笔直站等于军训站,视觉上假得刺眼。

靠墙等人类: 双臂松松交叉,一只脚平踩墙面,头微低,视线看向侧方而非镜头。靠墙加视线不直视镜头,画面立刻有了故事感;如果眼睛圆睁盯着镜头,就变成了到此一游照。

站姿ai人物动作提示词对比表

场景 重心分布 手部状态 脊柱/体态 视线方向 关键修饰词
自信站姿 双脚均匀 自然垂放 肩部后展 平视前方 shoulders back
放松站姿 偏向单腿 单手插兜 轻微弧度 随意扫视 weight shifted
倚靠站姿 靠墙支撑 松垮交叉 侧向倾斜 侧方不看镜头 leaning against
双手叉腰 双脚均匀 肘部外弯 头部微侧 半笑平视 hands on hips
沉思站姿 重心后移 一手托肘 肩部微含 低头看地 hand on chin

坐姿与手部:三个必须显式声明的变量

坐姿的隐藏参数

“坐在椅子上”这五个字对AI来说几乎不构成有效指令。坐姿需要显式声明三个变量:腿的姿态(交叠、分开、一前一后)、背部的接触方式(前倾、后靠、脊柱弧度)、手部的落点(大腿、扶手、桌面、下巴)。

一个可用的坐姿提示词示例:坐在椅子上,双腿在脚踝处交叠,背部微微前倾但不含胸,右手搭在左膝上,左手托着下巴,视线微微向上偏左。每个身体部位都有明确的落点,AI的“猜测空间”被压缩到最小。

手部动作的常见陷阱

手指是扩散模型的老大难。ai人物动作提示词在手部描述上要遵循一个原则:能用手掌就不用手指,能用手腕就不用手掌,能用大臂带动就不用小臂精细控制。

具体来说,“手插兜”比“手指比心”安全得多,“手臂交叉”比“捏着杯子把手”安全得多。如果必须涉及精细手部动作,优先选用“手掌张开放在桌面上”这类大面积接触的描述。

矛盾检测清单

写ai人物动作提示词时,以下矛盾组合会导致生成结果崩坏,需要在提交前逐一排除:

嘴部不能同时处于“微笑、咬唇、吐舌”中的两个以上状态。脖子不能同时“回头看镜头”且“身体背过去”。手肘不能同时“弯曲撑桌”且“手臂伸直下垂”。膝盖不能同时“跪地”且“双脚着地”。每次写完后逐条对照,能避免大量废弃生成。

H4 行走与动态:把“运动机制”写出来

从动词到机制的转换

“走路”是动词,不是机制。“走路”需要被翻译为:前脚掌先着地还是后跟先着地,手臂摆动的幅度是15度还是45度,身体是否有上下起伏,头发和衣摆是否因为移动而产生拖拽感。

一段有效的行走提示词:人物以正常步速向前行走,右腿迈出时左臂同步前摆约30度,脚掌后跟着地过渡到前掌,肩膀保持水平,头发因走动产生轻微后飘,衣摆边缘有细微摆动。

视频场景的动作时间线写法

视频场景下的ai人物动作提示词需要交代完整的时间结构:准备、发力、接触、反作用、落定。以“拿起桌上的杯子”为例:手臂从自然下垂位置开始抬起,前臂向桌面方向伸出,手掌张开接触杯壁,手指合拢包裹,前臂回收将杯子带离桌面,手臂回到胸前位置停稳。

这个写法比“拿起杯子”长了十几倍,但生成成功率也高了十几倍。

动态动作的强度分级

强度 代表动作 提示词写法要点 视频场景风险
微动 眨眼、呼吸起伏、手指轻敲 只描述一个部位的运动 低风险,最稳定
缓动 转头、抬手、微笑展开 加入运动方向和时间修饰 低风险
中动 行走、坐下、站起 需要重心转移描述 中风险,注意脚部接触
强动 跳跃、奔跑、转身 需要起止姿态加运动弧线 高风险,身份易漂移
剧烈 翻滚、打斗、摔倒 需要分阶段拆解 极高风险,建议分段生成

英文动作词库:中英对照与使用逻辑

基础姿态词

站立→Standing,走路→Walking,跑步→Running,跳跃→Jumping,跪地→Kneeling,蹲下→Squatting,躺下→Lying down,侧卧→on side,趴着→on stomach。

手部与上肢动作

手插兜→Hand in Pocket,双手叉腰→Hands on Hips,单手叉腰→Hand on Hip,双臂交叉→Crossed Arms,双臂高举→Arms Up,张开双臂→Spread Arms,招手→Waving,手放脸上→Hand on Own Face,双手拨头发→Hands in Hair,头发翻转→Hair Flip,裙摆翻转→Skirt Flip。

视线与头部动作

看向镜头→looking at viewer,仰视→looking up,斜视→looking away,回头看→looking back / Looking Back Over Shoulder,低头看地→looking down。

英文使用的三个原则

英文动作词在图像模型中通常比中文更精准,因为主流模型的训练语料以英文为主。但在视频场景下,中文视频模型对中文动作描述的解析能力在快速提升,火山引擎的Seedance系列和阿里云的万相系列都对中文语义做了针对性优化。建议图像生成优先用英文动作词,视频生成根据所用模型选择语言。

英文动作词后可以加程度副词来调节运动强度:slowly、gently、rapidly、firmly。这些副词在视频场景下对运动速度的控制效果远强于在图像场景下。

特殊场景与进阶技法

情绪动作:从“开心”到肌肉运动

“开心地笑”在ai人物动作提示词里约等于无效描述。有效的写法需要拆解到肌肉层面:嘴角向两侧拉开约45度,颧骨肌肉上提形成眼部下方的轻微褶皱,眉心舒展,下巴微微后收。

AI演员表情导演系统的核心逻辑正是如此:建立“肌肉动作到视觉结果”的映射库,把情绪翻译为面颊、眉心、眼睑、嘴角的具体运动状态。

连续动作的多帧一致性

当需要同一个人物在多个画面中保持动作一致性时,提示词需要锁定两个东西:人物的不可变特征(发型、服装、体型、面部特征)和动作的运动方向标记(“从左到右”“从正面转向侧面”)。前者确保身份不漂移,后者确保动作序列在时间上可衔接。

负向提示词的动作排除

以下负向提示词对动作质量的提升效果最明显:twisted limbs(肢体扭曲)、extra fingers(多余手指)、fused fingers(手指粘连)、malformed hands(手部畸形)、unnatural pose(不自然姿态)、stiff posture(僵硬体态)。

权重调节的实战用法

在ai人物动作提示词中,用括号加权可以精确控制某个动作特征的强度。关键动作词建议加权1.2到1.5之间,例如 (dynamic pose:1.3) 比裸写 dynamic pose 的效果显著提升。但权重不要超过1.5,过高的权重会导致画面崩坏或出现不自然的过度渲染。

动作与场景的匹配逻辑

同一个动作在不同场景下需要不同的修饰。比如“坐着”在图书馆场景下是“身体前倾,手肘撑桌,头微微低向书本”,在酒吧场景下是“身体后靠,一条腿搭在另一条腿上,手搭在沙发靠背边缘”。ai人物动作提示词必须把动作放在场景的物理约束中描述,孤立地写动作等于放弃了场景对动作的塑形作用。

FAQ

ai人物动作提示词写多长才够用?

图像场景建议60到120个词,视频场景建议120到250个词。超过250词后,模型对后半段描述的注意力会明显下降,关键信息应放在前三分之一。

为什么我写了“自然地站着”,生成结果还是很僵硬?

“自然”是AI无法解析的抽象词。把“自然”替换为具体的身体状态:重心偏向一侧、脊柱有弧度、一只手做某个具体动作、视线落在某个具体方向。

视频里人物走路像滑步怎么办?

需要补充脚部接触地面的描写:“脚掌后跟着地后过渡到前掌,另一只脚同时抬起离开地面”。同时加上镜头跟拍描述,让模型知道运动方向和速度感。

手部动作总是崩坏,有解吗?

优先改用大臂或手腕动作替代手指精细动作。必须涉及手指时,写“手掌张开”比写“手指捏住”安全得多。负向提示词中加入“fused fingers, extra fingers, malformed hands”也有帮助。

同一个动作词在不同模型上效果差很多,怎么回事?

不同模型的训练语料和文本编码器不同。Midjourney对英文动词的敏感度较高,Stable Diffusion对标签化短词的反应更直接,视频模型对中文连续叙述的理解能力在快速提升。建议先确定所用模型,再根据该模型的特点调整提示词的语言和结构。

怎样让动作看起来有“电影感”?

在动作描述之后追加镜头语言。比如“人物从画面左侧向右侧行走,镜头以相同速度横向跟拍,浅景深虚化背景,24fps胶片颗粒质感”。镜头运动与人物运动的配合是电影感的主要来源,单独写人物动作永远出不来这个效果。

以上内容不代表本平台立场,仅供读者参考