文章摘要
本文围绕豆包Seedance系列AI视频生成的提示词撰写展开,指出合格提示词核心是输出精准可执行的机器指令而非模糊文案,分享了分任务的基础公式、八要素进阶公式等撰写策略,梳理了常见误区,对比了不同模型的提示词偏好,解答了相关常见问题,帮助用户生成符合预期的高质量AI视频。

豆包制作视频提示词的核心不在“写得漂亮”,而在“写得准确”。一条合格的豆包制作视频提示词需要同时回答四个问题:谁、在哪、怎么动、怎么拍。本文用八个要素、三套公式和一份对比表,帮你把模糊想法翻译成模型能精确执行的工程指令,让每次生成都有可预期的结果。

豆包制作视频提示词

一、为什么你的豆包视频提示词总是不够用

大多数人写豆包制作视频提示词的方式是这样的:想一下画面里有什么,用两句话描述出来,点生成,然后祈祷。

结果通常是画面能动但很“平”,人物动作僵硬,镜头纹丝不动像动态PPT。问题不在模型能力,而在指令的精度。

Seedance 2.0 系列本质上是一个“全模态 AI 导演”,它在内部把提示词拆成“空间层”(画面里有什么)和“时间层”(事情如何随时间变化)两个维度来理解。如果你只描述了“空间层”——一个人站在雨中——却没有给“时间层”任何指令,模型就不知道这个人是慢慢转身、快步跑开,还是站在原地不动。

这意味着,豆包制作视频提示词的底层逻辑不是“写文案”,而是“写指令”。文案是给人看的,指令是给机器执行的。两者之间的差距,就是普通视频和电影感视频的差距。

一句话说清楚区别

文案式写法:“一个女孩在咖啡馆看书,氛围很温暖。”

指令式写法:“年轻女性侧坐窗边高脚凳,左手翻书页,右手握陶瓷杯,阳光从左前方45度射入,暖色调,镜头从书架后缓慢横移露出人物,浅景深,35mm胶片质感。”

前者让模型猜,后者让模型执行。


二、豆包视频提示词的基础公式:先选对任务类型

在动笔之前,需要先判断一件事:你要做的是哪种生成任务。Seedance 2.0 支持文本、图片、视频、音频四种输入方式,不同任务类型的提示词句式完全不同。

2.1 任务分类速查

任务类型 你手头有什么 典型场景 提示词核心动作
文生视频 只有文字想法 概念演示、分镜预演 完整描述画面与运动
图生视频 有一张参考图 产品展示、人像动起来 描述“图里什么在动、怎么动”
多模态参考 图/视频/音频组合 动作迁移、风格借鉴 指明“参考什么、生成什么”
编辑视频 有一段已生成的视频 局部替换、属性修改 指定“改哪里、改成什么”
延长视频 有一段视频需要续写 剧情延展、动作补全 描述“接下来发生什么”

多模态参考的推荐句式需要明确区分参考类型:参考图片中的主体,生成新场景;参考视频中的动作或运镜,迁移到新主体上;参考音频中的音色,用于配音生成。

编辑类任务有一个容易踩的坑:直接用“<视频N>”指代要编辑的视频,不要写“参考<视频N>”,否则模型会把它误判为参考任务,生成一个全新的视频而不是在原视频上修改。

2.2 基础公式的三种写法

如果你只想快速上手,记住这三种句式就够了:

全模态参考:参考<图片1>中的<主体>,生成<场景描述>。例如:“参考图1中的人物面部特征,生成他在雨中撑伞行走的5秒视频。”

编辑视频:严格编辑<视频1>,将其中的<原特征>修改为<新特征>。例如:“严格编辑视频1,将背景从办公室替换为深夜便利店,人物和动作保持不变。”

延长视频:向后延长<视频1>,生成<新动作/场景描述>。例如:“向后延长视频1,人物走出画面后镜头缓慢拉远,露出整条街道的夜景。”

这三种句式的共同逻辑是:先锁定输入素材的角色,再说明你要模型做什么。不要在一条提示词里同时做“参考”和“编辑”两件事,除非你明确使用组合句式的写法。


三、八要素进阶公式:把提示词变成“工程指令”

基础公式解决了“做什么”的问题,进阶公式解决“做得好不好”的问题。

官方推荐的进阶公式是:精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件。

这八个要素的顺序不是随意的。它对应的是人类导演在片场的思维顺序:先确定演员和动作,再确定环境和光线,最后决定机位和后期风格。豆包制作视频提示词遵循同样的逻辑,模型的理解也会更稳定。

3.1 精准主体:不说“一个人”,说“谁”

“一个人”对模型来说几乎等于零信息。主体描述的精度直接决定画面的一致性——如果主体描述模糊,模型在每一帧里都可能“换人”。

主体定义的三个层级:

第一层是身份锚定:“穿藏青中山装的45岁男性”。第二层是外观细节:“短发,左眉有疤痕,手持金属质感钢笔”。第三层是材质与质感:“羊毛混纺面料,哑光表面,领口微微磨损”。

主体不一定是人。可以是产品、动物、场景、甚至某种抽象概念的可视化。关键是让模型能在“空间层”里唯一确定一个对象。

3.2 动作细节:禁用模糊动词

“在动”是最差的动作描述。“缓慢抬头,鼻尖微抬,左前爪离地约1厘米,颈部肌肉轻微绷紧”——这是有效的动作描述。

动作描述的两个原则:速度可感知(缓慢/匀速/猛然/颤抖着)和幅度可度量(抬手不过肩/转身90度/后退半步)。如果一条动作描述没有速度或幅度信息,模型就会用默认值“填坑”,而默认值通常是最平庸的版本。

3.3 场景环境:用物理参数替代主观感受

“很亮的房间”不如“正午北向窗光,色温5500K,照度300lux,木地板反光率18%”。

当然不需要每次都写得这么极端,但方向是对的:场景描述需要包含空间纵深信息。前景有什么、中景是什么、背景延伸到哪里。模型对“三维感”的理解依赖于层次描述,只说“一个房间”会得到一个扁平的背景板。

3.4 光影色调:决定“质感”的隐形开关

光影是视频提示词里最容易被忽略、但对最终质感影响最大的要素之一。

一个实用的光影描述框架:光源方向 + 色温倾向 + 对比度风格。例如“左侧窗光,暖色调,柔和阴影”或“顶光,冷蓝调,高对比,硬阴影”。

豆包在人物表情和肢体动作上表现较好,但在自然光场景的层次感上仍有提升空间。因此,在提示词中明确光影方向,能部分弥补模型在自然光渲染上的不足。

3.5 镜头运镜:从“动态PPT”到“电影感”的分水岭

这是整个八要素中权重最高的一项。没有运镜描述的提示词,生成结果大概率是固定机位的“会动的照片”。

运镜描述需要覆盖三个维度:景别(特写/中景/全景)、运动方式(推/拉/摇/移/跟/环绕)、速度节奏(缓慢/匀速/加速/手持晃动)。

一个可直接套用的组合写法:“中景,缓慢推轨,镜头从人物背后向面部推进,速度均匀无抖动”。如果想让画面更有张力,可以叠加运镜:“先环绕后推进”或“从极特写拉远至全景”。

3.6 视觉风格:给模型一个“参考坐标系”

“电影感”是一个太宽泛的词。它可能指王家卫的霓虹迷离,也可能指诺兰的冷峻写实,也可能指韦斯·安德森的对称构图。

有效的风格描述需要一个具体的参照物或明确的技术标签。“35mm胶片质感,轻微颗粒,柯达Portra 400色彩倾向”比“电影感”有效得多。“日系清新”比“好看”有效得多。

3.7 画质与约束条件:把结果“收紧”

画质词不是越多越好。堆砌“4K、超清、高清、极致细节”反而可能被模型降权处理。

有效的方式是用正面锚定 + 括号权重。例如:“(人物面部清晰:1.3) + (背景轻微虚化:1.2) + (无运动模糊:1.1)”。权重的写法在不同版本中可能有差异,但原则是一致的:告诉模型什么重要,而不是什么不好。

约束条件包括:禁止变化的元素(“人物服装颜色保持不变”)、技术指标(“输出24fps”)、画面稳定性要求(“无闪烁卡顿”)。

3.8 八要素组合示范

主题:咖啡店产品展示

年轻女性咖啡师,深棕色围裙,白色衬衫卷至肘部,左手持拉花缸,右手稳定咖啡杯把手,动作匀速缓慢。精品咖啡店内吧台场景,前景有半杯拿铁作为虚化遮挡,中景为操作台,背景延伸至木质货架和暖色吊灯。暖色调侧光从右侧射入,色温3200K,柔和阴影。中景,微距跟拍,镜头从杯口特写缓慢拉远至中景,速度均匀。日系纪实风格,35mm胶片质感。画面稳定无抖动,24fps。

这条提示词覆盖了全部八个要素,每个要素都有可执行的具体信息,模型不需要“猜”任何东西。


四、运镜专项:豆包视频提示词的“隐藏杠杆”

运镜是豆包制作视频提示词中投入产出比最高的一个要素。同样一段画面描述,加不加运镜指令,成片质量差距可能是“手机随手拍”和“电影预告片”的距离。

4.1 万能运镜公式

对于不想记忆复杂术语的使用者,可以直接套用这个公式:

[主体描述] + [环境氛围] + [光影风格] + [运镜指令] + [画面质感] + [稳定约束]

以赛车场景为例:

  • 主体描述:红色未来概念跑车,流线型车身,极速飞驰,漂移过弯
  • 环境氛围:赛博朋克城市雨夜,霓虹灯牌闪烁,地面湿润反光
  • 光影风格:蓝紫撞色霓虹光,强烈明暗对比
  • 运镜指令:FPV drone shot,Fast tracking shot,Dive down
  • 画面质感:电影感,高细节
  • 稳定约束:Fluid motion,no flickering

这套组合生成的视频会具有明确的空间运动轨迹和视觉张力,而不是一个“车在动”的静态场景。

4.2 运镜指令的层级化选择

运镜类型 效果 适用场景 指令示例
固定 稳定、聚焦 产品特写、对话 “固定机位,聚焦面部”
推轨 聚焦、压迫感 情绪递进、细节揭示 “缓慢推进至眼部特写”
拉远 揭示、空间感 场景展开、结尾 “从面部拉远至全景”
环绕 张力、立体感 打斗、舞蹈、产品 “180度环绕主体”
跟随 沉浸、动感 行走、奔跑、驾驶 “低角度跟随脚步”
手持 真实、不安 纪实、紧张场景 “手持轻微晃动”
希区柯克变焦 眩晕、冲击 转折、揭示 “推进同时拉焦”

运镜指令不需要写得很长,但必须明确“从哪到哪”和“快还是慢”。两个信息缺一个,模型就会用默认值替代。

4.3 多镜头提示词的写法

当一条视频需要包含多个镜头时,提示词的结构需要从“一段话”变成“分镜表”。

推荐格式:每个镜头一行,包含镜号 + 景别 + 运镜 + 时长 + 内容。

示例:

镜头1 | 特写 | 固定 | 1.5s | 咖啡液从滤纸滴入玻璃杯,慢速旋转
镜头2 | 中景 | 缓慢推轨 | 2s | 咖啡师双手拿起杯子,转身面向镜头
镜头3 | 全景 | 拉远 | 1.5s | 咖啡店全貌,人物坐在窗边,暖色灯光

豆包 Seedance 2.5 支持单段30秒直出和时间戳控制。在提示词中使用时间戳(如“0-5秒:… 5-12秒:…”)可以让模型更精确地分配时长和节奏。


五、多模态参考的提示词策略

当你有参考素材时,提示词的写法需要从“描述一切”转变为“分配角色”。

5.1 素材角色的分配原则

Seedance 2.5 支持最多50个多模态参考素材。素材越多,越需要明确每个素材“负责什么”,否则模型会混淆。

一条清晰的多模态提示词应该包含:

  • 主体参考:哪张图提供人物/物体的外观
  • 动作参考:哪个视频提供运动轨迹或节奏
  • 风格参考:哪张图提供色调和视觉风格
  • 音频参考:哪段音频提供音色或配乐

例如:“参考图1中人物的面部和服装,参考视频2中的走路姿态和运镜方式,参考图3的暖色调胶片风格,生成人物在黄昏街道行走的8秒视频。”

如果不说清楚哪个素材对应哪个维度,模型可能会用图3的人脸配上图1的色调,结果就不是你想要的。

5.2 参考图预处理:比“高清”更重要的是“可控”

上传参考图时,高分辨率不一定带来更好的结果。手机随手拍的高清照片可能包含模糊的背景、杂乱的元素、不准确的边缘,模型会优先还原这些“噪声”,而不是你的文字指令。

实操建议:将参考图裁切至主体占画面70%以上,对主体区域做适度锐化,导出为PNG格式。这样处理后的参考图能让模型更准确地识别主体边界。


六、常见误区:为什么提示词写得“对”了,结果还是不对

6.1 语义歧义:模型不是你肚子里的蛔虫

“复古风格”是一个典型的歧义词。它可能指80年代胶片感、50年代美式广告、70年代苏联海报风格。如果你不限定年代和具体视觉特征,模型会选择它训练数据中最常见的那个“复古”。

“轻快音乐”没有指定BPM、乐器和情绪强度,模型也无法准确执行。

修复方法:把模糊修饰语替换为可验证的具体描述。“复古风格”改为“1980年代柯达胶片,暖黄色调,轻微褪色感”。“轻快音乐”改为“钢琴+轻打击乐,BPM 120,大调”。

6.2 负面词堆砌:越说“不要”越容易得到

“不要糊、不要歪、不要丑”——这类负面指令在大多数生成模型中会被降权甚至忽略。模型不擅长“否定理解”,你说“不要糊”,它看到的是“糊”这个概念的激活。

修复方法:把负面表述翻译成正面锚定。“不要糊”改为“清晰锐利的边缘,无运动模糊”。“不要歪”改为“水平构图,主体居中”。

6.3 把剧本当提示词:信息过载反而降低质量

把一段完整的剧本、对白、场景说明全部塞进提示词,模型不仅不会“理解得更好”,反而可能因为信息过载而丢失关键指令。

修复方法:一条提示词只服务一个镜头或一个连续动作段。剧本是给人看的分镜依据,提示词是给模型的执行指令,两者需要分开。

6.4 忽略“不变”的声明

当你在编辑已有视频时,如果不明确说“什么保持不变”,模型可能会“顺便”改掉你没提到的元素。

修复方法:在编辑类提示词中,明确声明“人物服装、面部特征、背景布局保持不变,仅替换XX”。


七、豆包与可灵:提示词策略的差异

理解不同模型对提示词的“偏好”,可以帮助你在豆包上更有针对性地写提示词。

维度 豆包 Seedance 2.0/2.5 可灵 Kling 2.0/3.0 对提示词的启示
人像表现 表情和手势更自然 偶尔动作僵硬 豆包适合人物日常场景,提示词可侧重动作细节
自然风光 色彩偏素,层次稍平 光影层次丰富 豆包需在提示词中加强光影方向描述
快速运动 运动连贯性好 偶尔拖影 豆包适合跑动、舞蹈类提示词
科幻场景 想象力不错 质感更震撼 豆包需更具体的材质和光影描述来补质感
生成速度 3-8分钟(5秒视频) 5-15分钟 豆包适合快速迭代,提示词可以更“敢写”
多镜头处理 指令遵循较好 多镜头一致性稍弱 豆包可用分镜式提示词做多镜头叙事

豆包的优势在于人像动作的自然度和生成速度,这意味着在写提示词时,可以把更多精力放在动作细节和运镜节奏上,而不是反复“抽卡”修正面部扭曲。


八、FAQ:关于豆包制作视频提示词的常见疑问

Q1:豆包制作视频提示词写多长比较合适?

没有固定字数限制,但有信息密度的下限。一条有效的提示词通常需要覆盖八要素中的至少五到六个。如果只写了“主体+动作”,生成结果大概率是“能看但不出彩”。建议起步长度在80-150字(中文),确保每个要素都有具体信息。

Q2:Seedance 2.0 和 2.5 的提示词写法有区别吗?

核心公式一致,但2.5在几个方面放宽了限制。2.5支持单段30秒直出,提示词中可以加入时间戳来分配节奏。2.5的参考素材上限从2.0的较低数量提升到50个,多模态提示词可以更复杂。如果你用的是2.0,建议把长视频拆成多条提示词分别生成再拼接。

Q3:为什么加了运镜指令后画面反而更乱了?

通常是运镜描述本身有冲突。“环绕推进”这种组合运镜在短时间内可能超出模型的理解能力。建议单条提示词只使用一种主运镜,组合运镜留给更有经验的场景。另一个常见原因是运镜速度没有指定,模型用了默认的快速运动导致画面模糊。

Q4:上传了参考图,但生成的人物和参考图不像,怎么办?

先检查参考图的预处理。手机原图的背景噪声会干扰主体识别。另外,提示词中需要明确“参考图N中的主体外观”,而不是笼统地说“参考图N”。如果同时提供了多张参考图,每一张都要指定它负责的维度(主体/风格/动作)。

Q5:编辑视频时模型总是改到我没想到的地方,怎么防止?

在编辑类提示词中,养成一个习惯:明确列出“保持不变”的元素。句式模板是:“严格编辑视频N,将[具体元素]修改为[新特征]。以下元素保持不变:[元素A]、[元素B]、[元素C]。” 声明得越具体,模型的“擅自修改”就越少。

Q6:中文提示词和英文提示词,哪个在豆包上效果更好?

豆包对中文的理解是原生级的,Seedance 2.5 原生支持10余种语言。纯中文提示词完全可以达到英文提示词的效果。但在运镜和画质类术语上,英文专业词汇(如 “FPV drone shot”“slow motion”“shallow depth of field”)有时比中文对应词更精确,因为模型训练数据中这些术语的英文标注密度更高。一个实用的做法是:画面描述用中文,运镜和技术术语用英文。

Q7:生成结果的人物在视频中途“变脸”了,提示词能解决吗?

这是长视频生成中的一致性问题。Seedance 2.5 在30秒内的主体一致性有显著提升,但如果你用2.0生成长视频,建议把视频拆成多个5-10秒的片段分别生成,每个片段的主体描述保持完全一致(甚至可以复制粘贴同一段主体描述)。另外,使用参考图锁定主体外观是防止“变脸”最有效的手段。

Q8:有没有“万能提示词模板”可以直接套用?

有一个可迁移的框架,但内容需要根据场景替换。框架如下:

[主体:身份+外观+材质] + [动作:速度+幅度+方向] + [场景:前景+中景+背景+空间纵深] + [光影:光源方向+色温+对比度] + [运镜:景别+运动方式+速度] + [风格:参照物+技术标签] + [画质锚定] + [约束声明]

把这个框架填满,就是一条合格以上水平的豆包制作视频提示词。

以上内容不代表本平台立场,仅供读者参考