豆包制作视频提示词:从一句话到电影级的提示词实战手册

豆包制作视频提示词的核心不在“写得漂亮”,而在“写得准确”。一条合格的豆包制作视频提示词需要同时回答四个问题:谁、在哪、怎么动、怎么拍。本文用八个要素、三套公式和一份对比表,帮你把模糊想法翻译成模型能精确执行的工程指令,让每次生成都有可预期的结果。

一、为什么你的豆包视频提示词总是不够用
大多数人写豆包制作视频提示词的方式是这样的:想一下画面里有什么,用两句话描述出来,点生成,然后祈祷。
结果通常是画面能动但很“平”,人物动作僵硬,镜头纹丝不动像动态PPT。问题不在模型能力,而在指令的精度。
Seedance 2.0 系列本质上是一个“全模态 AI 导演”,它在内部把提示词拆成“空间层”(画面里有什么)和“时间层”(事情如何随时间变化)两个维度来理解。如果你只描述了“空间层”——一个人站在雨中——却没有给“时间层”任何指令,模型就不知道这个人是慢慢转身、快步跑开,还是站在原地不动。
这意味着,豆包制作视频提示词的底层逻辑不是“写文案”,而是“写指令”。文案是给人看的,指令是给机器执行的。两者之间的差距,就是普通视频和电影感视频的差距。
一句话说清楚区别
文案式写法:“一个女孩在咖啡馆看书,氛围很温暖。”
指令式写法:“年轻女性侧坐窗边高脚凳,左手翻书页,右手握陶瓷杯,阳光从左前方45度射入,暖色调,镜头从书架后缓慢横移露出人物,浅景深,35mm胶片质感。”
前者让模型猜,后者让模型执行。
二、豆包视频提示词的基础公式:先选对任务类型
在动笔之前,需要先判断一件事:你要做的是哪种生成任务。Seedance 2.0 支持文本、图片、视频、音频四种输入方式,不同任务类型的提示词句式完全不同。
2.1 任务分类速查
| 任务类型 | 你手头有什么 | 典型场景 | 提示词核心动作 |
|---|---|---|---|
| 文生视频 | 只有文字想法 | 概念演示、分镜预演 | 完整描述画面与运动 |
| 图生视频 | 有一张参考图 | 产品展示、人像动起来 | 描述“图里什么在动、怎么动” |
| 多模态参考 | 图/视频/音频组合 | 动作迁移、风格借鉴 | 指明“参考什么、生成什么” |
| 编辑视频 | 有一段已生成的视频 | 局部替换、属性修改 | 指定“改哪里、改成什么” |
| 延长视频 | 有一段视频需要续写 | 剧情延展、动作补全 | 描述“接下来发生什么” |
多模态参考的推荐句式需要明确区分参考类型:参考图片中的主体,生成新场景;参考视频中的动作或运镜,迁移到新主体上;参考音频中的音色,用于配音生成。
编辑类任务有一个容易踩的坑:直接用“<视频N>”指代要编辑的视频,不要写“参考<视频N>”,否则模型会把它误判为参考任务,生成一个全新的视频而不是在原视频上修改。
2.2 基础公式的三种写法
如果你只想快速上手,记住这三种句式就够了:
全模态参考:参考<图片1>中的<主体>,生成<场景描述>。例如:“参考图1中的人物面部特征,生成他在雨中撑伞行走的5秒视频。”
编辑视频:严格编辑<视频1>,将其中的<原特征>修改为<新特征>。例如:“严格编辑视频1,将背景从办公室替换为深夜便利店,人物和动作保持不变。”
延长视频:向后延长<视频1>,生成<新动作/场景描述>。例如:“向后延长视频1,人物走出画面后镜头缓慢拉远,露出整条街道的夜景。”
这三种句式的共同逻辑是:先锁定输入素材的角色,再说明你要模型做什么。不要在一条提示词里同时做“参考”和“编辑”两件事,除非你明确使用组合句式的写法。
三、八要素进阶公式:把提示词变成“工程指令”
基础公式解决了“做什么”的问题,进阶公式解决“做得好不好”的问题。
官方推荐的进阶公式是:精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件。
这八个要素的顺序不是随意的。它对应的是人类导演在片场的思维顺序:先确定演员和动作,再确定环境和光线,最后决定机位和后期风格。豆包制作视频提示词遵循同样的逻辑,模型的理解也会更稳定。
3.1 精准主体:不说“一个人”,说“谁”
“一个人”对模型来说几乎等于零信息。主体描述的精度直接决定画面的一致性——如果主体描述模糊,模型在每一帧里都可能“换人”。
主体定义的三个层级:
第一层是身份锚定:“穿藏青中山装的45岁男性”。第二层是外观细节:“短发,左眉有疤痕,手持金属质感钢笔”。第三层是材质与质感:“羊毛混纺面料,哑光表面,领口微微磨损”。
主体不一定是人。可以是产品、动物、场景、甚至某种抽象概念的可视化。关键是让模型能在“空间层”里唯一确定一个对象。
3.2 动作细节:禁用模糊动词
“在动”是最差的动作描述。“缓慢抬头,鼻尖微抬,左前爪离地约1厘米,颈部肌肉轻微绷紧”——这是有效的动作描述。
动作描述的两个原则:速度可感知(缓慢/匀速/猛然/颤抖着)和幅度可度量(抬手不过肩/转身90度/后退半步)。如果一条动作描述没有速度或幅度信息,模型就会用默认值“填坑”,而默认值通常是最平庸的版本。
3.3 场景环境:用物理参数替代主观感受
“很亮的房间”不如“正午北向窗光,色温5500K,照度300lux,木地板反光率18%”。
当然不需要每次都写得这么极端,但方向是对的:场景描述需要包含空间纵深信息。前景有什么、中景是什么、背景延伸到哪里。模型对“三维感”的理解依赖于层次描述,只说“一个房间”会得到一个扁平的背景板。
3.4 光影色调:决定“质感”的隐形开关
光影是视频提示词里最容易被忽略、但对最终质感影响最大的要素之一。
一个实用的光影描述框架:光源方向 + 色温倾向 + 对比度风格。例如“左侧窗光,暖色调,柔和阴影”或“顶光,冷蓝调,高对比,硬阴影”。
豆包在人物表情和肢体动作上表现较好,但在自然光场景的层次感上仍有提升空间。因此,在提示词中明确光影方向,能部分弥补模型在自然光渲染上的不足。
3.5 镜头运镜:从“动态PPT”到“电影感”的分水岭
这是整个八要素中权重最高的一项。没有运镜描述的提示词,生成结果大概率是固定机位的“会动的照片”。
运镜描述需要覆盖三个维度:景别(特写/中景/全景)、运动方式(推/拉/摇/移/跟/环绕)、速度节奏(缓慢/匀速/加速/手持晃动)。
一个可直接套用的组合写法:“中景,缓慢推轨,镜头从人物背后向面部推进,速度均匀无抖动”。如果想让画面更有张力,可以叠加运镜:“先环绕后推进”或“从极特写拉远至全景”。
3.6 视觉风格:给模型一个“参考坐标系”
“电影感”是一个太宽泛的词。它可能指王家卫的霓虹迷离,也可能指诺兰的冷峻写实,也可能指韦斯·安德森的对称构图。
有效的风格描述需要一个具体的参照物或明确的技术标签。“35mm胶片质感,轻微颗粒,柯达Portra 400色彩倾向”比“电影感”有效得多。“日系清新”比“好看”有效得多。
3.7 画质与约束条件:把结果“收紧”
画质词不是越多越好。堆砌“4K、超清、高清、极致细节”反而可能被模型降权处理。
有效的方式是用正面锚定 + 括号权重。例如:“(人物面部清晰:1.3) + (背景轻微虚化:1.2) + (无运动模糊:1.1)”。权重的写法在不同版本中可能有差异,但原则是一致的:告诉模型什么重要,而不是什么不好。
约束条件包括:禁止变化的元素(“人物服装颜色保持不变”)、技术指标(“输出24fps”)、画面稳定性要求(“无闪烁卡顿”)。
3.8 八要素组合示范
主题:咖啡店产品展示
年轻女性咖啡师,深棕色围裙,白色衬衫卷至肘部,左手持拉花缸,右手稳定咖啡杯把手,动作匀速缓慢。精品咖啡店内吧台场景,前景有半杯拿铁作为虚化遮挡,中景为操作台,背景延伸至木质货架和暖色吊灯。暖色调侧光从右侧射入,色温3200K,柔和阴影。中景,微距跟拍,镜头从杯口特写缓慢拉远至中景,速度均匀。日系纪实风格,35mm胶片质感。画面稳定无抖动,24fps。
这条提示词覆盖了全部八个要素,每个要素都有可执行的具体信息,模型不需要“猜”任何东西。
四、运镜专项:豆包视频提示词的“隐藏杠杆”
运镜是豆包制作视频提示词中投入产出比最高的一个要素。同样一段画面描述,加不加运镜指令,成片质量差距可能是“手机随手拍”和“电影预告片”的距离。
4.1 万能运镜公式
对于不想记忆复杂术语的使用者,可以直接套用这个公式:
[主体描述] + [环境氛围] + [光影风格] + [运镜指令] + [画面质感] + [稳定约束]
以赛车场景为例:
- 主体描述:红色未来概念跑车,流线型车身,极速飞驰,漂移过弯
- 环境氛围:赛博朋克城市雨夜,霓虹灯牌闪烁,地面湿润反光
- 光影风格:蓝紫撞色霓虹光,强烈明暗对比
- 运镜指令:FPV drone shot,Fast tracking shot,Dive down
- 画面质感:电影感,高细节
- 稳定约束:Fluid motion,no flickering
这套组合生成的视频会具有明确的空间运动轨迹和视觉张力,而不是一个“车在动”的静态场景。
4.2 运镜指令的层级化选择
| 运镜类型 | 效果 | 适用场景 | 指令示例 |
|---|---|---|---|
| 固定 | 稳定、聚焦 | 产品特写、对话 | “固定机位,聚焦面部” |
| 推轨 | 聚焦、压迫感 | 情绪递进、细节揭示 | “缓慢推进至眼部特写” |
| 拉远 | 揭示、空间感 | 场景展开、结尾 | “从面部拉远至全景” |
| 环绕 | 张力、立体感 | 打斗、舞蹈、产品 | “180度环绕主体” |
| 跟随 | 沉浸、动感 | 行走、奔跑、驾驶 | “低角度跟随脚步” |
| 手持 | 真实、不安 | 纪实、紧张场景 | “手持轻微晃动” |
| 希区柯克变焦 | 眩晕、冲击 | 转折、揭示 | “推进同时拉焦” |
运镜指令不需要写得很长,但必须明确“从哪到哪”和“快还是慢”。两个信息缺一个,模型就会用默认值替代。
4.3 多镜头提示词的写法
当一条视频需要包含多个镜头时,提示词的结构需要从“一段话”变成“分镜表”。
推荐格式:每个镜头一行,包含镜号 + 景别 + 运镜 + 时长 + 内容。
示例:
镜头1 | 特写 | 固定 | 1.5s | 咖啡液从滤纸滴入玻璃杯,慢速旋转
镜头2 | 中景 | 缓慢推轨 | 2s | 咖啡师双手拿起杯子,转身面向镜头
镜头3 | 全景 | 拉远 | 1.5s | 咖啡店全貌,人物坐在窗边,暖色灯光
豆包 Seedance 2.5 支持单段30秒直出和时间戳控制。在提示词中使用时间戳(如“0-5秒:… 5-12秒:…”)可以让模型更精确地分配时长和节奏。
五、多模态参考的提示词策略
当你有参考素材时,提示词的写法需要从“描述一切”转变为“分配角色”。
5.1 素材角色的分配原则
Seedance 2.5 支持最多50个多模态参考素材。素材越多,越需要明确每个素材“负责什么”,否则模型会混淆。
一条清晰的多模态提示词应该包含:
- 主体参考:哪张图提供人物/物体的外观
- 动作参考:哪个视频提供运动轨迹或节奏
- 风格参考:哪张图提供色调和视觉风格
- 音频参考:哪段音频提供音色或配乐
例如:“参考图1中人物的面部和服装,参考视频2中的走路姿态和运镜方式,参考图3的暖色调胶片风格,生成人物在黄昏街道行走的8秒视频。”
如果不说清楚哪个素材对应哪个维度,模型可能会用图3的人脸配上图1的色调,结果就不是你想要的。
5.2 参考图预处理:比“高清”更重要的是“可控”
上传参考图时,高分辨率不一定带来更好的结果。手机随手拍的高清照片可能包含模糊的背景、杂乱的元素、不准确的边缘,模型会优先还原这些“噪声”,而不是你的文字指令。
实操建议:将参考图裁切至主体占画面70%以上,对主体区域做适度锐化,导出为PNG格式。这样处理后的参考图能让模型更准确地识别主体边界。
六、常见误区:为什么提示词写得“对”了,结果还是不对
6.1 语义歧义:模型不是你肚子里的蛔虫
“复古风格”是一个典型的歧义词。它可能指80年代胶片感、50年代美式广告、70年代苏联海报风格。如果你不限定年代和具体视觉特征,模型会选择它训练数据中最常见的那个“复古”。
“轻快音乐”没有指定BPM、乐器和情绪强度,模型也无法准确执行。
修复方法:把模糊修饰语替换为可验证的具体描述。“复古风格”改为“1980年代柯达胶片,暖黄色调,轻微褪色感”。“轻快音乐”改为“钢琴+轻打击乐,BPM 120,大调”。
6.2 负面词堆砌:越说“不要”越容易得到
“不要糊、不要歪、不要丑”——这类负面指令在大多数生成模型中会被降权甚至忽略。模型不擅长“否定理解”,你说“不要糊”,它看到的是“糊”这个概念的激活。
修复方法:把负面表述翻译成正面锚定。“不要糊”改为“清晰锐利的边缘,无运动模糊”。“不要歪”改为“水平构图,主体居中”。
6.3 把剧本当提示词:信息过载反而降低质量
把一段完整的剧本、对白、场景说明全部塞进提示词,模型不仅不会“理解得更好”,反而可能因为信息过载而丢失关键指令。
修复方法:一条提示词只服务一个镜头或一个连续动作段。剧本是给人看的分镜依据,提示词是给模型的执行指令,两者需要分开。
6.4 忽略“不变”的声明
当你在编辑已有视频时,如果不明确说“什么保持不变”,模型可能会“顺便”改掉你没提到的元素。
修复方法:在编辑类提示词中,明确声明“人物服装、面部特征、背景布局保持不变,仅替换XX”。
七、豆包与可灵:提示词策略的差异
理解不同模型对提示词的“偏好”,可以帮助你在豆包上更有针对性地写提示词。
| 维度 | 豆包 Seedance 2.0/2.5 | 可灵 Kling 2.0/3.0 | 对提示词的启示 |
|---|---|---|---|
| 人像表现 | 表情和手势更自然 | 偶尔动作僵硬 | 豆包适合人物日常场景,提示词可侧重动作细节 |
| 自然风光 | 色彩偏素,层次稍平 | 光影层次丰富 | 豆包需在提示词中加强光影方向描述 |
| 快速运动 | 运动连贯性好 | 偶尔拖影 | 豆包适合跑动、舞蹈类提示词 |
| 科幻场景 | 想象力不错 | 质感更震撼 | 豆包需更具体的材质和光影描述来补质感 |
| 生成速度 | 3-8分钟(5秒视频) | 5-15分钟 | 豆包适合快速迭代,提示词可以更“敢写” |
| 多镜头处理 | 指令遵循较好 | 多镜头一致性稍弱 | 豆包可用分镜式提示词做多镜头叙事 |
豆包的优势在于人像动作的自然度和生成速度,这意味着在写提示词时,可以把更多精力放在动作细节和运镜节奏上,而不是反复“抽卡”修正面部扭曲。
八、FAQ:关于豆包制作视频提示词的常见疑问
Q1:豆包制作视频提示词写多长比较合适?
没有固定字数限制,但有信息密度的下限。一条有效的提示词通常需要覆盖八要素中的至少五到六个。如果只写了“主体+动作”,生成结果大概率是“能看但不出彩”。建议起步长度在80-150字(中文),确保每个要素都有具体信息。
Q2:Seedance 2.0 和 2.5 的提示词写法有区别吗?
核心公式一致,但2.5在几个方面放宽了限制。2.5支持单段30秒直出,提示词中可以加入时间戳来分配节奏。2.5的参考素材上限从2.0的较低数量提升到50个,多模态提示词可以更复杂。如果你用的是2.0,建议把长视频拆成多条提示词分别生成再拼接。
Q3:为什么加了运镜指令后画面反而更乱了?
通常是运镜描述本身有冲突。“环绕推进”这种组合运镜在短时间内可能超出模型的理解能力。建议单条提示词只使用一种主运镜,组合运镜留给更有经验的场景。另一个常见原因是运镜速度没有指定,模型用了默认的快速运动导致画面模糊。
Q4:上传了参考图,但生成的人物和参考图不像,怎么办?
先检查参考图的预处理。手机原图的背景噪声会干扰主体识别。另外,提示词中需要明确“参考图N中的主体外观”,而不是笼统地说“参考图N”。如果同时提供了多张参考图,每一张都要指定它负责的维度(主体/风格/动作)。
Q5:编辑视频时模型总是改到我没想到的地方,怎么防止?
在编辑类提示词中,养成一个习惯:明确列出“保持不变”的元素。句式模板是:“严格编辑视频N,将[具体元素]修改为[新特征]。以下元素保持不变:[元素A]、[元素B]、[元素C]。” 声明得越具体,模型的“擅自修改”就越少。
Q6:中文提示词和英文提示词,哪个在豆包上效果更好?
豆包对中文的理解是原生级的,Seedance 2.5 原生支持10余种语言。纯中文提示词完全可以达到英文提示词的效果。但在运镜和画质类术语上,英文专业词汇(如 “FPV drone shot”“slow motion”“shallow depth of field”)有时比中文对应词更精确,因为模型训练数据中这些术语的英文标注密度更高。一个实用的做法是:画面描述用中文,运镜和技术术语用英文。
Q7:生成结果的人物在视频中途“变脸”了,提示词能解决吗?
这是长视频生成中的一致性问题。Seedance 2.5 在30秒内的主体一致性有显著提升,但如果你用2.0生成长视频,建议把视频拆成多个5-10秒的片段分别生成,每个片段的主体描述保持完全一致(甚至可以复制粘贴同一段主体描述)。另外,使用参考图锁定主体外观是防止“变脸”最有效的手段。
Q8:有没有“万能提示词模板”可以直接套用?
有一个可迁移的框架,但内容需要根据场景替换。框架如下:
[主体:身份+外观+材质] + [动作:速度+幅度+方向] + [场景:前景+中景+背景+空间纵深] + [光影:光源方向+色温+对比度] + [运镜:景别+运动方式+速度] + [风格:参照物+技术标签] + [画质锚定] + [约束声明]
把这个框架填满,就是一条合格以上水平的豆包制作视频提示词。

