豆包生成视频指令模板:从一句话到成片的完整指令手册

豆包生成视频指令模板的核心不在于堆砌华丽辞藻,而在于像调度一个片场团队那样,把主体、动作、场景、光影、运镜、风格、画质和约束条件逐项交代清楚。一份好的指令模板,能让模型准确理解你的拍摄意图,避免反复抽卡,一次生成可用的画面。本文从底层逻辑出发,提供覆盖多种创作场景的完整指令模板体系。

一、为什么大多数人的豆包视频指令“不听话”
一个普遍的现象是:同样用豆包生成视频,有人一条指令就能出电影感画面,有人反复生成十几次仍然人物僵硬、画面呆板。差别究竟在哪里?
答案藏在指令的信息密度里。
大多数人写指令的习惯是“描述画面内容”,比如“一个女孩在樱花树下走路”。这句话对人来说有画面感,但对视频生成模型来说,它缺失了三个关键信息:镜头怎么运动、光线什么调性、画面怎么收束。
豆包背后的视频生成模型本质上是一个“全模态导演”。它同时读取文字、图片、视频、音频,并在内部拆解成两个维度来理解:空间层——画面里有什么;时间层——事情如何随时间变化。当你只写“女孩在樱花树下走路”,空间层勉强能构建,时间层却几乎空白。模型不知道镜头是推进还是拉远,是固定还是跟随,于是它只能随机发挥——结果自然不可控。
这就是指令模板存在的意义:不是替代你的创意,而是把你的创意翻译成模型能精确执行的工程语言。
理解了这一点,后面的所有模板你都能“看得懂、改得动、用得上”。
二、指令模板的底层逻辑:八个要素构成一条完整指令
豆包视频生成的指令模板有一个经过官方验证的进阶公式:
精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件
这八个要素不是随便排列的,它们有明确的先后逻辑:先锁定“谁在干什么”,再交代“在哪里、什么氛围”,然后告诉模型“怎么拍”,最后用风格、画质和约束把结果收束到位。
2.1 各要素的实战写法
| 要素 | 作用 | 好的写法 | 常见的无效写法 |
|---|---|---|---|
| 精准主体 | 锁定画面的核心对象 | “一位身着月白色旗袍的年轻女性” | “一个女生” |
| 动作细节 | 定义时间维度的变化 | “缓缓转身,裙摆随动作自然摆动” | “在动” |
| 场景环境 | 交代空间背景 | “江南古镇的石板巷弄,两侧白墙黛瓦,巷口有藤蔓垂落” | “在古镇” |
| 光影色调 | 设定光线情绪 | “傍晚暖金色侧逆光,地面有拉长的人影” | “好看的光” |
| 镜头运镜 | 告诉模型怎么拍 | “镜头从远景缓慢推近至中景,保持水平” | 不写运镜 |
| 视觉风格 | 锚定审美方向 | “电影感,胶片颗粒质感,低饱和暖调” | “好看的风格” |
| 画质 | 硬性输出规格 | “4K,24fps,细节清晰” | 不写 |
| 约束条件 | 排除干扰项 | “无水印,无文字叠加,人物面部不变形” | 不写 |
八个要素并非每条指令都要写满。短视频场景下,主体、动作、运镜、画质四个要素是底线;追求电影感则需要把光影、风格和约束条件都补上。
三、按任务类型匹配指令模板
豆包视频生成并非只有“写一句话就出片”这一种方式。根据你手头的素材和创作目标,任务类型不同,指令模板的写法也完全不同。
3.1 文本直接生视频:五要素链模板
这是最基础也最常用的方式——手头没有素材,纯靠文字描述生成。
模板结构: 主体 + 场景 + 动作 + 运镜 + 风格画质
示例模板:
一只橘色虎斑猫趴在老式木质窗台上,午后阳光透过纱帘洒在它身上。它缓慢地伸了一个懒腰,前爪向前伸展,尾巴轻轻翘起。镜头从特写缓慢拉远至中景,暖色调,治愈系日系风格,1080P,9:16,8秒。
这条模板对应的是通用型创作需求。如果你要做的是竖屏短视频,把画面比例改为9:16,时长控制在8-10秒即可;如果是横屏影视感内容,16:9、10-15秒更合适。
3.2 图片参考生视频:从素材中提取元素
当你手头有参考图片时,指令的写法需要从“描述画面”切换为“调度素材”。
全模态参考的推荐句式:
参考<图片N>中的<主体/风格/场景>,生成……
示例模板:
参考图1中的人物外貌和服装,生成一段她在咖啡馆窗边阅读的视频。动作:翻书的右手缓慢抬起,目光从书页移向窗外。场景:窗边有绿植,窗外是模糊的街道。镜头:固定机位,浅景深。风格:文艺清新,暖调。9:16,10秒,无水印。
这里的关键在于图片负责锁定“谁”和“什么样”,文字负责调度“做什么”和“怎么拍” 。不要把图片里已经有的信息重复写在文字指令中,那样只会稀释指令的权重。
3.3 视频编辑:精准修改而不动全局
Seedance 2.5新增了视频局部编辑能力,可以在维持整体画面节奏的前提下,对背景、人物、商品等局部元素进行精准修改。
编辑类指令的推荐句式:
- 增加元素:清晰描述<元素特征> + <出现时机> + <出现位置>
- 修改元素:严格编辑<视频N>,将其中的<原特征>修改为<新特征>
- 删除元素:点明需要删除的元素,对保持不变的部分加以强调
示例模板:
严格编辑视频1,将画面中人物手中的白色马克杯修改为透明玻璃杯,杯中有半杯拿铁。其他所有内容保持不变——人物的坐姿、背景的书架、窗外的光线均不改变。
这里有一个容易踩的坑:编辑任务中,直接使用“<视频N>”指代视频,不要用“参考<视频N>” ,否则模型会把它误判为参考任务,而不是编辑任务。
3.4 视频延长:在时间轴上续写
当你有一段已生成的视频,希望向后延续剧情或动作时:
推荐句式: 向后延长<视频1>,生成……
示例模板:
向后延长视频1,生成一段3秒的内容。画面中的人物继续向前行走,走出巷口后停下脚步,侧头看向右侧的街道。保持与原视频一致的光线方向、色调和人物服装。
延长任务的核心约束是风格一致性——光线方向、色调、人物外观都必须与原视频匹配,否则拼接处会出现明显的断裂感。
四、三种创作场景的指令模板体系
不同类型的视频创作,指令的侧重点差异很大。以下按短视频、产品展示、叙事短片三种场景,给出可直接套用的模板框架。
4.1 社交短视频:竖屏节奏优先
竖屏短视频的核心诉求是前3秒抓住注意力,指令中需要强化视觉冲击力和节奏感。
模板框架:
[主体特征描述] + [一个有力的动作或变化] + [强对比光影] + [有节奏感的运镜] + [鲜明风格标签] + 9:16 + 8-12秒 + 无水印
实战示例:
一位穿着机能风外套的年轻男性走在雨夜霓虹街道上,撑一把透明雨伞,雨滴沿伞面滑落。镜头以低角度跟随拍摄,脚步踩过积水激起水花。赛博朋克冷色调,蓝紫霓虹反射在湿滑路面上,手持轻微抖动增加现场感。9:16,12秒。
4.2 产品展示:细节与质感并重
产品类视频指令的核心是让观众看清“好在哪里” ,需要强调材质、光泽、细节。
模板框架:
[产品精确描述] + [一个展示核心卖点的动作] + [干净的背景] + [特写推镜或环绕] + [强调质感的风格描述] + [画质参数]
实战示例:
一枚银色磁吸扣放置在白色大理石台面上,手指轻按将其吸合,发出清脆的“咔嗒”声。镜头以45度俯角缓慢环绕推进,冷光棚拍风格,金属表面呈现细腻拉丝纹理,无多余反光,4K,1:1,10秒。
4.3 叙事短片:用分镜思维拆解长内容
Seedance 2.5支持单段30秒视频直出,但“能生成30秒”不等于“应该一次性生成30秒”。更稳妥的做法是先做分镜,每个镜头单独生成,最后拼接。
分镜指令的关键原则:
- 每个分镜只指定一种运镜方式,不要在同一镜头中同时推、拉、摇、移
- 3-5个分镜/15秒是节奏的甜蜜点
- 相邻分镜之间的光线方向和色调必须保持一致
分镜模板示例(一个3镜头的15秒短片):
镜头1(0-5秒): 清晨,一位老人坐在老式书桌前,手中翻着一本泛黄的相册。固定机位,中景。窗外晨光斜射,桌面有暖金色光斑。胶片质感,低饱和度。
镜头2(5-10秒): 特写老人的手指翻过一页相册,页面上是一张黑白合影。镜头缓慢推近。同一光源方向,暖金色调。
镜头3(10-15秒): 老人合上相册,抬头看向窗外,嘴角微微扬起。镜头从侧面中景缓慢拉远。保持与前两个镜头一致的光影和色调。
五、横向对比:不同任务类型的指令要点速查
| 任务类型 | 核心指令要素 | 需要避免的写法 | 推荐时长 | 适用模型版本 |
|---|---|---|---|---|
| 文本生视频 | 主体+场景+动作+运镜+画质 | 只描述内容,不写运镜 | 5-15秒 | 2.0 / 2.5 |
| 图片参考生视频 | “参考图N中的……” | 重复描述图片已有信息 | 5-10秒 | 2.0 / 2.5 |
| 视频编辑 | “严格编辑视频N,将X改为Y” | 误用“参考视频N” | 与原视频等长 | 2.5 |
| 视频延长 | “向后延长视频N,生成……” | 不指定光线一致性约束 | 3-10秒 | 2.0 / 2.5 |
| 多镜头叙事 | 分镜独立指令+统一光影 | 一个镜头塞多种运镜 | 单镜3-5秒 | 2.5 |
六、进阶:让指令模板真正“出效果”的四个技巧
6.1 运镜指令要“单一且明确”
一个新手最常见的错误是在一条指令里写“镜头推进同时环绕旋转再拉远”。模型面对这种自相矛盾的运镜要求,输出结果往往是画面晃动、主体模糊。一个镜头只指定一种运镜方式,想要多角度,就拆成多个分镜。
常用的运镜指令及其效果:
- 推镜:制造聚焦感,适合揭示细节
- 拉镜:制造抽离感,适合交代环境
- 环绕:制造空间感,适合展示主体全貌
- 跟随:制造沉浸感,适合动作场景
- 固定:制造稳定感,适合对话或静态展示
6.2 光影描述要“给出光源方向”
“好看的光”对模型来说等于没有信息。有效的写法是明确光源的方向和色温:“傍晚暖金色侧逆光,光源在人物右后方”“清晨冷蓝色顶光,有薄雾散射”。
6.3 约束条件要“少而精准”
约束条件写太多会挤压模型的创作空间,写太少又容易出问题。经验法则是:3-5条核心约束。人物类视频重点约束面部和手部,产品类视频重点约束反光和背景。不要写“无任何瑕疵”这种模糊表述,要写“人物面部不变形,手指数量正常,背景无像素位移”。
6.4 利用样片模式快速验证
豆包支持样片模式,开启后先生成一段预览视频,用于快速验证场景结构、镜头调度和主体动作是否符合预期。在正式生成高分辨率版本之前,先用样片模式跑一轮,能大幅减少无效生成。
七、不同题材的指令定制策略
指令模板是框架,但不同类型的视频需要在框架内做出针对性调整。以下是几个高频创作题材的定制要点。
7.1 治愈系生活内容
治愈类视频的氛围感来自柔和的光线、缓慢的节奏、温暖的色调。指令中应避免出现快速运镜、强烈对比光、高饱和度色彩。
调整要点: 运镜用“缓慢推近”或“轻微跟随”;光影用“柔和的自然光,暖调”;风格标签用“日系清新”“胶片质感”“低饱和”。
7.2 科技感产品内容
科技感的核心是冷色调、金属质感、干净利落的光影切割。
调整要点: 光影用“冷光棚拍,有明确的轮廓光”;背景用“纯色或渐变背景,无杂物”;运镜用“精确的环绕推进”或“固定机位配合产品旋转”。
7.3 国风与东方美学
国风视频的难点在于文化符号的准确性和氛围的克制感。
调整要点: 服装和场景描述要具体到朝代或风格(如“宋代仕女”“明式园林”),不要只写“古风”;光影偏好“柔和的漫射光,低对比度”;运镜偏好“缓慢的水平移镜”或“固定长镜头”。
八、常见问题与避坑策略
在大量指令实践中,以下几个问题出现频率最高:
问题一:生成的人物面部变形。 原因通常是参考图片质量不够,或约束条件中未明确要求保持面部一致。解决方法是上传正面清晰、光照均匀的人像参考图,并在指令结尾加上“人物面部特征与参考图保持一致,不改变五官比例”。
问题二:画面像“动态PPT”,缺少运动感。 根源在于指令中缺少运镜描述。补充“镜头缓慢推近”或“跟随拍摄”之类的运镜指令,画面的“活”感会明显提升。
问题三:多镜头生成后拼接处不连贯。 通常是因为每个镜头的指令是独立写的,没有统一的风格锚点。解决方法是先写一段“全局风格声明”,再为每个分镜写具体指令,确保光影方向和色调关键词在所有分镜中保持一致。
问题四:编辑视频时模型修改了不该修改的部分。 原因是没有对“保持不变”的部分加以强调。在编辑类指令中,明确列出需要保持不变的元素,比只写“修改X”更有效。
九、关于指令模板的深度思考:从“写提示词”到“设计镜头”
大多数教程教的是“怎么把提示词写得更好看”,但真正的分水岭在于——你是把豆包当成一个“文字生成视频的工具”,还是把它当成一个“需要你担任导演的片场” 。
当你是“写提示词的”,你关注的是词句是否优美、描述是否详细;当你是“导演”,你关注的是:这个镜头要在几秒内完成什么叙事任务?光线从哪个方向来?摄像机放在哪里?观众的眼睛先看到什么、再看到什么?
指令模板的价值,恰恰在于把“导演的决策”结构化了。八个要素的公式,本质上就是一份微型的导演通告单——告诉模型你是谁、在哪里、做什么、怎么拍、拍成什么样。
理解了这一层,你就不再需要“抄模板”了。因为你知道模板里每一个要素存在的理由,也知道什么时候该加、什么时候该减。
十、常见疑问解答
问:豆包生成视频指令模板必须严格按照八个要素来写吗?
不必。八个要素是完整版框架,实际使用中可以根据任务类型灵活取舍。纯文本生视频写齐主体、动作、运镜、画质四个要素就能出不错的结果;追求电影感或需要精确控制时才需要补全光影、风格和约束条件。
问:指令写多少字比较合适?
建议控制在50-200个词之间。太短信息不足,模型只能“自由发挥”;太长会稀释每个要素的权重,模型反而抓不住重点。如果需要描述复杂场景,更好的策略是拆成多个分镜,每个分镜写一条精简指令。
问:豆包和即梦在指令写法上有什么区别?
两个平台底层使用的视频生成模型是同一系列,指令语法基本通用。区别主要在于功能开放程度:即梦的功能更完整,支持上传视频/音频作为参考素材,也支持更长的生成时长;豆包则更侧重快速生成和低门槛上手。同一条指令在两个平台都能用,但在即梦上可以发挥出更精细的控制力。
问:指令中提到“参考图片N”时,图片怎么上传?
在豆包的视频生成界面中,上传参考图片后,模型会自动为每张图片分配编号。在指令中按编号引用即可。如果是首帧/尾帧模式,需要在指令中明确区分“首帧”和“尾帧”。
问:视频编辑指令中,时间戳怎么写?
Seedance 2.5支持通过时间戳指定编辑生效的时段。例如“在视频的第3秒到第5秒之间,将背景中的蓝色窗帘替换为米白色”。需要注意的是,模型对精确时间区间的支持目前仍有一定波动,建议时间区间不要设得太窄。
问:同一条指令多次生成,结果差异很大怎么办?
这是视频生成模型的正常特性。如果希望结果更稳定,可以在参数中设定固定的随机种子值。另外,约束条件写得越具体,输出的稳定性通常越高。

