AI宣传片提示词:从一句描述到一部品牌片的完整写法

写好ai宣传片提示词的核心,不是堆砌华丽形容词,而是像导演一样下达可执行的制作指令。本文拆解六要素公式、分镜脚本写法、品牌一致性锁定、负面约束策略与音频提示词,提供可复制的模板与横向对比,帮助你把模糊的“想要好看”变成AI能精确执行的画面方案。

一、为什么你写的ai宣传片提示词总是“差一口气”
很多人写ai宣传片提示词的方式,是把脑子里的画面翻译成形容词:“高端的”“电影感的”“有科技氛围的”。然后满怀期待地把这段描述丢进工具,得到一坨融化中的蜡像。
问题不在工具,在输入逻辑。AI视频生成模型不理解“高端”对你意味着什么,它只知道视觉元素的组合概率。你写“高端企业宣传片”,模型可能给你玻璃幕墙加西装人群加无人机航拍——因为“高端企业”在训练数据里就是这么共现的。这套组合放在任何一家公司身上都成立,放在你的品牌身上就毫无辨识度。
真正有效的ai宣传片提示词,本质上是一份制作说明书:主语是谁、在做什么、摄影机怎么动、光从哪来、什么绝对不能出现。它不负责“创作”,它负责“执行”。你的创作发生在动笔之前,提示词只是把创作意图翻译成模型能消化的格式。
这个认知转变很重要。一旦你接受“提示词是执行文档而非创意描述”,写法就会彻底改变——从堆形容词变成写指令。
二、六要素公式:ai宣传片提示词的基本骨架
字节跳动在Seedance 2.5官方指南中给出的公式是:主体 + 动作或事件 + 场景与环境 + 视觉风格 + 运镜或切镜 + 声音。这个结构之所以稳定,是因为它按信息优先级排列:地基(谁在做什么)→ 空间(在哪)→ 质感(看起来怎样)→ 运动(怎么拍)→ 听觉(听起来怎样)。
后面四项是可选的,但每加一项,可控性就上一个台阶。一项都不加,模型自由发挥;六项都加,输出基本锁定在你设想的轨道上。
主体:别写“一个人”,写“一个什么样的人”
“一个商务人士”和“一位五十岁出头、穿深灰羊绒大衣、站在落地窗前背对镜头的制药公司CEO”,在模型眼里的差别,等同于“随便找个人”和“按照选角导演的要求找人”。
主体的描述需要解决两个问题:可识别性和情绪传达。可识别性靠具体特征——年龄、衣着、姿态、面部朝向。情绪传达靠微表情和肢体语言——Commnications专家Stephanie Nivinskus的建议是,不要写“一个自信的CEO”,而是写“一位CEO平静地站在现代办公室中,面向镜头,姿态自然,手势克制但有意图”。“自信”是结论,“平静的姿态和克制的手势”是产生这个结论的原因。模型不执行结论,模型执行原因。
动作:写运动,不写状态
这是最容易被忽略的区分。静态图片提示词可以写“她坐在窗边看书”,视频提示词必须写“她翻动书页,目光从书页移向窗外,停顿两秒”。
“在做的过程中”才是视频的本质。只描述一个静止的画面状态,模型要么生成一个几乎不动的片段,要么自作主张编一个动作。你要控制的是运动方向、速度、节奏和落点。动作的“来向和落点”比动作本身更重要——手从画面外伸入还是从画面内抬起,物品从左向右滑过还是从右向左,决定了观众的空间认知。
场景:地点 + 时间 + 空间关系
“办公室”是地点,“傍晚五点的办公室,窗外城市灯光初亮,办公桌上散落着文件和一只半冷的咖啡杯”是场景。
场景要交代的不只是“在哪”,还有“空间关系”。主体在画面的什么位置?前景有什么遮挡?背景距离主体多远?这些信息告诉模型画面应该有多“深”。浅景深和深焦距产生的空间感完全不同,而模型需要你告诉它用哪一种。
视觉风格:光线、色彩、质感,分开写
把“电影感”当成风格描述,等于什么都没说。有效的风格描述拆成三层:
光线要写来源和方向,不写形容词。“暖黄色的台灯光从画面左侧打来,人物右脸处于半阴影中”比“温馨的灯光”精确十倍。invideo的提示词结构建议把光照比例也写进去,比如“暗部与亮部比例约为85:15”,这是可以直接复现的视觉参数。
色彩和光线分开写。色调可以指定具体倾向:“琥珀色与墨绿色双色调,暗部偏冷,亮部偏暖”。如果品牌有固定色值,把近似色相描述写进去比后期调色更省事。
质感决定画面的“材质感”:胶片颗粒、数字锐利、柔焦、高对比、低饱和。一条宣传片不需要所有这些,选一个主调,保持一致。
运镜:景别、机位、运动方式
运镜是ai宣传片提示词中“性价比最高”的模块。加一句“镜头缓慢推近”,画面立刻有了方向感;加一句“低角度仰拍”,主体的视觉权重立刻上升。
Nivinskus在PR Daily的工作坊中指出,机位改变信息感知:“把摄影机放在主体略微下方,人物立刻显得更有力量;把摄影机拉近并用浅景深,立刻产生亲密感”。运镜不只是技术参数,它是无声的修辞。
常用的运镜词汇不需要多:推、拉、摇、移、跟、升降、环绕。每个镜头选一两个,不要堆叠。一个镜头里又是推又是摇又是跟,模型会混乱。
声音:如果有,就说清楚
原生音频能力正在成为主流AI视频模型的标配。Seedance 2.0的音频指南指出,在提示词中指定语言和声音语调——“平静的日语男声旁白”比“加一段旁白”的效果好得多。声音提示词的四类内容:对白(谁在说、什么情绪)、旁白(音色、语速、语言)、环境声(场景自然声音)、音乐(风格、节奏、情绪)。
如果你的宣传片需要配音,把配音描述放进提示词,让模型在生成画面时就考虑音画节奏。声音和画面的节奏对不上,是AI宣传片最常见的“廉价感”来源。
三、分镜脚本写法:把30秒宣传片拆成可执行的指令序列
一次性写一段600字的提示词描述整条宣传片,生成结果大概率是一段“什么都有一点,什么都不对”的碎片。正确的做法是按照时间线拆成镜头序列。
时间戳分镜格式
Wan 2.6的提示词指南建议的格式是:先写全局风格描述,然后逐个镜头用时间戳标注。例如:
全局风格:写实电影质感,暖色调,浅景深,35mm镜头特性,轻微胶片颗粒。
镜头1 [0-3秒]:产品静置于黑色大理石台面,顶光勾勒轮廓,镜头从微距特写缓慢拉远。
镜头2 [3-6秒]:一双工匠的手从画面下方进入,拿起产品翻面,手指沿边缘移动,侧光突出材质纹理。
镜头3 [6-10秒]:镜头切至全景,产品在场景中被使用,人物仅露出手部和身体局部,自然窗光,画面右侧留白。
每个镜头内部要包含四个信息层:时间范围(0-3s)、镜头动作(推/拉/切/摇)、主体行为(手进入、拿起、翻面)、光线与风格锚点(侧光、自然窗光)。
Seedance 2.0的品牌宣传片模板给出了一个更简练的三幕结构:第一幕(0-30%)建立情感世界,第二幕(30-70%)引入品牌作为变革催化剂,第三幕(70-100%)以情感升华收尾。这个比例可以套用到任何时长的宣传片上。
镜头之间的“连续性锚点”
分镜写得好不好,关键看镜头之间是否“接得上”。模型在跨镜头生成时很容易丢失一致性——第2秒的杯子和第7秒的杯子颜色变了,人物的手在第4秒出现、第8秒换了另一只。
解决方法是在每个镜头的提示词里重复关键锚点。如果第1秒出现了一个浅蓝色陶杯,第7秒的镜头提示词里仍然要写“同一只浅蓝色陶杯,釉面有细微的拉坯纹理”。不要假设模型记住了上一个镜头的内容——大多数模型不会。
一个实用的做法是维护一份 “锁定清单” ,把每个镜头中必须保持一致的视觉元素列出来,逐镜头复制进提示词。这张清单包括:主体外观、关键道具、色彩基调、光线方向、画幅比例。清单之外的东西允许模型变化,清单之内的东西不允许漂移。
四、品牌一致性:如何让ai宣传片“一眼就是你家拍的”
宣传片和短视频最大的区别,是宣传片承载品牌识别功能。观众看完15秒的产品演示,记住产品就够了;看完品牌宣传片,他们需要记住你是谁。
AI生成最大的风险恰恰在这里:每一帧单独看都不错,但整体看“没有品牌感”——因为模型默认输出的是通用美学,不是你的品牌美学。
品牌外观的提示词前置
品牌外观必须在第一个镜头的第一句话就锁定,而不是留到风格描述里再说。Vivideo的AI品牌一致性指南指出,好的提示词应该把品牌外观“锁进”开场:明确色板、字幕处理、Logo位置与片头节奏,让第一秒在观众还没读字之前就“ unmistakably yours”。
具体写法:把品牌主色相的近似描述、Logo出现的画面位置、字幕的字体倾向、片头的节奏感全部写进第一个镜头的提示词。例如:
深海军蓝作为画面基底色,琥珀金作为唯一强调色。Logo固定于画面右下角,白字无描边。片头以三帧静帧快切开场,节奏紧凑不拖沓。一位穿深灰西装的人物从画面左侧步入办公室,自然步态,镜头固定中景。
色板、Logo、字体、节奏——四件事在第一句里全部交代。后面的镜头只需要说“保持开场品牌元素不变”。
角色一致性的参考图工作流
如果宣传片中有反复出现的人物,不要靠文字描述维持一致性,靠参考图。
invideo的角色一致性指南建议构建一张多角度角色表——正面、侧面、半身、全身——然后把这张表连同品牌风格块一起附加到每一个镜头提示词中。参考图给模型提供的是“面部特征、发型、服装、品牌色、标志性配饰”的精确锚定,文字描述做不到这个精度。
一个进阶做法是给一致性代理起一个名字,比如“品牌连续性”。在提示词中直接写“遵循‘品牌连续性’参考中的角色外观”,模型会把这句话当作一个已定义的变量来调用。这个名字本身没有魔法,它的作用是提醒你自己在每次写提示词时都去调用参考资源。
五、负面约束:告诉AI“绝对不要做什么”
正面提示词决定画面“是什么”,负面约束决定画面“不会变成什么”。在品牌宣传片场景中,负面约束的重要性不亚于正面描述——一个Logo漂移、一个多余的手指、一处不该出现的竞品标识,都足以让整条片子报废。
负面约束的写法有优先级。最优先的是品牌安全类:不得出现竞品Logo、不得出现水印、不得出现未授权的文字叠加、Logo形状和位置不得改变。其次是画面质量类:不得出现额外肢体、不得出现文字错乱、不得出现面部扭曲。最后是风格漂移类:不得出现与品牌色板冲突的霓虹色、不得出现手持晃动的风格(如果你的品牌是稳定专业的调性)。
一个有效的负面提示词模板:
禁止出现:竞品标识、水印、字幕叠加、Logo变形、额外手指、面部不对称、文字乱码、色调偏冷发蓝、手持抖动、快速无意义切镜。
负面提示词放在整个提示词的末尾,作为一个独立的块。不要把负面约束混在正面描述中间——模型对位置敏感,末尾的约束权重更高。
六、音频提示词:让声音和画面“长在一起”
宣传片的声音不是后期贴上去的,它应该和画面在提示词层面就对齐节奏。
Seedance 2.0的原生音频指南把声音提示词分为四个可独立指定的通道:对白、旁白、环境声、音乐。每个通道的写法不同。
旁白需要指定语言、音色、语速和情绪。“中文女声旁白,中速偏慢,语气平静有力,无上扬尾音”是一个可执行的描述。“有感染力的旁白”不是。
环境声要和场景对应。“潮湿石面上的脚步声,远处城市低频嗡鸣,偶尔的鸟鸣”比“环境声”有用得多。环境声的作用是建立空间真实感——没有环境声的画面即使在视觉上很完美,也会让人觉得“假”。
音乐可以指定风格、节奏和情绪走向。“极简钢琴,每分钟70拍,从单音逐渐叠入弦乐,情绪从克制到释放”给出了一个清晰的听觉弧线。音乐描述不需要专业术语,但需要变化方向——模型需要知道音乐在时间里怎么走。
音画对齐的一个实用技巧是在分镜的时间戳里同时标注声音事件。比如:
镜头2 [3-6秒]:手进入画面拿起产品,侧光。同期声:布料摩擦声,轻微的环境低频。音乐进入第二层,弦乐弱起。
声音和画面共享同一套时间轴,生成的片段在节奏上天然对齐。
七、进阶:独到见解与深度策略
见解一:提示词的质量上限由“视觉词汇量”决定
一个写作者能写出的ai宣传片提示词,精确度不会超过他所掌握的视觉描述词汇。如果你只知道“推拉摇移”四个字,你无法告诉模型“镜头以每秒三厘米的速度从特写拉至中景,同时焦点从产品表面平滑转移到背景人物”。如果你分不清“侧逆光”和“轮廓光”的区别,你就无法控制人物边缘的分离感。
提升提示词质量的最短路径,不是学更多“AI技巧”,而是扩充你的摄影和视觉叙事词汇。读摄影基础教材比刷提示词教程有用。看三遍你最喜欢的品牌宣传片,逐帧记下你看到了什么——光线从哪来、镜头在做什么、画面里有什么、没有什么。这份笔记就是你写下一组提示词时的素材库。
见解二:最容易被忽视的维度是“节奏”
大多数ai宣传片提示词在描述“画面”,很少描述“节奏”。但宣传片的记忆点往往来自节奏:开场三帧快切制造紧张感,中段一个长镜头让情绪沉淀,结尾定格两秒让品牌信息停留。
节奏可以在提示词中控制。在分镜的时间戳里,镜头时长的分配本身就是节奏设计。如果所有镜头都是3秒,节奏是平的。如果第一个镜头1秒、第二个4秒、第三个1.5秒、第四个5秒,节奏就有了呼吸。
写法上,节奏通过“镜头时长 + 运动速度”的组合来传达。“镜头以缓慢匀速推近,持续4秒”和“镜头快速甩入,0.5秒完成,随即静止”是两个完全不同的节奏指令。
见解三:参考视频比参考图更能解决“动态一致性”
参考图解决的是“长什么样”的一致性问题,但宣传片的动态质感——运动方式、镜头节奏、光线变化——参考图管不了。如果你的品牌调性是“稳定、克制、不花哨”,光靠静态参考图无法阻止模型生成一个花哨的运镜。
这时候需要参考视频。提供一段符合品牌调性的现有视频片段,在提示词中写“运动方式和节奏参考@视频1,但主体替换为当前描述”。模型会从参考视频中提取运动特征,而不是从文本中猜测“克制”是什么意思。
见解四:提示词的长度不是问题,“信息密度”才是
新手常有一个误解:提示词越短越好,写太长模型会“混乱”。实际上,模型对长度的容忍度比你想象的高得多。真正造成混乱的不是长度,是信息密度低——一段300字的提示词里有250字是形容词,剩下50字才是实际指令。
有效的长提示词是这样的:每一句话都在增加一个模型可以执行的新变量。如果你写的某句话删掉之后生成结果没有变化,那句话就是冗余的。
八、主流工具的宣传片提示词策略横向对比
不同AI视频模型对提示词的“消化方式”不同。同一套提示词逻辑,在A工具上效果很好,在B工具上可能需要调整结构。下表对比了当前主流工具在宣传片场景下的提示词策略差异。
| 工具 | 提示词结构偏好 | 宣传片场景的强项 | 需要注意的限制 | 适合的宣传片类型 |
|---|---|---|---|---|
| Sora / Sora 2 | 多句结构化,接近给摄影师的完整简报,支持对话时间标记和同步音频 | 叙事性内容、带对白的人物场景、复杂镜头调度 | 对过度简短的提示词容易“自由发挥”;需要明确的时间戳分镜 | 品牌故事片、人物驱动型宣传片 |
| Runway Gen-4 | 简单性优先,迭代添加细节;适合先测基本运动再叠风格 | 运动控制和视觉效果的快速迭代 | 不适合一次性写超长提示词;需要多轮调整 | 产品动态展示、视觉概念片 |
| Seedance 2.5 | 六要素公式,支持多达50份参考素材组合,官方提供分镜模板 | 多素材调度、长片分段、品牌一致性工作流 | 参考素材有输入上限(图片30张、视频10段) | 品牌宣传片、企业活动回顾、产品发布 |
| Wan 2.6 | 全局风格描述 + 逐镜头时间戳;文本提示词上限约800字符 | 多镜头序列、画幅比例适配、时序控制 | 字符数有上限,长片需要拆分为多次生成 | 社交媒体品牌短片、多平台格式适配 |
| Kling 2.6 | 原生音频支持强,对白和旁白的提示词精度高 | 有配音需求的宣传片、多角色对话场景 | 运镜词汇的响应一致性因版本而异,需要测试 | 人物访谈型宣传片、有旁白的品牌叙事 |
| Veo 3 | 支持电影级术语,对“18mm、浅景深、微妙薄雾”等摄影语言响应准确 | 电影感品牌短片、广告级视觉输出 | 提示词需要较高的摄影词汇门槛 | 高端品牌形象片、广告级制作 |
选择工具的实用建议:如果宣传片以人物叙事为主,优先考虑Sora或Kling;如果以产品视觉为主,Runway和Veo更直接;如果需要多素材调度和品牌一致性管理,Seedance的参考图工作流更成熟;如果多平台格式是刚需,Wan 2.6的宽高比支持和时序控制更方便。
九、FAQ:关于ai宣传片提示词的常见疑问
Q1:ai宣传片提示词写多长比较合适?
没有固定长度,但有信息密度的底线。一个5秒镜头的提示词,如果包含主体、动作、场景、光线、运镜、约束六项,大约在80-150字之间。如果某个维度不需要控制(比如纯产品微距镜头不需要“动作”描述),可以删到60字左右。超过200字的单镜头提示词通常包含冗余形容词,建议精简。
Q2:中文提示词和英文提示词的效果有差别吗?
取决于模型。Seedance、可灵、万相等中文训练数据充分的模型,中文提示词的响应精度和英文相当。但涉及摄影专业术语时,英文术语(如“anamorphic”“shallow DOF”“split-toning”)在多数模型中的识别精度仍然更高。一个实用的折中方案是:主体和场景用中文写,技术参数用英文关键词嵌入。
Q3:写好的提示词生成结果不理想,应该改提示词还是换工具?
先改提示词。同一个工具在提示词优化前后,输出质量的差异通常大于不同工具之间的差异。改提示词的顺序:先确认“主体+动作”是否清晰(地基)→ 再检查“运镜”是否明确 → 最后调整“风格描述”是否具体。如果这三层都没问题,再考虑换工具。
Q4:如何在宣传片中保持多个镜头的色调一致?
在全局风格描述中锁定一个色彩模式,然后在每个镜头的提示词末尾重复这个色彩描述。不要指望模型自动记住上一镜头的色调。如果品牌有固定色值,把十六进制值的近似色相描述写进每一段提示词。更可靠的方式是使用参考图——提供一张色彩参考板,附加到每个镜头。
Q5:负面提示词真的有用吗?
在品牌宣传片场景中,负面提示词是必要项而非可选项。模型不会主动知道“竞品Logo不能出现”“产品标签不能被生成文字覆盖”“品牌色的饱和度不能漂移”。这些约束必须显式写入负面提示词。一个宣传片项目的负面约束清单应该在第一次生成之前就确定,并作为模板复用。
Q6:AI宣传片提示词可以复用吗?
可以复用结构,不能复用具体内容。把六要素公式、时间戳分镜格式、负面约束模板作为可复用的框架,每次替换主体、场景和品牌参数。Seedance的品牌宣传片模板就是按这个思路设计的:提供三幕结构和组装公式,具体内容由使用者填充。
Q7:宣传片的开场镜头有什么特殊的提示词写法?
开场镜头需要在前1.5秒内建立视觉吸引力。提示词中要指定“开场即以主体最大视觉权重出现”或“以运动吸引注意力”。Seedance的社交品牌短片模板建议:将最具视觉冲击力的元素前置——醒目的产品亮相、出人意料的转场或人物反应。开场镜头的提示词不要交代背景,背景留到第二个镜头再说。

