文章摘要
文章介绍了2026年AI短剧的制作全流程。从AI生成剧本,按镜头类型拆分用不同版本软件制作,锁定角色与场景参考图,到图生视频、配音、音效处理,最后用剪映拼接等。还给出成本对比,AI单人剧组成本远低于传统微剧组。同时指出制作要避免人脸漂移等三大坑,强调内容才是爆火关键,把握好开篇等要素可控制成本获流量。

打开红果短剧的热播总榜,排名前五的作品里,AI短剧占了四席。《万妖图录传》连续十一季连播,成为现象级作品,背后的光宇团队不到20人。


另一部AI短剧《都重生了,谁还装富二代啊》做到第九季,20人团队,三天出一季,九季共729集。《一枕山河踏月来》一人7天,上线24小时播放量突破1700万,登顶抖音短剧榜新剧分类榜第一名,3天全网播放量破亿。


单人剧组,批量生产,千万热度,普通人也能分蛋糕。


下面我们把完整的AI短剧制作流程展开,从剧本到成片,每一步用什么工具、怎么写提示词、花多少钱,全部说清楚。


AI生成


1.png

第一步:用DeepSeek/Chatgpt生成剧本


AI短剧看是短剧,不是AI。短剧的流量密码就两个字:钩子。前15秒抓不住人,后面拍得再好也白搭。AI短剧能在榜单上碾压真人剧,就是反复推积爽感,每集都有打脸和逆袭。


剧本提示词

请写一部3分钟以内的重生逆袭类短剧剧本,格式如下:

【剧名】:(3-5个字,带钩子)
【题材】:重生/逆袭/打脸
【核心爽点】:一句话说清楚“观众为什么会爽”
【人物】:
  - 主角:[姓名],[年龄],[核心身份],[性格标签],[重生前的困境]
  - 反派:[姓名],[年龄],[核心身份],[性格标签]

【剧本正文】:
场景一:[地点][时间]
(画面描述:谁在哪儿、在做什么、情绪状态)
[角色名]:[台词]

【分镜要求】:
- 全剧控制在15-25个镜头
- 每个镜头时长5-10秒
- 前3个镜头必须出现:身份反差、冲突预告、情绪钩子
- 每3-5个镜头设置一个小反转


小技巧:学习剧本创作最好的方法是模仿,先让AI拆解一个爆款的剧情套路,再创作新的剧本,慢慢熟能生巧。


2.png

第二步:拆分时间线


这Seedance 2.5推出后,本人的一个省钱小经验。


很多人做AI短剧有一个误区,所有镜头都用最新的Seedance 2.5生成,积分烧快,成本控不住。


正确的做法是,按镜头类型拆分,不同难度用不同版本,先用Seedance 2.0廉价建立角色与环境,再以上一段视频作为参考,让Seedance 2.5生成复杂高潮。


镜头类型

推荐工具

原因

建立镜头/简单运镜(15-20秒)

Seedance 2.0

基础推拉摇移、建立环境,2.0足够用,价格便宜得多

高潮/复杂动作/叙事核心(10-15秒)

Seedance 2.5

只在关键段落用2.5,物理更稳定、动作更连贯


这样故事更完整、物理更稳定、积分大幅节省。


为什么这样更省?很多人担心拆分会更费积分,但忽略了失败率。一次复杂生成失败 = 全部积分白费。拆分后成功率和可控性大幅提升,反而更省。


环境、角色入场、情绪铺垫用2.0;冲突酝酿、对话推进用2.0;20秒动作高潮:打斗、爆发、反转用2.5。


3.png

第三步:GPT Image/即梦锁定角色三视图与场景参考图


角色一致性是AI短剧最大的坑,同一个角色,上个镜头长这样,下个镜头就换人了,差评不断,我们必须在生成视频之前先把角色锁死。


a27ab033-eb0c-4ef9-9a8d-fd21a92928e6.jpg


角色三视图提示词


用GPT Image或即梦生成角色的正面、侧面、3/4侧三视图。多角度角色参考图(正面、侧面、背面加上面部特写)锁定为参考图像,然后将其输入到每一次图生视频生成中:

生成一张电影级角色设定板,浅灰中性背景,非对称拼接排版:

中央:角色全身立像
周边:全身多角度转面图(正面、3/4侧、正侧、背面)
侧边:头部细节研究组图(正面、3/4、正侧、低头、抬头)
局部:服装与配件拆解说明,带材质标注引线

角色:[填写名字],[填写外貌特征],身穿[填写服装]。

风格:写实电影质感,自然抓拍感,拒绝摆拍。全角度五官、发型、身形比例严格一致。


这张图会作为后续所有视频生成的锚点,每个镜头的提示词都要引用它。


场景参考图同理,为每个主要场景生成2-3张参考图,标注空间方位关系(如南侧入口、北侧后院、中间庭院等),后续生成时保持空间逻辑一致。


4.png

第四步:Seedance 2.5/可灵做图生视频,批量生成片段


HP2yK73XwAAaESh.jpg


图生视频比文生视频稳定得多,用角色三视图作为参考,模型就锁定了“这个人长什么样”,提示词只需要告诉它“这个人接下来做什么动作”。


公式(来自Seedance官方提示词指南):

主体 + 动作或事件 + 场景与环境(可选)+ 视觉风格(可选)+ 运镜或切镜(可选)+ 声音(可选)


写提示词时,先说清楚想生成什么,再按需要写明参考素材、事件过程、视觉表达和声音。


完整案例:《武馆挑战》


这套提示词来自一位专业AI短剧创作者的实际工作流,他先用GPT Image生成角色与场景参考图(@Image 1~8),分别定义武馆的完整地理(街道、正门、前院、内门、高门槛、主院、侧廊、后练功厅)、咏春与洪拳弟子的服装、两位师父的形象,再写极详细的分段提示词。


ezgif-3739d875bd2b4542.gif


Part 1 提示词(30秒入场,使用Seedance 2.0):

[参考资料]
@图像1确立了武馆的整体空间布局:街道、正门、入口庭院、内门、高门槛、主庭院、侧廊以及后方练武厅。
@图像2呈现了雨后湿润的街面立面、花岗岩台阶、木质大门。
@图像3确立了从正门通往后方练武厅的连贯轴线。须保留所有的门、地面高差及行进动线。
@图像4呈现了主庭院、后厅、校名牌匾、廊道、石板铺地及光影效果。
@图像5仅呈现咏春拳学员的暖灰色上衣、黑色长裤及黑布鞋。
@图像6仅呈现洪拳学员的靛炭色练功服及牛血红腰带。
@图像7呈现咏春拳师父的身份特征、精瘦体格及象牙白服饰。
@图像8呈现洪拳挑战者的身份特征、魁梧体格、炭色服饰及深红腰带。

[目标]
制作一部香港历史背景功夫片短片(共两部分,总时长60秒)的第一部分。
这30秒的片段旨在构建武馆场景,引出挑战事件,并在格斗即将开始前戛然而止。
对白语言:地道的香港粤语。语音与画面自然同步。不加字幕、标题、书法或图形文字。

[空间布局与调度]
正门位于南侧入口处。门后紧接着是第一个室外练武场。
洪拳挑战者停留在南侧入口附近(正门内侧),未越过内门槛深入。
咏春拳师父位于相对的另一端——北侧后方练武厅的深处。
主庭院与高门槛将两人隔开。
全程保持这种南北方位的空间关系。不得出现瞬间移动或出入口方位错乱的情况。

[0–6秒 — 逼近]
以高角度广角全景镜头开场。画面上半部分展示武馆立面;前景处是雨后湿润的街道。
来自@Image8的洪拳挑战者正沿街走向武馆。他的三名弟子紧随其后,保持着严整的三角形阵型。
挑战者右手持一封封口的红色战书,目光始终锁定武馆入口。
保持广角镜头,交代上方的武馆、下方逼近的队伍以及连接两者的花岗岩台阶。
当挑战者抵达台阶时,镜头开始缓慢下降并横向移动,跟随他向大门走去。
他穿过正门。

[6–11秒 — 闯入]
切至第一个练武场内的广角镜头,回望正门方向。
挑战者进入并在门内三步处停下。三名弟子在其身后呈浅纵深队形停步。
他必须停留在入口附近,不得跨过内侧较高的门槛。
在更深处练功的三名咏春弟子察觉到来者,随即停下动作。
挑战者将封口的红信放在入口旁的木架上,随后透过敞开的内门望向远处的武馆牌匾。
大师兄认出了这份正式战书,目光在信件与挑战者之间游移,随后转身走向后堂。

[11–16秒 — 警示]
从后方跟拍大师兄,他正快速穿过主庭院,向后方练武堂走去。
他的行进路线须沿用@Image3确立的中轴线。
后堂内,咏春宗师站在一张木制练功台旁,侧身背对入口。
弟子在恭敬的距离处停步,行抱拳礼,语气急促而克制地说道:
{师父,外面有人来踢馆。}
宗师的手停在了正在整理的物件上。他先转头望向庭院,随后才转身。

[16–21秒 — 师父登场]
师父从后堂走出,大弟子紧随其后,落后半步距离。
采用正面中远景镜头,在他们步入庭院的过程中进行后退跟拍。
咏春弟子们移至左侧廊下,腾出中央的切磋场地。
画面切至沿庭院中轴线拍摄的对称长镜头。
师父在内侧门槛的北面站定。
挑战者则停留在靠近正门南面一侧。
两人隔着庭院相对而立。


Part 2 提示词(30秒对打高潮,用Seedance 2.5 + 上一段视频):

[参考角色]
@视频1为后续扩展的源视频。它定义了完整的前情提要,包括人物身份、服装、武馆布局、物品位置、灯光、音效环境、镜头方向以及最终对峙场景。
@视频1控制扩展边界和开口合成。

[向前延伸]
@视频1是向前延伸的源视频。
向前扩展@视频1。扩展片段的第一帧直接从@视频1的最后一帧继续。
保持两位大师准确姿势、方向、目光和距离的连续性;学生的立场;红色挑战信;固定的学校牌匾;门槛;庭院建筑;背景和空间关系;锁定的相机位置和构图;潮湿阴暗的灯光;以及@视频1结尾处建立的无声紧张气氛。

[动作段落概要]
挑战者率先出手,洪拳刚猛直进,拳风破空。
咏春师父以寸劲接招,连消带打,在方寸之间化解三记重拳。
挑战者变招为扫腿,师父提膝格挡,顺势进马,一记摊打正中挑战者胸口。
挑战者后退三步,卸力重整,两人拉开距离。
第二回合:挑战者双拳齐出,师父以问路手探其虚实,随即转膀手破开中路,连消带打迫其后退。
挑战者被逼至内门附近,师父停手,示意点到为止。
挑战者低头抱拳,转身离去。红色战书仍留在原处。
师父目送其离开,转身回到后堂。

5.png
第五步:配音与音效


配音在图生视频时已经可以一并生成,Seedance 2.5支持多语言台词生成和口型同步,你只需要在提示词里写清楚谁在什么时候说什么话。


483a0a03-1e39-4f48-ba28-b0bbd4cedb8a.png


台词嵌入写法


在视频提示词中加入台词指令,格式为{角色名:台词}:

参考@图1中角色的外貌。角色站在画面中央,面无表情,嘴唇微动说出台词:
{师父,外面有人来踢馆。}
口型与台词同步,自然的粤语发音,语气急促而克制。
无背景音乐,保留环境音。


对白语言可以指定为地道的香港粤语、日语、韩语等,语音与画面自然同步。


音效独立处理


如果对AI生成的音效不满意,可以用剪映或讯飞配音单独处理:


  1. 从生成的视频中截取音频片段作为配音参考
  2. 用剪映的文本转语音或讯飞配音生成纯净人声
  3. 导出为48kHz WAV格式,导入剪辑软件对齐


声音设计原则


  • 环境音比BGM重要:车流声、脚步声、开关门声,这些才是建立真实感的关键
  • 无BGM有时比有BGM更高级:全程依靠真实的环境音(车流、引擎、急刹)、动作音效(撞击、拔枪)以及人物原声对白
  • 台词单独导出:每句台词生成独立音频文件,剪辑时灵活性更高


6.png

第六步:剪映拼接、调色、字幕、导出


剪辑顺序


  1. 先铺画面:把所有选中的视频片段按分镜顺序拖入时间线
  2. 再对音频:把配音和音效文件对齐到对应画面
  3. 最后调色:统一所有片段的色温和对比度


62ce6868-776c-403f-a514-0ad84caecd09.png


统一调色


AI生成的视频片段之间色温往往不一致。用剪映的色温和色调工具,把全部片段调到同一个基准线上,再统一套一个LUT或滤镜。


自动字幕


剪映的识别字幕功能可以自动从音频生成字幕,生成后手动检查断句和标点。


导出设置:H.264编码,1080p分辨率,24fps帧率。


7.png

完整成本对比


以一部60秒短剧、约15-20个镜头为例:


成本项

AI单人剧组

传统微剧组

剧本

DeepSeek/Chatgot(免费-20元/月)

编剧费 500-2000元

分镜

AI自动生成(0元)

分镜师 300-1000元

角色设计

GPT Image/即梦(约50-80元)

造型师+服装 500-3000元

视频生成

Seedance 2.0+2.5混合(约200-400元)

摄影+器材 2000-10000元

配音

AI生成(含在视频生成中)

配音演员 300-2000元

剪辑

剪映免费版(0元)

剪辑师 500-3000元

总计

约250-500元

约4000-20000元


8.png
2026工具推荐表


环节

推荐工具

特点

费用

剧本/分镜

DeepSeek / Claude

免费额度充足,支持长上下文

免费-20元/月

角色图

GPT Image / 即梦

角色一致性控制强

按量计费

视频生成(建立/运镜)

Seedance 2.0

基础推拉摇移,价格便宜

约0.07美元/秒

视频生成(高潮/动作)

Seedance 2.5

单次30秒,物理稳定,动作连贯

约2.7元/秒(1080P)

视频生成(备选)

可灵3.0

图生视频+主体参考,角色锁定强

按量计费

配音

Seedance 2.5内置 / 剪映AI

口型同步,多语言支持

含在视频生成中

音效

剪映AI / 讯飞配音

环境音、脚步声、开关门声

免费-少量付费

剪辑/调色/字幕

剪映

自动字幕、调色、导出一站式

免费版够用


9.png

三大踩坑与解决方案

坑1:人脸漂移


解决方案:

  • 用图生视频而非文生视频,以角色三视图为首帧锚定
  • 每个镜头的提示词原样复制角色外貌描述
  • 如果连续生成多次后出现漂移,使用原始参考图而非已生成帧来重新锚定
  • 可灵3.0的“图生视频+主体参考”技术可以锁定面部结构跨镜头一致


坑2:光影不统一


解决方案:

  • 同一场景的所有镜头集中生成,保持光照条件一致
  • 剪辑时先统一调色再套风格LUT
  • 在提示词中明确光影方向


坑3:空间逻辑混乱


解决方案:

  • 在提示词中明确空间方位关系(南侧入口、北侧后院、中间庭院)
  • 标注关键地标(门槛、牌匾、廊道)
  • 规定人物移动路线,禁止瞬间移动


ff4a1313-5652-4743-9d38-a05ac200e7b7.jpg

写在最后


AI短剧能不能爆,跟AI做关系不大,重要是内容,要让观众有代入感。


第一,开篇钩子。身份反差、冲突预告、情绪钩子,不要觉得别人写过,这些都是被验证过的公式。


第二,角色锁定。观众认不认得这个角色,比画面精不精美重要得多。人脸漂移一次,观众出戏一次。三视图+图生视频+提示词复用,这三件事做扎实了,角色就稳了。


第三,节奏把控。5-10秒一个镜头,每3-5个镜头一个小反转,全程不留气口让观众划走。


用2.0建立环境和简单运镜,只在关键高潮段落用2.5,既保证了质量,又把积分花在刀刃上。一部60秒的短剧,15-20个镜头,混合使用2.0和2.5,总成本可以控制在几百元以内。


工具在变,成本还会降,但内容本身的规律没变,谁会讲故事,谁就能拿到流量。把上面的模板复制过去,跑一遍流程,你就知道了。


以上内容不代表本平台立场,仅供读者参考