文章摘要
近期,AI创作团队推出新一代视频生成模型Seedance 2.5,在长叙事、多模态参考与编辑能力上实现突破。长叙事能力提升单次生成时长,优化衔接过渡;多模态参考能力可精准还原创意;精准编辑能力支持按时间戳编辑。此外,该模型拓展至教育、工业等场景,虽有优化空间,但已登陆多个平台,企业级API服务也将接入主流平台。

近期,AI创作团队正式推出新一代视频生成模型Seedance 2.5,该模型延续了前代统一的多模态音视频联合生成架构,核心在长叙事能力、多模态参考能力与编辑能力三个方向实现了突破性升级,满足用户从“生成单个片段”到“完成完整创作”的需求变化。

长叙事能力:从单片段到完整创作

Seedance 2.5将单次视频生成时长从15秒提升至30秒,同时优化了镜头衔接与场景过渡逻辑,能够在30秒内完成从铺垫、推进到收尾的完整叙事,而非简单延续单一画面。例如在创作歌手登台演出的片段时,模型可以完整呈现歌手在化妆间与工作人员互动、穿过后台走廊与伴舞汇合、最终登台表演的完整流程。

一镜到底演唱会片段

T2V prompt

一镜到底手持稳定器跟拍,镜头从红色厚重幕布缝隙缓缓推进,进入暖色后台化妆间。年轻女歌手背对镜头整理耳机,工作人员提醒她准备登台。她回头看向镜头,开始唱起 City Pop。镜头后退跟拍,歌手穿过幕布进后台通道,与舞伴自然互动,一位工作人员把麦克风递给她。随后歌手与舞伴登上舞台,镜头绕至背面,红黑舞美、LED 屏、追光、烟雾与反光地板逐渐展开。镜头最终拉远至体育馆全景,呈现满场观众、灯牌、荧光棒与欢呼声,营造年轻自由的演唱会高潮氛围

凭借多轮延长能力,用户可以在已生成的视频基础上自然衔接后续镜头,且在延长过程中保持主体特征、场景环境与叙事节奏的连贯性,最终生成数分钟拥有统一视听语言的连贯内容,省去了拆分镜头、反复拼接与处理衔接的繁琐步骤。

多轮延长片段

R2V prompt

延长视频,衔接 @视频 1 画面内容和主体继续生成一个 30 秒的视频,保持人物主体、场景、画面风格、声音音效一致。小男孩抱着足球沿车厢跑,地铁停稳后侧边门打开,他立刻冲出,男主紧追。两人一路穿过站台跑到街上,惊动街边路人,男主最终追上并抓住他,小男孩委屈抬头,男主慢慢消气,摸摸他的头,露出无奈笑容

在画面呈现上,模型能够实现更自然的运镜衔接,即使多次切换镜头,主体依然保持稳定,音画始终对齐,让长视频的生成结果更连贯。比如在京剧表演场景中,镜头可以伴随主角旋转水袖的动作完成优雅的环绕运镜,主体与背景的呈现始终保持一致,水袖在空中的摆动也更符合物理规律,形成自然的弧线。

京剧水袖环绕运镜

R2V prompt

16:9 宽幅电影级质感,一镜到底,丝滑运镜,无剪辑。场景参考 @图片 4。0-5 秒:@图片 2 霸王近景开场,镜头缓慢环绕上半身并过渡至中景;霸王旋身翻转,随后身体与靠旗从镜头前快速掠过,形成自然遮挡,镜头顺势绕至 @图片 1 虞姬身侧。6-10 秒:镜头稳定环绕 @图片 1 虞姬中景,跟随水袖动作完成环绕运镜虞姬抬臂、挑腕、展袖、半转身。最后收袖定格,侧身看向霸王。11-20 秒:@图片 3 武生出场完成后空翻腾动作,随后霸王居中,武生在对侧进退攻防。虞姬位于霸王侧后方以水袖配合,形成刚柔对比。镜头从武生中近景缓慢后拉至舞台大景,结尾三人面向观众同步京剧落幕亮相

针对视频生成中常见的“油腻感”问题,Seedance 2.5对物体材质、人物肤质与眼神、光影、画面饱和度等细节进行了系统性优化,同时减少了字幕与背景音乐不受控的情况,让最终成片更接近实拍的影视质感。

多模态参考能力:精准还原创作创意

Seedance 2.5的多模态参考能力大幅升级,单次可支持最多30张图片、10段视频与10段音频作为创作参考素材。更多数量、不同类型的参考素材,能够帮助模型更精准地理解用户的创作意图,生成包含多主体、多场景、多镜头变化的复杂视频内容。

模型可以综合解析不同参考素材中的画面构图、场景风格、人物形象、道具细节等元素,并按照指令将这些参考内容融入生成视频中。即使在多人同框、群像叙事等复杂场景中,也能同时还原多个人物的形象与声音,保持各主体特征的稳定性。

音乐会多主体同框

R2V prompt

30 秒音乐会片段,16:9 横屏,电影感写实,真实音乐厅光影,暖金色舞台灯,正式古典音乐会氛围。场景 @图一,钢琴家参考 @图二,大提琴参考 @图三,小提琴参考 @图四,主唱参考 @图五,管弦等其他乐队参考 @图六到图十,合唱团参考图十一到图十四,观众席参考 @图十五到图十八。主唱舞台中央走向前沿,钢琴家在钢琴旁,乐队分布两侧与后方,合唱团在舞台后方。开场高位俯拍音乐厅全景,钢琴家落键,主唱进入追光演唱,镜头自然带过小提琴、大提琴与管弦乐队,小提琴明亮,大提琴温暖。后段合唱团加入,主唱与第一排观众短暂眼神交流,观众微笑点头。结尾镜头后移,演唱结束,观众跟随鼓掌

模型还提升了白模参考、运动参考、创意参考等各类参考能力,让画面中的主体、动作、运镜更可控。用户可以用无纹理3D模型搭建画面的空间结构、主体姿态、运动轨迹与镜头机位,再让模型参考这套结构生成视频,让复杂镜头的构图与调度更接近预期。同时,模型增强了光照控制能力,通过白模的空间信息,生成符合真实物理规律的光照效果,包括光源方向、色温、强度、阴影投射等细节。

白模参考成片

R2V prompt

参考 @白模 1 的运镜、镜头节奏、景别变化、主体轨迹和镜头调度。参考 @图片 2 的角色外形、场景、材质、光照、色彩和童话氛围,将白模渲染为梦幻温暖、儿童幻想感、3D 动画短片。剧情依次为:幻想天空飞行→云海神兽伴飞→俯冲入海→鳐鱼海底穿梭→镜面时空裂缝→宇宙摘星→幻化回房间→爸爸盖被→合上绘本定格

精准编辑能力:灵活把控创作细节

在视频创作过程中,用户往往需要精准控制生成节奏,并在生成后持续打磨细节。比如某个动作在第几秒出现、镜头在什么时间切换,或是某片段中的角色、动作是否需要调整,这些细节直接影响最终成片的效果。

Seedance 2.5支持通过时间戳精准编辑音视频内容。在生成阶段,用户可以通过指令控制特定时间段内的剧情、画面视角、运镜风格与整体节奏;生成完成后,用户还可以针对指定片段中的角色、动作、声音或剧情进行定向修改,且保持修改前后的连贯性与真实感。

模型还进一步提升了绿幕编辑、视角与运镜编辑、参考编辑等多种编辑能力。在绿幕编辑场景中,模型不仅可以在保持主体不变的前提下替换不同场景、讲述不同故事,还能基于不同场景的物理规则渲染人物身上的物理效果,包括衣服飘动方向、头发状态、步态节奏、光影等,让主体与场景更加和谐统一。

绿幕编辑

R2V prompt

把 @视频 1 绿幕背景渲染场景、障碍、服装和配角:0-4 秒:户外训练,障碍换石头、砖块、轮胎、木箱;4-10 秒:休息室,朋友鼓励;10-15 秒:国际赛场,训练杆换原创防守球员和门将,主角进球。整体写实电影级

运镜编辑

R2V prompt

编辑 @视频 1,保持人物、动作及画风不变,仅调整运镜。15 秒分段运镜设计:0-4 秒,微型 FPV 贴锅穿行,跟随弹起的吐司后横甩至咖啡;4-7 秒,推近并沿锅边横移,跟随煎蛋翻起落回;7-11 秒,急速升至顶视角,匀速下压扫过餐盘和钥匙;11-15 秒,手持近镜跟随双手快速横甩,最后推近早餐,再拉回双人中景。全程连贯稳定

产业场景拓展:覆盖多领域创作需求

随着模型能力的不断提升,Seedance 2.5也逐步拓展至教育、工业等多个产业场景,为不同行业的创作需求提供支持。

在教育领域,该模型可以将课本背后的历史背景、人物故事与科学原理转化为生动的视频内容,把静态的知识讲解转变为更具沉浸感的动态演示。同时,模型可以帮助教师高效制作教学视频,将抽象的科学原理、历史事件、实验过程等内容转化为直观的动态画面,已有教育工具平台开始接入使用该模型的教学创作功能。

豆包课堂场景示例

R2V prompt

东方写意风格。南宋临安街景,热闹的街上几个孩子边跑边闹,孩子们嘴里张嘴念着"蓦然回首,那人却在,灯火阑珊处"。镜头始终跟随孩子们奔跑,带过热闹的街景。镜头上摇,此人正是 @图片 1 辛弃疾。辛弃疾回头,远处是在灯火阑珊中的男子,镜头连贯

在工业制造、具身智能和自动驾驶等领域,模型可以生成高质量的合成视频数据,用于训练机器人的感知与操作能力,也可以用于工业仿真、流程培训和设备演示。在自动驾驶场景中,模型还可以模拟极端天气、复杂路况等低频场景,为系统测试与训练提供更多样的样本数据。

汽车拼装白模渲染

R2V prompt

参考 @白模 1 的运镜、构图、景别、空间关系、零件位置、模型结构、装配顺序和运动轨迹。参考 @图片 1 的材质、光照、色彩、反射和氛围,将白模渲染为高端真实汽车拼装片段

研发团队也表示,目前模型在复杂运动的物理合理性、极多主体交互场景的稳定性上仍有优化空间,未来将继续探索更长时长的连贯叙事、更流畅的生成与编辑体验,以及对现实物理规律的更强理解能力。

目前,Seedance 2.5已陆续登陆国内多个AI创作工具平台,企业级API服务也将在近期接入主流AI服务平台,为更多用户提供便捷的视频创作支持。

以上内容不代表本平台立场,仅供读者参考