文章摘要
2026 年 8 月 6 日,阿里云全新一代视频生成模型 Wan3.0 开启公测。它基于扩散 Transformer 架构,单次可生成 30 秒视频,首次支持多种文档格式输入,在多方面全面升级。该模型在多个平台公测,API 按秒计费。与竞品相比,它有文档输入、价格和叙事完整性等优势,应用场景广泛,不过声音质感和文字识别准确性待提升。

2026年8月6日,阿里云正式宣布全新一代视频生成模型Wan3.0开启公测。阿里云Wan3.0视频生成大模型公测标志着视频生成技术从短片段走向完整叙事的关键转折——单次可生成30秒视频,首次支持doc、xls、ppt、pdf、md等文档格式输入,将办公素材直接转化为动态视频内容。该模型在生成时长、万能创作、全能参考与真实感等维度全面升级,正从“生成一个镜头”走向“讲述一段完整的故事”。

阿里云Wan3.0公测

一、Wan3.0的诞生背景与技术演进

1.1 万相模型家族的发展历程

阿里云Wan系列(通义万相)视频生成模型自2023年7月首次推出以来,经历了持续的迭代升级。从Wan1.0到Wan3.0,万相模型家族一共迭代了8个版本。Wan2.1是首个开源的Wan版本,于2025年2月发布,提供1.3B和14B两个参数版本。Wan2.2于2025年7至8月间推出,是一个纯视频生成pipeline,涵盖文本到视频、图像到视频、语音到视频等多种任务。

Wan2.7是Wan3.0公测之前的API旗舰版本,支持文本到视频、图像到视频(首尾帧控制)、多角色参考到视频(含声音克隆)以及基于指令的视频编辑,最高支持1080P/15秒输出。Wan3.0的单次生成时长从Wan2.7的15秒翻倍至30秒。

1.2 技术架构深度解析

Wan3.0基于扩散Transformer架构。这一技术路线将压缩后的隐空间与扩散Transformer模块相结合,形成了“Wan-VAE压缩+DiT扩散”的核心架构。Video VAE负责将视频压缩为时空隐空间表征,Diffusion Transformer在隐空间中进行扩散去噪,而T5文本编码器则将文本提示词转换为语义向量以引导生成过程。

在模型参数方面,Wan系列包含1.3B和14B两个主要参数版本,其中1.3B版本仅需约8.19GB的显存需求,可适配消费级GPU。关于Wan3.0的具体参数规模,业界存在不同说法——有报道提及27B参数的MoE架构(含14B激活参数),也有提及60B参数规模。无论具体数字如何,Wan3.0在模型规模上代表了通义万相系列的重大跃升。

二、核心功能与技术突破

2.1 单次30秒视频生成

Wan3.0最直观的升级在于单段视频生成时长从15秒翻倍至30秒。这一突破追平了字节跳动Seedance 2.5的生成时长。更长的成片时长支撑连续运镜、一镜到底等复杂镜头语言,创作者可完成完整故事叙事,摆脱短镜头碎片化局限。

Wan3.0对长序列的原生支持允许创作者执行复杂的摄像机运动和连续不间断的镜头。从“生成一个镜头”到“讲述一段完整的故事”,这一跃迁使AI视频生成真正具备了叙事能力。

2.2 智能时长与视频延长

Wan3.0配套了智能时长推荐功能,能够根据用户提示词自动推荐合适的成片长度。同时搭载视频延伸工具,支持对已有视频内容拓展剧情、丰富镜头。搭配视频延长功能,用户可以轻松延展故事走向与剧情发展,让创意自然生长。

2.3 多模态文档输入——“万物皆可生视频”

Wan3.0在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档格式输入。支持的输入格式覆盖doc、xls、ppt、pdf、txt、key、pages、numbers以及md,最多输入一个文件或链接,文件大小不超过100MB,页数不超过50页。

这一功能意味着教学课件、产品演示、动态图表、业务汇报等办公素材可以直接转化为视频。例如,上传一个智能眼镜产品的PPT,配上提示词,就能得到一个完整的形象片。Wan3.0正从视频生成模型跃迁为信息的表达载体。

2.4 人像“千人千面”与真实感还原

Wan3.0在画面真实度与内容一致性方面进行了重点优化。针对过往生成人像同质化、质感失真问题,Wan3.0文生视频人像模块实现了“千人千面”,精细还原五官、皮肤纹理,人物微表情、肢体动作、情绪表达相互匹配,多人同框场景也能区分独立人物神态。

在全能参考任务中,Wan3.0可精准复刻参考细节,保持角色、道具、声音、空间关系、风格等关键维度的一致性。对于角色而言,五官、发型发色、形体、服饰、配饰等细粒度特征均可稳定保持;对于道具,多角度外观、硬件结构、Logo、材质细节均保持稳定;对于场景,准确处理角色站位与机位视角的关系;对于风格,精准渲染影视拍摄调性,多风格创作时不易发生风格混淆。

2.5 视频编辑能力升级

Wan3.0的视频编辑能力也有大幅提升,支持修改画面、剧情与台词。持续完善的编辑能力减少了反复抽卡的情况。不过官方也坦言,当前声音质感与文字识别准确度仍存在优化空间。

三、公测渠道与商业化定价

3.1 公测平台

即日起,Wan3.0在以下平台开启公测:

  • 阿里云百炼(Alibaba Cloud Model Studio)
  • 万镜一刻
  • 万相官网
  • 千问创作PC端(c.qianwen.com)
  • IF STUDIO
  • 堆友

此外,千问APP已灰度开放Wan3.0的体验入口。API接口将于近期全量开放。

3.2 API定价

Wan3.0提供三种分辨率的API服务,采用按秒计费模式:

分辨率 API价格(元/秒)
480P 0.3
720P 0.6
1080P 1.2

四、行业横向对比

4.1 主流视频生成模型对比

对比维度 阿里云Wan3.0 字节跳动Seedance 2.5 快手可灵Kling 3.0 HappyHorse 1.0
单次最大时长 30秒 30秒 10秒 3-15秒
最高分辨率 1080P 4K 1080P 1080P
多模态输入 文本/图片/音频/视频/文档 图文音视 图文音视 图文/视频参考
文档格式支持 doc/xls/ppt/pdf/md等 不支持 不支持 不支持
API计价方式 0.3-1.2元/秒 42-70元/百万tokens 约0.075美元/秒起 约0.9元/秒起
视频编辑 支持画面/剧情/台词修改 支持多轮延长 支持音画同步 支持多工作流

4.2 差异化竞争优势分析

Wan3.0相较竞品的核心差异化优势体现在三个方面:

文档输入能力:Wan3.0是当前主流视频生成模型中唯一原生支持办公文档格式输入的模型。这一能力将视频生成的入口从创意领域拓展到了办公场景,使教学课件、产品演示、动态图表、业务汇报等场景的生产效率得到质的提升。

价格竞争力:Wan3.0的API定价为480P/720P/1080P分别0.3/0.6/1.2元/秒。以30秒1080P视频为例,成本约为36元。相比Seedance 2.5的token计费体系(不含视频输入70元/百万tokens),Wan3.0在价格上具有一定优势。

叙事完整性:30秒的单次生成时长配合智能时长推荐和视频延长功能,使Wan3.0能够支撑完整的叙事结构。从“生成一个镜头”到“讲述一段完整的故事”的定位转变,使Wan3.0在内容创作领域具有更广泛的应用空间。

五、应用场景与创作实践

5.1 办公场景

Wan3.0的文档输入能力使其在办公场景中具有独特价值:

  • 教学课件制作:将PPT演示文稿转化为带有动画演示的讲解视频
  • 产品演示:将产品手册生成包含3D模型展示的宣传片
  • 业务汇报:将Excel数据图表呈现为交互式动态图表
  • 动态图表:将PDF报告文档转化为包含动态元素的视频

5.2 创意创作

在创意创作领域,Wan3.0的30秒长视频能力和“千人千面”人像生成提供了更多可能性:

  • 电影级短片创作:30秒时长支撑完整的叙事结构
  • 音乐视频制作:配合节奏生成连贯的视觉叙事
  • 品牌形象片:上传产品介绍文本或PPT,生成完整的品牌形象片

5.3 行业应用

Wan3.0还可作为技术开发者的强大工具,用于生成逼真的模拟视频以训练自动驾驶汽车和机器人系统。从电影制作人到短视频创作者,从营销人员到教育工作者,Wan3.0覆盖了广泛的行业需求。

六、技术局限与未来展望

6.1 当前局限

尽管Wan3.0在多项指标上实现了突破,但官方也坦言当前版本在以下方面仍有优化空间:

  • 声音质感:音频生成的质量和真实感仍需提升
  • 文字准确度:画面中文字识别的准确性有待改进

6.2 行业趋势

2026年是视频生成大模型快速发展的关键年份。字节跳动Seedance系列从2.0迭代至2.5,快手可灵推出3.0版本,MiniMax发布H3(Hailuo 3),阿里云则通过Wan3.0将单次生成时长从15秒提升至30秒。视频生成大模型正从“玩具”向“工具”加速演进。

Wan3.0的发布标志着阿里云在视频生成领域的战略布局进一步深化。从Wan1.0到Wan3.0的8个版本迭代,体现了阿里云在大模型领域持续投入的决心。文档输入这一差异化功能的引入,则展现了阿里云对视频生成应用场景的独特理解——让视频生成真正融入日常工作流。

七、常见问题(FAQ)

Q1:阿里云Wan3.0视频生成大模型公测如何参与?

用户可通过阿里云百炼、万镜一刻、万相官网、千问创作PC端、IF STUDIO和堆友直接体验,千问APP已灰度开放。

Q2:Wan3.0支持哪些输入格式?

Wan3.0支持文本、图片、音频、视频四种基础模态,以及doc、xls、ppt、pdf、txt、key、pages、numbers、md等文档格式。

Q3:Wan3.0单次最多能生成多长的视频?

Wan3.0单次可生成最长30秒的视频。

Q4:Wan3.0的API如何收费?

480P、720P、1080P三种分辨率的API价格分别为每秒0.3元、0.6元和1.2元。

Q5:Wan3.0与Wan2.7相比有哪些主要升级?

单次生成时长从15秒翻倍至30秒,首次支持文档格式输入,人像生成实现“千人千面”,全能参考的一致性大幅提升。

Q6:Wan3.0的视频编辑功能支持哪些操作?

Wan3.0支持修改画面、剧情与台词。

Q7:Wan3.0当前存在哪些不足?

官方指出声音质感与文字识别准确度方面仍有进步空间。

Q8:Wan3.0的API接口何时全量开放?

API接口将于近期全量开放。

以上内容不代表本平台立场,仅供读者参考