阿里Wan3.0视频大模型公测:30秒生成+多格式+真实感升级

8月6日,旗下的Wan 3.0视频生成大模型正式开启公测。这款模型在多个核心维度完成了全面升级,不再局限于传统的单镜头视频生成,而是进化成为了全能的信息创作载体。
首先在输入模态上实现了重大突破:除了原本支持的文本、图片、音频、视频四种基础格式外,模型首次加入了对doc、xls、ppt、pdf、md等多种文档类文件的支持,单个文件或链接的大小不超过100MB,页数限制在50页以内。用户只需要上传对应文档并搭配提示词,就能快速生成教学课件、产品演示片、业务汇报视频等实用内容,比如上传一份智能眼镜的产品演示PPT,就能一键生成完整的品牌形象宣传视频。这背后离不开模型强大的提示词工程与指令遵循能力,提示词已经成为调度输入内容、控制最终表达效果的核心中枢。
生成时长的升级也是本次公测的一大亮点。Wan 3.0支持单次生成30秒的完整视频,能够让创作者从容安排叙事节奏,连续运镜、一镜到底等复杂的镜头语言都可以得到充分展现,让AI视频从“生成单个镜头”升级为“讲述完整的故事”。除此之外,模型还搭载了智能时长推荐功能,可以根据用户输入的提示词自动匹配合适的视频时长,进一步降低了创作门槛。
随着AI视频工具向生产力工具转型,用户对视频的要求也从“画面清晰”升级为“真实可信”。Wan 3.0在真实世界还原上做出了针对性优化:生成的人物形象力求千人千面,能够细致刻画五官与皮肤细节,人物的情绪表达自然克制,微表情与肢体动作能够形成自然联动;在全能参考任务中,角色设定、道具细节、声音风格、空间关系以及整体创作风格等细粒度的要求,都能够得到稳定的保持。就连图表、数据界面等数字化信息的视觉呈现,也能够同步提升质感,让整体画面更加专业美观。
此外,Wan 3.0的视频编辑能力也得到了大幅提升,用户可以对生成后的视频画面、剧情走向以及台词内容进行修改调整。不过目前模型仍存在一定的优化空间,比如在声音质感与文字准确度方面还有提升的余地。
即日起,Wan 3.0已经在多家合作的AI创作平台开启公测,同时在部分主流AI创作APP开启灰度测试。API接口的定价按照分辨率分为三档:480P为0.3元每秒,720P为0.6元每秒,1080P为1.2元每秒,全量开放的API接口也将在近期正式推出。

