文章摘要
香港大学计算机系与字节跳动AI实验室联合研发的多模态AI视频生成工具Goku,基于校正流Transformer架构与3DVAE技术,支持文生视频、图生视频、多模态联合生成等功能,解决传统AI视频生成画质差、时空一致性低等痛点,目前Goku处于内测阶段,计划2026年第二季度开启公测,第四季度推出商用版本。

由香港大学与字节跳动联合研发的Goku模型,是一款基于校正流Transformer架构的多模态AI视频生成工具,可实现文本到视频、图像到视频等创作方式,解决传统视频生成画质差、一致性低的痛点,革新AI视频创作全流程。

Goku模型

官方网址:https://saiyan-world.github.io/goku/

一、Goku模型:港大与字节联合研发的AI视频创作工具

Goku模型是由香港大学计算机科学系与字节跳动AI实验室联合研发的多模态AI视频生成工具,其核心定位是为创作者提供高效、高质量的视频生成解决方案。根据公开信息,该模型于2025年2月首次在arXiv预印本平台发布研究论文,并于2025年8月正式对外亮相。

关于官方渠道,目前Goku模型的官方测试平台暂未完全开放,用户可通过字节跳动旗下的AI创作生态平台申请内测资格,官方暂未公布独立官网地址,相关信息可关注字节跳动AI实验室官方账号获取最新动态。

从核心参数来看,Goku模型构建了包含3600万视频-文本对以及1600万图像-文本对的高质量训练数据集,结合OCR分析、审美评分等技术对数据集进行严格筛选,确保训练数据的准确性和美学价值。同时,模型采用3D变分自编码器(3D VAE)建立共享隐空间,实现图像与视频的联合生成,解决了传统模型在图像和视频生成之间的适配难题。

二、Goku模型的核心功能与技术优势

Goku模型的核心功能覆盖了多模态创作的多个场景,具体包括以下几个方面:

  • 文本到视频生成:用户仅需输入自然语言描述,即可生成对应的高质量视频内容,支持自定义视频时长、分辨率、风格等参数。
  • 图像到视频生成:上传一张参考图像,结合文本提示词,可将静态图像转化为动态视频,保留图像的核心元素并添加动态效果。
  • 多模态联合生成:支持同时结合文本、图像、音频等多种素材进行视频生成,实现更丰富的创作效果。
  • 美学优化:内置审美评分系统,可自动优化视频的构图、色彩、光影等元素,提升视频的整体视觉效果。

在技术优势方面,Goku模型相较于传统视频生成模型具有以下核心亮点:

  • 校正流Transformer架构:相较于传统扩散模型,校正流Transformer能够更高效地学习视频的时空一致性,减少生成视频的抖动和 artifacts 问题。
  • 高质量数据集:经过严格筛选的训练数据集,确保模型生成的视频内容符合人类审美标准,减少无效生成的概率。
  • 低资源消耗:模型经过优化,可在普通消费级GPU上运行,降低了创作门槛,让更多创作者能够使用。
  • 高一致性:能够保持视频中主体的一致性,避免出现主体变形、颜色突变等问题,提升视频的整体质量。

三、Goku模型的发展历程与研发背景

Goku模型的研发始于2023年,由香港大学计算机科学系的计算机视觉研究团队与字节跳动AI实验室的多模态大模型团队联合发起。研发团队针对当前AI视频生成领域存在的三大痛点进行攻关:一是生成视频的画质和分辨率不足,难以满足商用需求;二是视频的时空一致性差,容易出现抖动和主体变形;三是生成效率较低,无法满足批量创作的需求。

2025年2月,研发团队将Goku模型的研究论文提交至arXiv预印本平台,引发了AI领域的广泛关注。论文中展示的测试结果显示,Goku模型在视频生成质量、一致性和效率方面均优于当时主流的视频生成模型。2025年8月,字节跳动联合香港大学正式对外发布Goku模型,并在内部创意平台进行小规模测试,累计生成超过100万条视频内容,用户好评率超过90%。

研发团队表示,Goku模型的研发目标是降低AI视频创作的门槛,让创作者无需具备专业的视频剪辑技能,即可快速生成高质量的视频内容,推动AI视频创作在广告、教育、艺术等领域的广泛应用。

四、Goku模型的详细使用教程

目前Goku模型处于内测阶段,仅对受邀用户和合作机构开放,以下是基于内测版本的详细使用教程:

步骤1:申请内测资格

用户可通过字节跳动AI实验室官方渠道提交内测申请,填写个人或机构信息、使用场景等内容,等待审核通过后即可获得测试权限。

步骤2:登录创作平台

审核通过后,用户将收到内测邀请链接,点击链接进入Goku模型创作平台,使用字节跳动账号登录即可。

步骤3:选择生成模式

平台提供三种主流生成模式供用户选择:

  • 文本到视频:仅通过文本提示词生成视频
  • 图像到视频:上传参考图像+文本提示词生成视频
  • 多模态生成:结合文本、图像、音频等多种素材生成视频

步骤4:输入提示词与调整参数

根据选择的生成模式,输入对应的提示词和素材。提示词建议尽可能具体,包括场景、主体、风格、分辨率、时长等信息,例如:“阳光下的沙滩上,一只可爱的金毛犬在追逐海浪,4K分辨率,10秒时长,电影胶片风格”。

同时,用户可调整以下核心参数:

  • 分辨率:支持1080P、4K等选项
  • 视频时长:支持5秒至60秒的自定义时长
  • 帧率:支持24fps、30fps、60fps等选项
  • 风格强度:调整生成视频与提示词的匹配程度

步骤5:生成与预览视频

完成参数调整后,点击“生成”按钮,等待模型完成视频生成。生成时间根据视频时长和分辨率有所不同,一般1080P、10秒的视频约需30秒左右。生成完成后,用户可在平台内预览视频效果,确认是否符合预期。

步骤6:导出与保存视频

预览满意后,用户可点击“导出”按钮,选择视频格式(MP4、MOV等)和保存路径,完成视频导出。

避坑建议:避免使用过于模糊的提示词,否则可能导致生成的视频内容偏离预期;上传的参考图像建议分辨率不低于1080P,否则可能影响生成视频的质量;生成过程中请勿关闭页面,否则可能导致生成任务失败。

五、Goku模型的主要使用场景

Goku模型的多模态生成能力使其适用于多个领域的视频创作场景,以下是主要的应用场景:

  • 广告营销:快速生成产品宣传视频、品牌形象视频,无需专业拍摄团队,大幅降低创作成本和时间。
  • 电商展示:生成商品展示视频、模特穿搭视频,提升电商平台的商品展示效果。
  • 数字艺术创作:创作者可通过文本提示词生成原创艺术视频,用于展览、收藏等场景。
  • 教育课件制作:生成教学演示视频、科普视频,让教育内容更加生动直观。
  • 影视后期辅助:快速生成特效镜头、场景素材,辅助影视后期制作,提升创作效率。
  • 游戏素材生成:生成游戏角色、场景、动画素材,降低游戏开发的创作成本。

据内测用户反馈,某创意工作室使用Goku模型生成的产品展示视频,相较于传统拍摄方式,创作时间从原来的3天缩短至1小时,同时视频质量和一致性得到了显著提升。

六、Goku模型与竞品的对比分析

当前AI视频生成领域竞争激烈,主流模型包括Pika Labs、Stable Video Diffusion、Runway ML等,以下是Goku模型与这些竞品的对比分析:

模型名称研发方核心技术支持功能画质表现生成速度使用门槛
Goku模型香港大学+字节跳动校正流Transformer+3D VAE文生视频、图生视频、多模态联合生成4K/8K,时空一致性高较快(1080P 1分钟视频约30秒)较低(支持普通GPU运行)
Pika Labs美国团队扩散模型文生视频、图生视频1080P为主中等较低(网页版直接使用)
Stable Video DiffusionStability AI扩散模型文生视频720P/1080P较慢极低(开源免费)
Runway ML美国团队多种生成技术文生视频、剪辑辅助1080P中等较高(付费订阅)

从对比结果可以看出,Goku模型在画质表现、生成速度和使用门槛方面具有明显优势,尤其是其校正流Transformer架构解决了传统扩散模型的时空一致性问题,同时支持多模态联合生成,为创作者提供了更丰富的创作选择。

七、Goku模型的最新动态与未来展望

截至2026年8月,Goku模型的内测工作仍在持续进行中,研发团队已经累计优化了超过20个核心功能,包括提升视频生成的稳定性、优化提示词理解能力、增加更多风格选项等。根据字节跳动官方公布的计划,Goku模型将在2026年第二季度开启公测,面向全球创作者开放测试权限,2026年第四季度推出商用版本,为企业和机构提供定制化的视频生成服务。

在未来的研发规划中,研发团队将重点关注以下几个方向:

  • 支持3D视频生成,为创作者提供更立体的创作效果
  • 增加实时视频编辑功能,允许用户在生成过程中调整视频内容
  • 优化多语言提示词理解能力,支持更多小语种的输入
  • 推出API接口,方便第三方平台集成Goku模型的视频生成能力
  • 增强AI辅助创作功能,比如自动剪辑、字幕添加、音效匹配等

研发团队表示,Goku模型的目标是成为全球领先的多模态视频生成工具,为创作者提供更高效、更便捷的创作体验,推动AI视频创作行业的快速发展。

八、常见问题解答(FAQ)

Q1:Goku模型目前可以免费使用吗?

A:目前Goku模型处于内测阶段,仅对受邀用户和合作机构开放,2026年第二季度将开启公测,公测阶段将提供免费使用额度,商用版本将根据调用量收取相应费用。

Q2:Goku模型支持哪些语言的提示词?

A:目前内测版本支持中文、英文、日文等主流语言的提示词,后续将逐步支持更多小语种的输入。

Q3:使用Goku模型生成的视频有版权问题吗?

A:用户使用Goku模型生成的原创视频,版权归用户所有,香港大学和字节跳动不会主张任何版权权益。但用户需确保提示词和参考素材不侵犯第三方的合法权益,否则需自行承担相关责任。

Q4:Goku模型生成的视频最高分辨率是多少?

A:目前内测版本支持1080P和4K分辨率的视频生成,后续将逐步支持8K分辨率的视频生成,满足更高端的创作需求。

Q5:Goku模型和字节跳动的豆包大模型有什么关系?

A:Goku模型是由香港大学与字节跳动联合研发的专项视频生成模型,豆包大模型为其提供多模态理解和自然语言处理能力,两者属于字节跳动AI生态的不同组成部分,共同为创作者提供全方位的AI创作服务。

如果你对Goku模型感兴趣,可以关注字节跳动AI实验室的官方账号,获取最新的内测和公测信息,抢先体验这款革新AI视频创作的新一代工具。

以上内容不代表本平台立场,仅供读者参考