港大与字节跳动联合研发Goku模型 革新AI视频创作新方式

由香港大学与字节跳动联合研发的Goku模型,是一款基于校正流Transformer架构的多模态AI视频生成工具,可实现文本到视频、图像到视频等创作方式,解决传统视频生成画质差、一致性低的痛点,革新AI视频创作全流程。

官方网址:https://saiyan-world.github.io/goku/
一、Goku模型:港大与字节联合研发的AI视频创作工具
Goku模型是由香港大学计算机科学系与字节跳动AI实验室联合研发的多模态AI视频生成工具,其核心定位是为创作者提供高效、高质量的视频生成解决方案。根据公开信息,该模型于2025年2月首次在arXiv预印本平台发布研究论文,并于2025年8月正式对外亮相。
关于官方渠道,目前Goku模型的官方测试平台暂未完全开放,用户可通过字节跳动旗下的AI创作生态平台申请内测资格,官方暂未公布独立官网地址,相关信息可关注字节跳动AI实验室官方账号获取最新动态。
从核心参数来看,Goku模型构建了包含3600万视频-文本对以及1600万图像-文本对的高质量训练数据集,结合OCR分析、审美评分等技术对数据集进行严格筛选,确保训练数据的准确性和美学价值。同时,模型采用3D变分自编码器(3D VAE)建立共享隐空间,实现图像与视频的联合生成,解决了传统模型在图像和视频生成之间的适配难题。
二、Goku模型的核心功能与技术优势
Goku模型的核心功能覆盖了多模态创作的多个场景,具体包括以下几个方面:
- 文本到视频生成:用户仅需输入自然语言描述,即可生成对应的高质量视频内容,支持自定义视频时长、分辨率、风格等参数。
- 图像到视频生成:上传一张参考图像,结合文本提示词,可将静态图像转化为动态视频,保留图像的核心元素并添加动态效果。
- 多模态联合生成:支持同时结合文本、图像、音频等多种素材进行视频生成,实现更丰富的创作效果。
- 美学优化:内置审美评分系统,可自动优化视频的构图、色彩、光影等元素,提升视频的整体视觉效果。
在技术优势方面,Goku模型相较于传统视频生成模型具有以下核心亮点:
- 校正流Transformer架构:相较于传统扩散模型,校正流Transformer能够更高效地学习视频的时空一致性,减少生成视频的抖动和 artifacts 问题。
- 高质量数据集:经过严格筛选的训练数据集,确保模型生成的视频内容符合人类审美标准,减少无效生成的概率。
- 低资源消耗:模型经过优化,可在普通消费级GPU上运行,降低了创作门槛,让更多创作者能够使用。
- 高一致性:能够保持视频中主体的一致性,避免出现主体变形、颜色突变等问题,提升视频的整体质量。
三、Goku模型的发展历程与研发背景
Goku模型的研发始于2023年,由香港大学计算机科学系的计算机视觉研究团队与字节跳动AI实验室的多模态大模型团队联合发起。研发团队针对当前AI视频生成领域存在的三大痛点进行攻关:一是生成视频的画质和分辨率不足,难以满足商用需求;二是视频的时空一致性差,容易出现抖动和主体变形;三是生成效率较低,无法满足批量创作的需求。
2025年2月,研发团队将Goku模型的研究论文提交至arXiv预印本平台,引发了AI领域的广泛关注。论文中展示的测试结果显示,Goku模型在视频生成质量、一致性和效率方面均优于当时主流的视频生成模型。2025年8月,字节跳动联合香港大学正式对外发布Goku模型,并在内部创意平台进行小规模测试,累计生成超过100万条视频内容,用户好评率超过90%。
研发团队表示,Goku模型的研发目标是降低AI视频创作的门槛,让创作者无需具备专业的视频剪辑技能,即可快速生成高质量的视频内容,推动AI视频创作在广告、教育、艺术等领域的广泛应用。
四、Goku模型的详细使用教程
目前Goku模型处于内测阶段,仅对受邀用户和合作机构开放,以下是基于内测版本的详细使用教程:
步骤1:申请内测资格
用户可通过字节跳动AI实验室官方渠道提交内测申请,填写个人或机构信息、使用场景等内容,等待审核通过后即可获得测试权限。
步骤2:登录创作平台
审核通过后,用户将收到内测邀请链接,点击链接进入Goku模型创作平台,使用字节跳动账号登录即可。
步骤3:选择生成模式
平台提供三种主流生成模式供用户选择:
- 文本到视频:仅通过文本提示词生成视频
- 图像到视频:上传参考图像+文本提示词生成视频
- 多模态生成:结合文本、图像、音频等多种素材生成视频
步骤4:输入提示词与调整参数
根据选择的生成模式,输入对应的提示词和素材。提示词建议尽可能具体,包括场景、主体、风格、分辨率、时长等信息,例如:“阳光下的沙滩上,一只可爱的金毛犬在追逐海浪,4K分辨率,10秒时长,电影胶片风格”。
同时,用户可调整以下核心参数:
- 分辨率:支持1080P、4K等选项
- 视频时长:支持5秒至60秒的自定义时长
- 帧率:支持24fps、30fps、60fps等选项
- 风格强度:调整生成视频与提示词的匹配程度
步骤5:生成与预览视频
完成参数调整后,点击“生成”按钮,等待模型完成视频生成。生成时间根据视频时长和分辨率有所不同,一般1080P、10秒的视频约需30秒左右。生成完成后,用户可在平台内预览视频效果,确认是否符合预期。
步骤6:导出与保存视频
预览满意后,用户可点击“导出”按钮,选择视频格式(MP4、MOV等)和保存路径,完成视频导出。
避坑建议:避免使用过于模糊的提示词,否则可能导致生成的视频内容偏离预期;上传的参考图像建议分辨率不低于1080P,否则可能影响生成视频的质量;生成过程中请勿关闭页面,否则可能导致生成任务失败。
五、Goku模型的主要使用场景
Goku模型的多模态生成能力使其适用于多个领域的视频创作场景,以下是主要的应用场景:
- 广告营销:快速生成产品宣传视频、品牌形象视频,无需专业拍摄团队,大幅降低创作成本和时间。
- 电商展示:生成商品展示视频、模特穿搭视频,提升电商平台的商品展示效果。
- 数字艺术创作:创作者可通过文本提示词生成原创艺术视频,用于展览、收藏等场景。
- 教育课件制作:生成教学演示视频、科普视频,让教育内容更加生动直观。
- 影视后期辅助:快速生成特效镜头、场景素材,辅助影视后期制作,提升创作效率。
- 游戏素材生成:生成游戏角色、场景、动画素材,降低游戏开发的创作成本。
据内测用户反馈,某创意工作室使用Goku模型生成的产品展示视频,相较于传统拍摄方式,创作时间从原来的3天缩短至1小时,同时视频质量和一致性得到了显著提升。
六、Goku模型与竞品的对比分析
当前AI视频生成领域竞争激烈,主流模型包括Pika Labs、Stable Video Diffusion、Runway ML等,以下是Goku模型与这些竞品的对比分析:
| 模型名称 | 研发方 | 核心技术 | 支持功能 | 画质表现 | 生成速度 | 使用门槛 |
|---|---|---|---|---|---|---|
| Goku模型 | 香港大学+字节跳动 | 校正流Transformer+3D VAE | 文生视频、图生视频、多模态联合生成 | 4K/8K,时空一致性高 | 较快(1080P 1分钟视频约30秒) | 较低(支持普通GPU运行) |
| Pika Labs | 美国团队 | 扩散模型 | 文生视频、图生视频 | 1080P为主 | 中等 | 较低(网页版直接使用) |
| Stable Video Diffusion | Stability AI | 扩散模型 | 文生视频 | 720P/1080P | 较慢 | 极低(开源免费) |
| Runway ML | 美国团队 | 多种生成技术 | 文生视频、剪辑辅助 | 1080P | 中等 | 较高(付费订阅) |
从对比结果可以看出,Goku模型在画质表现、生成速度和使用门槛方面具有明显优势,尤其是其校正流Transformer架构解决了传统扩散模型的时空一致性问题,同时支持多模态联合生成,为创作者提供了更丰富的创作选择。
七、Goku模型的最新动态与未来展望
截至2026年8月,Goku模型的内测工作仍在持续进行中,研发团队已经累计优化了超过20个核心功能,包括提升视频生成的稳定性、优化提示词理解能力、增加更多风格选项等。根据字节跳动官方公布的计划,Goku模型将在2026年第二季度开启公测,面向全球创作者开放测试权限,2026年第四季度推出商用版本,为企业和机构提供定制化的视频生成服务。
在未来的研发规划中,研发团队将重点关注以下几个方向:
- 支持3D视频生成,为创作者提供更立体的创作效果
- 增加实时视频编辑功能,允许用户在生成过程中调整视频内容
- 优化多语言提示词理解能力,支持更多小语种的输入
- 推出API接口,方便第三方平台集成Goku模型的视频生成能力
- 增强AI辅助创作功能,比如自动剪辑、字幕添加、音效匹配等
研发团队表示,Goku模型的目标是成为全球领先的多模态视频生成工具,为创作者提供更高效、更便捷的创作体验,推动AI视频创作行业的快速发展。
八、常见问题解答(FAQ)
Q1:Goku模型目前可以免费使用吗?
A:目前Goku模型处于内测阶段,仅对受邀用户和合作机构开放,2026年第二季度将开启公测,公测阶段将提供免费使用额度,商用版本将根据调用量收取相应费用。
Q2:Goku模型支持哪些语言的提示词?
A:目前内测版本支持中文、英文、日文等主流语言的提示词,后续将逐步支持更多小语种的输入。
Q3:使用Goku模型生成的视频有版权问题吗?
A:用户使用Goku模型生成的原创视频,版权归用户所有,香港大学和字节跳动不会主张任何版权权益。但用户需确保提示词和参考素材不侵犯第三方的合法权益,否则需自行承担相关责任。
Q4:Goku模型生成的视频最高分辨率是多少?
A:目前内测版本支持1080P和4K分辨率的视频生成,后续将逐步支持8K分辨率的视频生成,满足更高端的创作需求。
Q5:Goku模型和字节跳动的豆包大模型有什么关系?
A:Goku模型是由香港大学与字节跳动联合研发的专项视频生成模型,豆包大模型为其提供多模态理解和自然语言处理能力,两者属于字节跳动AI生态的不同组成部分,共同为创作者提供全方位的AI创作服务。
如果你对Goku模型感兴趣,可以关注字节跳动AI实验室的官方账号,获取最新的内测和公测信息,抢先体验这款革新AI视频创作的新一代工具。

