文章摘要
过去视频生成模型局限于输出固定视频,可交互实时世界模型虽有进展但存在有画无声的短板。如今某团队联合多机构发布实时可交互音视频世界模型HelixWorld 1.0,该模型可实现声画同步响应操作。它通过四步技术链路实现,其权重和代码将开源,后续还有三个进化方向,有望改写多领域场景。

过去两年,视频生成领域的竞争已经从画面参数内卷延伸到了交互体验的升级。从4K分辨率到物理一致性,行业玩家不断刷新着视觉真实度的上限,但传统视频生成模型始终存在一个核心局限:输出的永远是一段固定预设的成品视频,用户无法干预剧情、调整视角,更不能改变下一秒的画面内容,只能作为被动的观看者。

如今,可交互的实时世界模型正在打破这种局限,多家头部团队都在推进相关技术,初步实现了可自由探索、实时交互的视觉场景,画面质量、帧率、持续生成时间和稳定性都有了显著提升。不过这类模型仍存在一个致命短板:当你戴上耳机沉浸式体验时,会发现这片虚拟世界一片寂静——车辆驶过没有轰鸣,开门没有铰链声,野兽低吼也听不到任何声响,有画无声,终究算不上完整的世界。

现在,这个短板终于被补上了。某团队联合来自香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员,正式发布了实时可交互音视频世界模型HelixWorld 1.0。用户仅需输入一张图片和一句提示词,就能展开一个持续动态生成的虚拟世界,不再是坐着观看,而是可以自由行走、转身,每一次操作都会让画面和声音同步响应,走到哪里,世界就延伸到哪里。

这次HelixWorld补上的,是世界对用户行动的完整实时响应,远不止简单添加一条音轨。在可交互的虚拟世界中,声音承担的功能远超背景音乐:距离声源的远近、踩踏的地面材质、声音传来的方向,都会让听觉体验产生差异;身后的脚步声、拐角外的碰撞声,往往能通过听觉提前感知。这款模型支持24 FPS的实时画面生成,同时输出48kHz双声道音频,更关键的是,画面和声音由原生Transformer架构统一生成,从一开始就绑定在一起,无需等到视频生成完成后再后期配轨。用户的每一次操作,都会同时作用在声画两个模态上,实现声音随场景转动、实时交互的完整体验。

要实现声画同步的实时交互世界模型,需要一套完整的技术链路,HelixWorld将其拆解为四个核心步骤。

第一步:构建带空间和动作的音画训练数据

训练数据的质量决定了模型的上限,可交互世界模型不仅需要视觉信息,还要能关联操作与画面变化。视觉侧已有成熟的位姿估计方案,可以反推相机轨迹生成动作标签,但音频侧几乎没有现成的可用数据集——现有技术报告通常只关注分辨率、时长、镜头切换等视觉指标,很少考虑声音维度,毕竟此前的模型大多不需要生成有声世界。

音视频世界模型需要解决的问题远比普通视觉模型复杂:需要判断音轨是否为现场录制、声源的具体位置、听者转身时声场的变化、空间回响的时长等。为了补齐这一短板,团队采用了双轨取材的方案:一方面从公开网络视频中采集真实世界的第一人称连续行走素材,这类素材的镜头持续移动、环境声同期录制,声画天然对齐,能提供真实的空间反射、遮挡和材质信息;另一方面从游戏世界获取数据,游戏引擎可以同时模拟视觉和听觉,几何形状、材质、声源位置和听者朝向都有精确的已知参数,距离衰减、墙体遮挡等空间规则清晰,且天然带有动作标注,能直接对齐画面、声音与用户操作。

原始素材还需要经过严格的清洗和校验:视觉侧会过滤镜头过碎、运动不足、画质较差的片段,同时去掉台标、水印和字幕;音频侧则需要自行搭建清洗流程,去掉左右声道完全相同的伪立体声、与画面对不上的后期配乐,通过语义筛选移除旁白和外加音效,仅保留现场声。之后还要进行声画对齐校验,系统逐帧计算声像位置和左右声道能量,与画面中的声源方位、事件时刻逐一比对,比如汽车从画面右侧驶向左侧时,声像需要同步从右滑到左,碰撞发生的帧必须与音轨的能量峰值完全匹配,不符合要求的片段会被直接丢弃。

标注环节也不再局限于视觉信息,除了相机位姿和视频描述,还会添加音频描述和音视频联合标注,将声音与画面中的声源一一对应,画外声则单独记录,避免模型生成不符合实际的内容。最终团队得到了百万量级的高质量训练片段,在音质、立体声效果和帧级对齐上都达到了标准,再通过人工标注训练的分类器,按声画配合度与声场空间感打分,筛选出高质量的微调子集,为音频侧补齐了可用的训练数据。

第二步:让画面与声场共同响应动作

团队以音视频生成基座LTX2.3为基础,引入动作控制模块。音频和视频各自保留latent表征,但会进入同一套Transformer进行联合生成,并持续交换信息,模型需要学习根据当前状态和用户动作,预测下一刻的画面与声音。比如用户向前走一步,透视关系、遮挡情况和声源距离都要随之变化;用户转身,整个声场也需要同步转动,原本正前方的声音要转移到侧后方,任何一个模态的滞后都会破坏沉浸感。

这一阶段首先采用全序列可见的双向模型,优先保证动作控制和联合生成的准确性,再去优化实时性。在完成动作控制的基础上,团队使用微调数据集进行针对性微调,验证的标准不仅是模型能否动起来,还要看脚步是否匹配地面材质、混响是否符合空间大小、声源方位是否随视角转动。最基础的要求是事件发生时声音必须同步出现,回响也要匹配空间和动作,彻底排除循环BGM、素材库音效和后期贴轨造成的伪同步问题。

此前行业对视觉质量有FID、FVD等量化指标,对音质有FAD指标,对音画同步有Desync指标,但一直缺乏自动化的标尺来验证声音的方位和距离是否与画面匹配,不能仅靠主观听觉判断,必须做到位置完全对应。到这一步,HelixWorld已经可以实现声画同步响应动作,但训练阶段的模型仍依赖未来帧信息,无法实现真正的实时交互。

第三步:改造为因果模型实现实时交互

传统视频扩散模型采用双向生成方式,计算第10帧时可以参考第20帧的信息,更容易保持连贯性,但在交互世界中,第20帧还未发生,用户下一秒的行动也无法预知,无法提前获取后续帧的信息。因此HelixWorld将双向预训练模型改造成因果模型,仅允许模型查看过去的历史信息,同时通过KV Cache复用已计算的历史数据,实现逐块自回归生成,持续输出音频和画面。

因果化改造分为两步:第一步使用真实数据微调,让模型学会不依赖未来信息也能持续生成音视频;第二步则需要解决训练和部署的历史数据差异问题——训练时模型看到的历史数据干净且正确,但部署时模型看到的是自己之前生成的结果,误差已经混入其中,如果一直用这种带误差的数据训练,最终会导致声画双双跑偏。团队的解决方案是在训练时就让模型读取自己生成的历史数据,再去预测正确的结果,提前练习在带误差的情况下继续生成,让模型从生成小段内容迈向持续生成。

第四步:优化速度实现实时响应

能持续生成还不等于能实现实时交互,传统的几十步去噪过程太慢,用户按下方向键后,留给声画响应的时间只有几十毫秒。团队需要将去噪步数从几十压到个位数,同时省掉文本条件引导带来的额外前向计算。

主流的少步生成方案DMD(分布匹配蒸馏)常见的副作用是画面过曝,优化过度会导致高光溢出、色彩过饱和、暗部细节丢失,画面看似更亮实则失真。HelixWorld采用了轨迹蒸馏与DMD结合的方案:轨迹蒸馏让学生模型沿着教师模型的去噪路径生成,为少步生成提供稳定的基线;DMD则负责守住最终的分布,避免减少步数后生成结果偏离教师模型。配合因果化后的KV Cache和逐块生成,动作输入、联合生成与音视频输出被串成连续流水线,上一块内容刚生成,下一块就已经开始计算,无需等待整段视频完成后再统一输出,最终让模型跨过实时门槛,实现用户操作的即时响应。

目前HelixWorld 1.0的模型权重和代码将在接下来几周完全开源,相关仓库链接为https://github.com/NoizAI/HelixWorld。

开源并非该团队的临时选择,而是长期以来的底色。这支团队组建于2025年底,成员来自多家顶尖机构,累计开源项目获得超过5万GitHub Stars。创始人曾在头部企业主导核心模型落地,当时团队超九成代码都是开源的,此前还开源过热门项目;首席科学家也有多个知名开源工作,其中部分项目还被行业顶尖学者转发过。

目前HelixWorld的API已经在内测中,团队还在搭建全新的交互内容社区,从创作者和用户手中获取宝贵的使用数据和反馈,这也为团队的后续发展提供了扎实的底气。

HelixWorld 1.0是对世界模型下一形态的回应:视觉生成已经从成片输出走向实时漫游,而声音正成为交互体验中不可或缺的关键一环。团队选择开源,是希望推动整个生态的丰富发展,让更多开发者可以复现、复用这套技术,接入更多系统,让行业共同推进相关技术的落地。

当代码开源后,真正的挑战才刚刚开始。当前大多数多模态模型仍围绕Prompt展开:输入一句话完成一次生成,任务就宣告结束,但真实世界不会因为Prompt停止而停滞,环境始终在变化,用户始终在行动,新的事件不断发生,世界模型需要持续运行,不能在生成完成后就停止。它需要感知当前正在发生的事,记住已经发生的内容,并对后续变化做出即时响应。

HelixWorld补上的实时音视频交互,只是世界模型进化的第一步。接下来的进化方向主要有三个:一是多智能体方向,每个角色都有自己的身份、目标和记忆,可以协作也可以产生冲突,故事不再完全按剧本发展,而是由角色互动自然演化;二是多人现场方向,当多个用户和智能体同时进入一个空间,模型需要听清每一个声音,区分说话人、对话对象和声音来源,读懂整个现场的互动逻辑;三是超长时间一致性,当世界需要运行数小时甚至数天时,角色需要保持身份一致,场景状态保持连贯,比如昨天推开的门今天依然开着,一次对话和决定需要留下持久的痕迹,这不仅要求人物不变形、场景不混乱,还要保证身份、记忆、空间状态和因果关系的完整连贯。

再往更远的未来,世界还可以实现自主进化:即使没有新的Prompt,也没有用户在场,世界依然可以按照自身的规则持续运行,角色会形成新的关系,城市和资源会持续变化,用户开口时世界会做出回应,转身离开后内部的故事依然会继续发展。当这些技术真正融合,游戏、互动影视、教育等多个场景都将被彻底改写。

以上内容不代表本平台立场,仅供读者参考