文章摘要
AI世界模型此前落地门槛高,普通用户仅能通过公开演示体验。近期有团队开源适配消费级单卡GPU的LingBot-World 2.0 1.3B小参数版本,支持用户本地实时交互生成连贯稳定的虚拟世界,同时配套开源训练工具,降低了相关研究与二次开发门槛。

最近发现一种全新的AI互动玩法,最适合和朋友一起体验:两人共同操控一个动态生成的虚拟世界,一人负责向前探索场景,另一人作为导演随时添加剧情。比如在走廊行进时,探索者可以随时拐进小巷,导演可以立刻让场景里出现怪物,或是临时改变天气——刚还晴空万里,转眼就能飘起雪花。AI会根据两人的实时操作,持续生成连贯的画面,让这个虚拟世界随着想法不断延伸。

这种边接收操作、边实时生成后续画面的能力,正是当前AI世界模型的核心探索方向。世界模型的概念并非近年才出现,2018年David Ha和Jürgen Schmidhuber发表的《World Models》就是代表性研究,核心思路是让智能体先学习环境的变化规律,再在模拟环境中完成训练。后续不少团队都在这个方向上发力,比如李飞飞联合创办的World Labs探索空间智能,Google DeepMind也推出了支持实时交互的Genie 3,尽管技术路线各有侧重,但目标都是让AI更好地理解、生成和模拟真实或虚拟的世界。

不过这类技术的落地门槛曾经很高,如果需要多卡服务器才能运行,普通用户就只能通过公开视频或在线Demo旁观,和传统生成视频并没有本质区别。

近期有团队更新了LingBot-World 2.0模型,其中一项重点是开源了面向消费级单卡GPU的1.3B小参数版本,现在普通用户只要一张消费级显卡,就能在本地实时生成可交互的虚拟世界了。

我们可以先看看官方演示的效果:首先是巫师施法的片段,施法时周围环境会同步联动——巫师抬手、转身释放不同魔法,绿色魔法出现时,附近的雾气和路面都会染上对应的色彩。这要求模型必须同时处理人物动作、魔法效果和环境光影的联动,让魔法看起来确实发生在这条街道上。更难得的是镜头移动时,商店、路面和楼体随着视角展开,巫师始终处于场景中,没有出现频繁更换背景的割裂感,真正做到了用户不断添加操作时,模型能保留之前生成的场景内容。

另一段滑翔伞的演示则很好地展现了空间感:随着视角转动,玩家可以看到山坡、天空,也能俯视下方的村落。近处的双腿、绳索,下方的山坡,远处的雪山形成了完整的空间参照系,镜头移动时,所有物体的相对位置都保持合理。如果只是简单平移整张风景图,或是近景远景各自独立移动,很容易露出破绽。而在这段演示中,第一人称的身体和装备提供了稳定的参照,外部景观随着视角自然展开,让人真的感觉自己正坐在滑翔伞上,只是在看向不同的方向。

我自己尝试了特洛伊木马的场景,画面持续变化的同时,整体空间延续性和场景衔接都非常丝滑,仿佛真的置身其中向前行走,一旦体验过就会忍不住不断尝试新的操作。

这也是本次1.3B小模型开源的核心价值:让更多人有条件亲自运行、修改和验证这个模型。相比此前的14B主模型,新版本专门面向消费级单卡GPU,支持本地实时生成。

过去体验这类世界模型,往往只能依赖公开视频或在线Demo,能尝试的操作、运行时长和可调整的内容,都受限于展示方开放的功能。现在用户终于可以在本地部署模型,自己设计实验、验证效果。这给个人开发者、高校实验室和小型团队都带来了新的机会:

  • 个人开发者可以围绕模型打造自定义交互,比如给镜头控制添加手柄适配,找到更顺手的操作方式,围绕生成模型设计全新的玩法;

  • 高校实验室可以将其作为研究工具,测试不同延迟下用户的跟手感受,研究文字指令和按键操作分别适合的场景,或是分析场景出现不合理变化时对用户判断的影响。本地部署能更方便地控制实验条件、记录输入输出数据并反复调整界面;

  • 小型团队则可以快速搭建应用原型,比如互动展览项目中,观众走到某个位置或是做出选择时,场景就会继续生成,先通过短流程测试观众的接受度和参与意愿,再逐步扩展内容。

随着更多人参与进来,世界模型或许很快就会迎来类似LLaMA带来的行业变革时刻。当然,消费级单卡的实时生成效果仍受算力和配置限制,我测试后发现,镜头移动时场景虽然能同步变化,但清晰度相比高配版本还是能看出差距。

本次更新还同步开源了可用于后续训练的Causal Pretrain和Bidirectional工具:前者支持后续的场景适配和模型训练,为深入研究的用户提供了训练基础;后者可用于模型蒸馏,帮助研究者用更少的计算资源保留生成效果。尽管这两项工作仍需要数据和算力支持,但基于现有模型的基础开发,无疑比从零搭建要高效得多。

相关资源传送门:

官网:

https://technology.robbyant.com/lingbot-world-v2

模型:

https://huggingface.co/collections/robbyant/lingbot-world-v2

代码:

https://github.com/robbyant/lingbot-world-v2

论文:

https://arxiv.org/pdf/2607.07534

接下来我们看看这个模型是如何做到实时承接用户操作、保持画面稳定并提升生成速度的。根据公开论文,模型主要接收两类控制信息:相机位姿和文本指令。

相机位姿负责告诉模型“从哪里看、朝哪个方向看”,论文中使用Plücker编码将每个像素对应的观察射线表示为六维坐标,再通过自适应层归一化(AdaLN)调整生成网络内部的特征,让画面生成过程参考这些空间信息。对应到滑翔伞的演示中,就是当玩家转动视角时,模型会根据新的观察方向,自动补全对应区域的景物。

文本指令则负责定义“接下来发生什么”,模型会为不同的视频片段配置对应的提示词,通过交叉注意力机制将文字要求和正在生成的画面绑定。比如前一段还在正常行走,后续指令要求施法时,动作就会在合适的位置出现,让剧情可以在生成过程中随时更新。

为了让系统能主动安排剧情事件,团队还设计了“导演—执行”框架:视觉语言模型充当“导演”,观察当前场景并提出事件;视频模型负责生成后续画面,生成结果再交回“导演”评估,继续决定下一步的剧情走向。如果需要操作具体物体,还可以借助基于SAM的分割与跟踪技术,比如开门时先精准定位选中的门,再围绕该对象生成对应的变化。这套流程形成了观察场景、安排事件、生成画面的完整循环。

不少用户都会担心一个问题:长时间生成下去,画面会不会越来越离谱?如果前期出现一点变形,后续以这个有偏差的画面为基础继续生成,偏差很可能越积越多。论文从预训练和后训练两个阶段解决了这个问题:

预训练阶段,传统的Teacher Forcing方法会给模型提供正确的历史画面,让它学习生成后续内容,但团队发现历史内容越长,模型越容易依赖现成上下文,出现过拟合和画质下降的问题。因此他们设计了MoBA混合注意力掩码,将两种训练方式结合:自回归分支让模型根据过去的内容生成后续,双向注意力分支则允许训练片段内部充分交流信息,帮助保留视觉生成能力,缓解单纯Teacher Forcing带来的过拟合问题。同时文本也有对应的限制:自回归分支只能读取背景描述、当前和过去的指令,无法提前看到未来的要求,避免训练时“偷看答案”。

后训练阶段,团队则专注于提升生成速度。传统的Teacher模型需要多次去噪才能得到完整画面,团队首先使用一致性蒸馏,让Student模型用更少的步骤逼近Teacher多步生成的结果。但减少步骤可能会影响画质和长时稳定性,因此他们又加入了分布匹配蒸馏(DMD),让生成结果的分布更接近真实数据分布。这里的关键细节是,DMD训练使用了Student模型自己连续生成的长序列——如果训练时一直参考正确画面,实际运行时却要基于自己的输出继续生成,两者会存在落差。让模型在训练时就适应自己生成的上下文,就能提前应对真实运行中可能出现的偏差,真正做到“前面是自己生成的,后面也能顺利承接”。

为了让用户能更快看到生成结果,论文还将生成、解码和传输流程设计为可并行的流水线:当模型生成下一段压缩表示时,VAE负责将上一段压缩数据还原为画面;已经解码完成的内容会逐步传输给用户,不需要等待上一个环节完全结束,有效缩短了用户等待反馈的时间。

那这套系统的长时生成表现如何呢?论文展示了一次60分钟的连续生成过程,从中选取了20个场景,涵盖水乡、城市街道、温室、雪地码头甚至太空视角。可以看到,运行到三四十分钟后,建筑、植物和船坞等场景仍保持清晰的轮廓和细节;接近一小时时,画面也没有出现明显的整体画质崩坏,在经历多个场景转换后,依然维持了较好的视觉质量。

横向对比测试中,论文将不同模型在灭火器、水上摩托两个场景中的表现从5秒到60秒进行了对比。以水上摩托场景为例,部分对照模型随着时间推移,逐渐出现噪点、变形或内容偏移,而LingBot-World 2.0的生成结果中,骑手、艇身和水面的关系在后续时间点依然保持清晰合理。

结语

一个真正能玩的交互式世界模型,最难的地方就在于:你随时可以改变想法,它还能完美承接你的新操作。转动镜头时,它要补出新的景物;要求施法时,人物和环境要同步响应;长时间运行时,画面也不能越来越混乱。前面提到的所有技术设计,都是为了解决这些具体的痛点。

而LingBot-World 2.0的这次更新,进一步降低了普通人参与的门槛。1.3B的小参数模型让更多人可以在自己的设备上尝试,同步开源的Causal Pretrain和Bidirectional工具则为进一步开发提供了基础——无论是继续训练让模型适配特定场景,还是通过蒸馏优化生成速度和成本,都有了可靠的起点。

过去我们只能观看别人演示的AI生成世界,现在我们终于有机会自己决定:拐进那条小巷,给里面安排一段全新的故事。这些想法最终能实现到什么程度,还需要大家亲自跑起来才能验证,但拥有了尝试和修改的条件,才能真正把“看着挺好玩”变成“我也做出了一个”。感兴趣的朋友不妨动手尝试,如果你跑出了有趣的效果,也欢迎和更多人分享。

以上内容不代表本平台立场,仅供读者参考