视频版GPT-Live:Genesis-1.0开启24小时稳定AI互动娱乐

我们正在见证一个全新的AI互动生态的诞生——长时、智能的AI互动娱乐基础设施已经从概念走向落地。
正如媒介理论家麦克卢汉所说,媒介真正塑造的,是人类关联与行动的规模和形式。未来最具代表性的个体与企业,或许都会具备双重属性:一半是内容媒体,一半是智能载体,既生产标准化产品,也在构建沉浸式的虚拟现实。
从文本交互到语音互动,再到视频生成与世界模型,AI正在从被动回答问题,转向主动陪伴用户,甚至通过全新的交互方式创造专属的虚拟世界。这一切的核心体验,都来自最新发布的Genesis-1.0。
全新的视频双工架构,拉开数字人互动新维度
此前体验过不少视频生成与数字人产品,大多给人一种“预制菜”的观感:内容像是零散视频片段拼接而成,缺少一个稳定连贯的虚拟世界。而Genesis-1.0的架构设计,恰恰解决了这个核心痛点。
它的核心创新之一,是将规划层与感知渲染层进行了解耦。其中负责视频双工的模块,会直接感知用户、渲染画面,实现极低的端到端角色行为延迟,包括细腻的动作与表情变化;而Genesis-1.0-Brain则专注处理语言风格、工具调用等逻辑。
在视频双工场景中,语言智能与视觉行为智能需要完全不同的优化路径:Brain负责内容创作、风格调整与工具调用,渲染层则专注于视觉感知与动作生成。这种解耦设计不仅让开发者更容易理解架构逻辑,也大幅降低了接入门槛。
基于这套全新的视频双工架构,Genesis-1.0在生成时长、响应速度与应用成本上,都达到了业内领先的交互式虚拟人水准:支持全身渲染,端到端画面延迟最低仅1.2秒,最大生成时长可达24小时。
在成本控制上,Genesis-1.0的定价仅为0.003美元每秒,远低于行业平均的0.006美元每秒,相比HeyGen LiveAvatar、Runway Avatar等上一代数字人产品,已经来到了全新的竞争维度。
对于开发者而言,纸面参数只是基础,真正决定产品能否落地的是边界条件:如果AI陪伴产品每5分钟就要重启一次虚拟世界,用户的沉浸体验会被彻底打断;如果虚拟主播的响应超过2秒,互动感就会明显下降;如果应用成本无法控制,商业模型也无从谈起。而Genesis-1.0已经悄悄把这些背后的技术支持做到了行业顶尖水平。
我曾参与过一个面向高端群体的意识传承与定制陪伴项目,当时因为模型能力与配套设施的限制,在家族形象传承、数字人交互上遇到了不少瓶颈。而Genesis-1.0的出现,重新打开了长时陪伴、类人交互的可能性。
真正的类人交互,打造闭环互动体验
类人的互动体验,外表与静态视觉只是基础,真正的核心在于行为逻辑。体验下来,Genesis-1.0给人的直观感受是,它能真切感知到用户的存在。
Genesis-1.0同时具备主动感知与实时生成能力,支持通过用户摄像头直接交互,并以极低的端到端延迟,实时反馈角色的行为反应。市面上不少数字人产品,虽然可以说话、对口型或者做出预设动作,但一旦开启摄像头交互就会露馅——这类产品本质上只是Chatbot套了一层视频外壳。
真正的视频双工交互,需要模型能够持续捕捉用户的视觉信息,并直接将视觉理解转化为下一步的行为决策。Genesis-1.0在视频双工场景中,展现出了成熟的类人交互与端到端推理能力。
看似简单的视频互动,背后其实包含了完整的交互闭环:当用户说话时,它会先完成感知聆听,再进行思考推理,随后做出决策反馈,最后通过动作与表情完成表达。这四个环节都需要在极低延迟下完成,而更快的响应速度,正是这个闭环得以成立的关键。
这种能力将直接重塑AI社交与陪伴产品的形态。以往的AI陪伴大多停留在文字与语音交互阶段,用户需要自行想象对方的形象;而加入视频双工交互后,用户可以直接看到虚拟角色,角色也能实时感知用户的存在,互动从语言层面扩展到表情、动作、视线与环境互动,产品的设计空间被大幅拓宽。
虚拟主播可以实时回应观众的动作与弹幕,AI陪伴可以感知用户的情绪与状态变化,互动娱乐场景可以让用户真正成为场景的一部分。这些全新的应用场景,都需要模型能够持续捕捉用户信息,并将视觉理解转化为自然的下一步行为。
24小时不“崩档”,解决长时生成的核心难题
Genesis-1.0支持的24小时最大生成时长,绝不仅仅是时间变长这么简单。以往的实时视频生成大多采用自回归模式,模型以前序生成结果作为上下文持续预测后续内容,随着生成时间拉长,微小的误差会不断累积,最终导致角色IP漂移、场景状态崩溃。
因此,实时视频生成从分钟级升级到长时模式,核心难题在于如何在更长的时间尺度上保持虚拟世界的状态稳定。生成更多内容只是表面现象,真正的挑战在于让模型始终清楚当前虚拟世界的状态,以及下一刻应该发生的合理变化。
Genesis-1.0的研发团队认为,视频模型最终应该自主学会理解和维护世界状态,不需要额外搭建一套3D场景表示,可以直接在视频表征中学习世界的结构、状态与变化规律。这种统一的视频表征方式也更符合规模化扩展的规律:随着模型规模、训练数据规模与算力投入的提升,模型可以持续学习更复杂的世界与交互逻辑,无需同步扩张外部的结构化世界表示体系。
针对长时生成的误差累积与内容一致性问题,Genesis-1.0进行了专项优化,将业界普遍仅支持5分钟级的互动时长,提升到了稳定的24小时。
长时生成的核心考验从来不是开头的效果,而是24小时后的状态表现:角色的身份是否一致、服装是否出现漂移、场景结构是否稳定、物理交互是否合理、行为逻辑是否连贯。这些细节才是衡量虚拟世界状态稳定性的真实标准。
这很像长上下文大语言模型的能力演进:长上下文模型可以在更长的历史对话中,依然准确理解当前状态并做出合理判断,视频世界模型也是如此。长时生成的本质,是在更长的时间尺度上,始终清楚虚拟世界的当前状态,并生成符合逻辑的后续内容。
Genesis-1.0让视频生成从单次产出一段内容,升级为持续维护一个稳定的虚拟世界状态。对于开发者与参与者来说,这意味着虚拟主播直播、AI陪伴、互动娱乐等产品,可以从“每次生成一段内容”的模式,真正升级为“角色持续存在”的模式,全新的关系感、养成感与陪伴感,都将带来体验层面的大幅升级。
从工具到基础设施,重构AI陪伴与互动娱乐的未来
在“模型即产品”的时代,Genesis-1.0本身就是一款高度成熟的产品。无论是开发者还是普通用户,拿到的不再只是单一的视频生成能力,而是一套全新的互动内容生产与运营体系。
而规划层与感知渲染层的解耦设计,也是降低使用门槛的关键一步:Brain模块负责处理问答内容、语言风格与工具调用,视频双工层则专注感知用户、渲染画面并实现极低的端到端延迟。开发者可以根据自身需求灵活对接业务逻辑:需要工具调用时,直接对接Brain模块;需要视觉交互时,使用视频双工层;需要长时稳定的虚拟世界时,则可以依托Genesis-1.0的世界状态维护能力。这种精准的分工设计,让整个系统的实用性大幅提升。
背后的研发团队年轻高效、务实落地,始终围绕市场需求推进产品迭代,无论是产品设计还是模型架构,都充满了突破创新的精神。
持续在场、持续感知、持续回应——这将是未来AI互动产品的核心标准。未来一两年内,视频模型的行业竞争将从单次生成的质量比拼,转向持续互动的质量竞争。谁能在更长的时间尺度上维持虚拟世界的状态稳定,谁能让虚拟角色持续存在,谁能以极低延迟理解并回应用户,谁就能拿到下一代互动娱乐与AI陪伴赛道的入场券。
媒介理论家尼尔·波兹曼曾提出,技术变化不是简单的叠加,而是生态式的革新:一项新技术进入社会,不会只是在原有世界中增加一个工具,而是会彻底改变整个环境的运行逻辑。Genesis-1.0正是如此,它正在重构一整套行业环境,构建一个全新的AI原生娱乐与陪伴生态。
想要体验的用户可以前往官方平台了解详情,目前还可以体验24小时无人值守的虚拟直播间,让数字主播全天候与用户互动。或许,这正是我们与AI建立深度长期关系的开始。

