文章摘要
今年中秋,基于生数科技推出、清华大学团队研发的实时互动模型Vidu S2打造的AI主播紫樱开启首场实时互动直播,设置业绩不达标即重启的挑战模式,凭借自然互动、极强活人感,短时间吸引两万观众,多次挑战后营收持续上涨。该技术还可应用于游戏NPC、AI陪伴等领域,是实时互动AI的成功探索。

今年中秋期间,一位虚拟AI主播的直播成为了热门话题。短短时间内就有两万名观众涌入直播间,这场由实时互动模型支持的首秀,彻底拉满了大众的期待值。

这位名为紫樱的AI女主播,带来了她的首场全天候直播——设定为不完成业绩目标就不会结束的挑战模式,从聊天互动、才艺展示到全场控场,她的表现让不少观众直呼惊艳。

在这场直播中,观众拥有极高的参与自由度:可以点歌、投票选择主播的造型,也可以随时发送互动请求,紫樱需要根据这些实时变化调整对话内容、完成表演甚至换装,哪怕被观众打断,也能自然衔接上之前的话题。

这看起来更像是一场为直播间设计的互动游戏,但比“AI主播冲刺业绩”更值得关注的是,它将虚拟角色放在了直播这个最考验即时反应的场景中:每一分钟都有新的互动输入,每一个反应都会被观众放大观察,任何不够自然的停顿都会被轻易发现。

和短视频可以后期剪辑修正失误不同,直播没有重来的机会,每一个实时反应都会被观众尽收眼底,这也让这场直播成了对AI背后技术能力的一次公开压力测试。敢于将这样的技术公开探索,本身就需要不小的勇气。

尽管技术仍处于探索阶段,难免存在一些小问题,但不少涌入直播间的观众都发出了感慨:“这怎么比真人还像真人?”一些极具活人感的瞬间,甚至让人完全忽略了她是AI。

50分钟2万人涌入直播间,

AI主播第一次自己挣到了钱

整场直播中,紫樱外形亮眼,性格冷艳又不失亲和力,短短几句话就抓住了观众的注意力。和其他数字人主播相比,她有着几个鲜明的亮点:画质清晰,妆容细节都能清晰呈现;表情动作生动流畅,可以做出生气、娇嗔等多种情绪表情,还能完成撩头发、进食等自然互动动作;同时她能保持稳定的人设,比如傲娇御姐的形象。

她会用个性化的称呼和观众互动,比如“你可是今天第一个有专属称呼的人,姐姐可是忘不了的。”“安安宝宝,叫你小甜糕怎么样?又甜又可爱。”时不时还会为观众献上热舞或歌曲,流畅的一键换装表演更是让不少观众眼前一亮。

这场直播其实暗藏挑战机制:紫樱需要在两小时内通过观众的打赏积累80000营业值(折合人民币约8000元),如果没能达标,直播就会被强制中断,她的记忆也会被重置,重新开启新一轮挑战。

就在直播氛围正热烈时,紧张的气氛悄然升起:离第一场直播结束还有37分05秒时,紫樱的营业值仅为6174,距离80000的目标还有不小的差距。观众们的心都跟着悬了起来,不少人主动充值打赏,同时更多观众涌入直播间。

在观众刷礼物的过程中,紫樱还会温柔提醒大家:“不要再刷了,上班那么辛苦,对自己好一点。”这种体贴的情绪价值,或许正是她能留住观众的关键原因。

直播中出现了一幕让人印象深刻的场景:当AI主播面临直播惩罚时,不少观众开始心疼这串“代码”。

过往的传统数字人主播,大多依靠预先设定的形象、动作和话术,通过语音驱动口型或调用动作库完成内容输出,它们可以完成固定的内容,但很难应对不断变化的直播场景,常常出现眼神空洞、对话延迟的问题,很容易让观众感到尴尬。而纯靠AI驱动的数字人,同样存在类似的问题。

但在紫樱的直播间中,正是因为她的活人感表现出色,打赏的观众越来越多。直播结束后复盘数据可以发现,开播不到5分钟,直播间在线人数就突破了两万人,热度可见一斑。首次登场的5小时里,她就完成了过万元的营收,最终累计营业值达到24184。经过多次重启挑战后,后续场次的营收持续攀升,第二次直播的营业值几乎翻倍,第三次还未结束就已经超过了前一次的总业绩。

在Vidu S2超强的一致性支持下,紫樱始终保持着稳定的角色状态。这意味着,你喜欢的游戏角色、动漫中的绝版纸片人,都可以通过这种技术一键“空降”直播间,陪你聊天互动甚至带货。而且每次挑战失败后,AI都会复盘调整节奏,更好地照顾每位观众的需求,这种自主进化的能力,已经初步展现出类似递归自我改进的雏形。

视频从「内容」变成「交互界面」:

Vidu S2不止AI主播

如果认为紫樱的成功只是多了一位能赚钱的AI主播,那就太小看这场实验的意义了。造梦次元与生数科技推出的这场“无限重开”实验,其实是在文娱与科技的交叉路口,推开了一扇通往新世界的大门。当AI视频可以实现实时生成、实时互动并保持高度一致性时,我们熟悉的世界将迎来改变。

游戏世界的NPC,再也不用当「木头人」了

传统游戏中的NPC大多依赖固定脚本,玩家很容易就能预判他们的台词,比如重复的问候语和固定的剧情分支,仿佛只是一串没有灵魂的代码。比如经典游戏中的卫兵台词,因为重复率太高,成为了广为流传的网络梗。

但有了Vidu S2之后,这种情况将彻底改变:游戏中的NPC可以根据玩家的实时对话做出个性化反应,就像和真人面对面交流一样自然。你甚至可以让历史中的科学家现身,比如让数学家为你讲解专业理论。

AI陪伴——真到让人心疼的赛博伴侣

现有的AI聊天软件很容易露出破绽,用户很快就会感到厌倦,比如部分产品存在记忆断层的问题,和用户热聊一段时间后,就会突然表现得像是刚认识。但如果你的AI伴侣不仅可以和你实时视频互动,还能记住你前一天说过的每一句话,甚至记得你醉酒时的碎碎念,会是怎样的体验?

实时生成技术恰好填补了AI陪伴领域的短板,让虚拟伴侣拥有了真实的情绪表达和稳定的角色状态,这种能与用户建立深度情感连接的技术,有望重塑面向孤独人群的数字经济模式。

撕开「活人感」的底牌:实时互动模型 Vidu S2

紫樱能拥有如此逼真的表现,离不开背后的核心技术:生数科技推出的实时交互与编辑模型Vidu S2。这场直播也可以看作是Vidu S2的一次公开技术展示。该模型的全链路研发由清华大学相关团队负责。

Vidu S2包含两大核心模块:Vidu S2-Avatar支持实时语音交互与复杂动作控制,可以结合参考图完成物品互动、服装更换和背景切换等操作;Vidu S2-Editing则支持基于风格、服装、主体及背景参考图,对输入视频流进行持续实时编辑。此外,Vidu S2还支持离线生成模式,仅需一张图片和一段音频就能生成数字人视频。

近期Vidu S2已经引发了不少关注,有人用它还原经典影视角色,和他们实现实时互动交流。

传统的AI视频生成模式是“用户输入指令,模型渲染后输出一段静态视频”,但Vidu S2打破了这种次元壁,带来了行业内领先的“实时视频双高峰”:实时生成与实时互动。

紫樱能让观众感受到“活灵活现”,正是因为Vidu S2在多个技术维度实现了突破。首先是极强的角色一致性。过往的AI生成视频常常出现画面崩坏的问题,角色动作稍多就会出现外形变形。但在Vidu S2的支持下,角色无论是换装、热舞还是回应互动,轮廓、光影和体态都始终保持稳定,仿佛真实存在的个体。

这种一致性并非单点模块的优化,而是从训练、数据、架构、推理到评测五个层面共同约束的系统属性。为了彻底解决长时间流式生成带来的“崩溃”与“漂移”问题,团队独创了SRF训练技术,简单来说就是让模型拥有“自我纠错的记忆”,学会直面自己的生成历史并修正误差。

其二,Vidu S2实现了真正的实时生成能力。直播中出现的每一个互动反应,都不是提前编写的脚本,而是模型在数百毫秒内实时计算生成的真实画面。S2-Editing采用帧对齐稀疏注意力等底层技术,实现了实时编辑,不同风格的实拍短片都可以瞬间完成风格重绘。

在实时交互链路上,S2进一步采用了高效注意力、低比特线性层加速等技术,大幅压缩生成延迟,实现实时语音交互与动作控制。用户可以直接与数字人实时对话,也可以通过语音指令控制角色完成指定动作,让数字人从“会说话”进一步走向“能听懂、能响应、能行动”。相比前代产品,S2在肢体动作表现力上也有明显提升,能够自然完成更大幅度、更复杂的全身动作,让实时数字人的表现力进一步接近真实表演。

其三,Vidu S2拥有出色的情境理解能力。无论是观众抛出的网络梗、刁钻的提问还是突发的情绪变化,模型都能快速响应,并通过角色的表情、语气自然传递出来。不再是“AI看起来像人”,而是“AI正在像人一样和你经历当下的每一秒”,这正是紫樱能在直播间吸粉无数,让观众心甘情愿打赏的终极秘密。

下一个时代,已经在直播间里开启

正如本次活动的主题“AI能靠直播养活自己吗”,紫樱用真金白银给出了答案:能,至少她真的靠自己实现了营收。

在这场“无限重开”的挑战中,我们看到的不仅仅是AI主播在努力通关,更是实时互动AI模型在真实世界的压力测试中交出的探索答卷。当拥有高度活人感的AI走入直播场景,当实时视频生成技术打破虚实之间的界限,一个全新的实时互动AI时代已经悄然开启。或许在下一个中秋,陪你赏月、听你倾诉的,就会是这样一位真正懂你的虚拟伙伴。

以上内容不代表本平台立场,仅供读者参考