Vivix A1:0.6秒延迟实现虚拟角色“身体化”平行世界互动

比起诺兰在《星际穿越》里用摩斯密码搭建平行时空的桥梁,当下的AI技术已经把跨时空对话变得触手可及。你可以和一只虚拟小猫实时互动:它会一边说着俏皮的情话,一边弓背摇尾、抬爪踱步,连脚下的影子都会随着动作自然变化,而且所有反应都不是提前预设好的——你每说一句话,它都会根据你的输入即时调整动作和回应。
这只小猫背后,是一款全新发布的实时交互多模态模型A1。它让用户可以像打视频电话一样,和屏幕另一端的虚拟角色持续交流。和传统数字人、视频生成模型不同的是,A1赋予了屏幕里的角色真正的“身体”:它不再只是对着镜头说话,而是能够行动、转身、改变姿态,和所在环境里的物体持续互动,这种体验就像真的和另一个平行世界连线。
与此同时,团队还同步推出了W1模型,让用户不再只是作为旁观者观看故事,而是可以随时介入,改变角色的选择、行动,甚至影响后续的剧情走向。
不少人会好奇,这样的实时交互需要消耗多大的算力?据技术文档披露,A1虽然拥有近30B激活参数,但通过MJD多维联合蒸馏、原生NVFP4训推策略,以及自研的通信-计算调度和mega-kernel推理基础设施,将部署门槛降到了消费级GPU可以实现实时推理的水平,在近似画质下,推理效率提升了近两个数量级。其流式调度器响应新输入的最短时间为300毫秒,从用户发出指令到画面出现可见反应的平均延迟仅为0.6秒,几乎是话音刚落,屏幕另一端的角色就已经做出了回应。目前官方已经开放内测,感兴趣的用户可以访问官网及API开放平台申请体验:https://vivix.ai/
让虚拟角色保持连贯的核心:原生流式多模态架构
要实现真正的实时跨时空交互,第一步不是让角色有多聪明,而是要保证在持续生成的过程中,角色始终是同一个个体,身处同一个世界。A1被定位为全球首个在原生流式架构中,统一多模态参考、实时交互和流式生成的基础模型。
传统的基于clip的视频生成模型,通常一次生成一个完整的片段,可以提前统筹前后的动作和画面,更容易保证人物、场景和物体关系的一致性。但流式生成没有这样的条件,只能一边生成画面,一边接收用户的新指令,实时预测后续内容,就像一边铺铁轨一边开火车,生成时间越长,误差累积的风险就越高,角色的外形、位置和动作可能逐渐漂移,场景和物体的空间关系也会被破坏。
最简单的解决办法是让角色少动,但这样的虚拟角色根本谈不上拥有真正的身体。A1的解决方案是,将图片、视频、声音、交互历史和已经生成的内容都写入持续状态,在后续的流式生成中反复生效。通过因果时序建模和流式状态维护,A1既可以保证相邻动作的自然衔接,又能在更长时间范围内维持角色身份、场景和物体关系。其中局部连续性先验负责让相邻动作无缝衔接,全局序列先验则负责守住长期的角色一致性和场景稳定性。在此基础上,模型同时优化开放式指令遵循、时间连续性、角色一致性、物体一致性和运动动态,重点解决长期生成中的视觉漂移、误差累积和动作衰减问题——既保证角色始终是它本身,又不会因为害怕出错而一动不动,这也是A1和现有数字人相关产品最大的区别。
全模态统一建模:让角色听懂所有细节
当前大多数数字人采用的是流水线式的架构:先通过ASR将语音转为文字,再由大语言模型生成回答,接着用TTS将文字转为语音,最后通过动作模型或视频模型补上口型和动作。这种架构虽然可行,但每多一层链路就会多一次等待和信息交接,而且很多细节会在转写过程中丢失,比如一句话里的语气、停顿和情绪,环境中的雷声、风声,或是画面中的手势动作,都无法被完整压缩进文字中。
A1没有将ASR文本作为唯一的交互中间表示,而是直接建模语言语义、声学特征、非语言声音、环境事件、手势和动态视觉信号。多模态上下文(包括音视频参考、系统提示、历史帧等)会以原生多模态的形式输入模型,模型可以在约300毫秒的最小时间片内,推理出对当前上下文的最新响应,这可以被称为模型的“快思考”。而更上层的Director Agent则负责“慢思考”,进行推理、思考和工具调用,并异步给出长时序的宏观行为控制。
这样一来,角色不必等待完整的文字转写完成后再行动。用户的语气变化、环境中的新声音、画面中的新动作,都可以成为触发信号,实时改变尚未生成的内容。这就是A1强调的持续聆听和事件触发响应,让感知、规划、行为控制和音视频生成不再是各自排队的离线任务,而是整合进同一条实时链路。
MJD技术:把8步视频扩散压缩到2步
实时交互的另一个瓶颈来自视频扩散模型本身。视频扩散的不同采样步骤承担着不同的任务:有的负责搭建语义结构和运动方向,有的补充局部细节,还有的维持前后画面的连续性。如果直接减少采样步数,往往会同时损失动作幅度、画面细节和长时稳定性。
为此,团队提出了MJD(Multidimensional Joint Distillation,多维联合蒸馏)技术,以8步版本作为质量基线,将不同去噪阶段的能力共同压缩进2步模型中,而非仅针对单帧画质进行蒸馏。MJD同时优化三个核心目标:一是保留快速采样下的视觉细节和运动表现,二是抑制连续生成过程中的漂移和累计误差,三是对齐latent空间、像素空间以及语义和动作分布。
为了防止模型通过减少动作来换取稳定性,MJD还让学生模型学习教师模型更完整的动作分布,同时在latent潜空间和原始数据空间中进行优化。前者守住整体生成分布,后者补充细小动作、视觉纹理和长期累计误差的优化。最终,视频扩散可以从8步质量基线压缩到2步推理,同时保持接近8步版本的短时画质、指令遵循能力、运动表现和长时稳定性。
30B参数如何跑进消费级显卡?
近期市场上出现了不少近似实时推理的视频生成模型,但它们大多基于小参数量(1~5B)或较大的VAE压缩比(如16x16x8),牺牲了模型的容量,导致要么无法支持大动作,要么频繁出现明显的画质瑕疵。而本次发布的A1有效激活参数接近30B,采用了8x8x4的高质量压缩率,每秒token吞吐需要达到同类工作的数十倍,这对推理成本和实时性带来了极大挑战。
为了解决这个问题,团队推出了VMI(Vivix Model Infra)推理基础设施,其核心思路可以概括为三步:拆分互相干扰的任务、以更低精度运行模型、统一调度计算、通信和内存资源。
Encoder与Decoder解耦:疏通实时链路
第一步是拆分容易互相拥堵的任务。多模态Encoder负责处理图片、视频、语音和其他参考条件,更适合用大Batch来追求高吞吐;而实时Decoder Loop需要连续逐帧生成,更在意低延迟、稳定输出和随时打断。如果将两者放在同一个资源池中,Encoder的批量任务可能会堵住Decoder的实时链路。
VMI将两者拆分为独立服务,分别配置进程、资源池和扩缩容策略,让参考图片和语音可以集中编码,而正在进行的视频互动无需排队等待。此外,VMI还在推理阶段引入了prefill/decode分离,并重新设计了KV Cache传输层。前者隔离不同类型的任务负载,后者减少推理阶段之间的状态搬运和等待,这套架构被称为PD分离架构。整套链路支持稳定连续生成、模型级打断和实时重定向,Encoder和Decoder也可以独立弹性伸缩。根据测试,这套流式调度器响应新输入的最短时间仅为300毫秒,从用户发出指令到画面出现可见反应的平均延迟低于0.6秒。
原生NVFP4训推协同:让大模型装得下、跑得动
拆分编码和解码只是疏通了实时链路,接下来的问题是如何将近30B激活参数的模型装进消费级显卡。降低数值精度可以减少显存占用和计算量,但视频扩散模型对量化误差格外敏感,单步计算的微小偏差会沿着去噪链路和长时间生成过程不断累积,最终导致细节退化、角色漂移和时序不稳定。
真正的难点不在于能否用4-bit跑起来,而在于跑起来之后还能保留动作、细节和长期稳定性。针对这个问题,VMI将Blackwell GPU支持的NVFP4 GEMM直接设为目标推理路径,并在训练和蒸馏阶段引入了低精度感知的蒸馏,让模型提前适应4-bit数值分布,而非训练完成后再做PTQ量化。此外,针对视频生成链路,VMI还加入了专门的去噪误差校正,压制量化误差在不同timestep和连续帧之间的累积。整套训练过程也直接对齐最终部署使用的NVFP4 GEMM Kernel,减少训练精度和推理精度之间的分布偏移。实测显示,NVFP4相对于BF16基线实现了接近无损的生成质量,同时降低了显存占用并提高了推理吞吐。
统一调度计算、通信和内存:消灭隐形等待
NVFP4让模型可以装得下、跑得动,但在多卡系统中还有一个容易被忽略的瓶颈:GPU、PCIe和显存不能总是互相等待。在RTX级消费GPU上,多卡通信主要通过PCIe进行,如果GPU算完后等待数据,PCIe传完数据后等待计算,大量冷状态还一直占用显存,即使每个单独模块都很快,整条链路依然无法跑起来。
为此,VMI构建了Compute-Communication-Memory Co-Scheduling Engine,将计算、通信和显存调度统一纳入同一张推理执行图。首先,让Attention通信、显存Offload和跨服务数据传输运行在不同的CUDA Stream中,尽可能和GPU计算重叠;其次,将计算与通信融合进Mega Kernel,减少中间状态的写回和同步等待;最后,利用CUDA Graphs捕获整张流式推理图,将原本数百次的Kernel Launch压缩成少量统一提交。简单来说,就是能并行的尽量并行,能合并的尽量合并,不让Python、CPU和PCIe成为GPU运行的阻碍。
根据测试结果,VMI实现了单卡吞吐超过10000 video tokens/s,在多卡链路中,PCIe带宽利用率达到88%以上。将这三项优化结合起来,逻辑非常清晰:Encoder与Decoder解耦疏通实时链路,原生NVFP4训推协同让30B参数模型可以在消费级显卡上运行,而计算、通信和内存的协同调度则消灭了多卡系统中的隐形等待。至此,A1才完成了从“模型可以交互”到“交互可以实时运行”的最后一公里。
从单个角色到持续演变的世界
从统一多模态参考与流式生成,到原生交互信号建模,再到将8步视频扩散压缩到2步,加上Encoder/Decoder解耦、原生NVFP4训推协同和整套协同调度引擎,六项核心技术共同填补了实时交互链路中的各个缺口。这套组合拳最终实现了近30B激活参数、接近无损的消费原生NVFP4、消费级显卡实时生成。
A1交付的不再只是一个实时交互的概念,而是一套已经可以落地运行的原生流式多模态模型。如今,屏幕另一端的AI已经可以听见你、转过身,继续在自己的世界里向前行走。
而W1模型则希望更进一步,让角色背后的世界可以随着用户的选择而改变。当然,这距离真正的“平行世界”还有很远的距离,但至少,这通跨时空的视频电话已经传来了第一声清晰的回音。

