文章摘要
最新推出的Wan - Streamer v0.2为AI实时对话带来新体验。它是端到端全模态理解与生成模型,有极致低延迟、高清画质输出、全模态端到端架构等优势。通过改变架构、提升画质、采用双通路架构,实现极低延迟和全双工交互。其应用场景广泛,团队将持续迭代该项目。

和AI打视频电话时,卡顿、延迟、声画不同步几乎是常态。传统的实时数字人系统往往采用“语音识别→大模型生成回复→语音合成→动画驱动”的级联流水线架构,每多一个环节就多一层延迟,还容易出现声音和嘴型错位、表情僵硬的问题,完全无法达到和真人面对面交流的自然感。

真正自然的AI实时交流,应该像和朋友打视频通话一样:没有等待,没有割裂感,AI能实时捕捉你的微表情,同步做出点头、手势等反应,让声音、唇形和神态在毫秒间完美匹配。而最新推出的Wan-Streamer v0.2,正在把这种想象变成现实。

一分钟了解Wan-Streamer v0.2

这是一款面向实时双工交互的端到端全模态理解与生成模型,将“听、看、说、演”全流程整合进单个Transformer架构中,让AI可以边听、边看、边做出实时回应。它的核心优势体现在三个方面:

  • 极致低延迟:端到端整体响应延迟约550ms,其中模型内部延迟仅200ms,加上350ms的网络传输开销,远快于市面上主流的实时语音对话模型
  • 高清画质输出:将生成分辨率从v0.1版本的192×336提升至640×368@25FPS,不仅能清晰展示面部细节,还可以完整呈现身体姿态、手势动作甚至背景场景
  • 全模态端到端架构:原生支持文本、音频、视频的实时理解与同步生成,无需依赖外部模块拼装,从根源上避免了多模块协同带来的延迟和错位问题

从流水线到原生因果流:重新定义实时交互逻辑

传统实时数字人系统的最大问题在于模块间的割裂:当你开口说话时,系统需要等待语音转写完成、大模型生成回复、语音合成完成,最后才能驱动数字人做出动作。这个过程不仅耗时漫长,各个独立模块还很难做到完全同步,很容易出现声画不同步的情况。

举个简单的例子:当你说一句话,系统需要按顺序完成多个独立步骤,最终呈现出的回应往往会比真人交流慢半拍,甚至出现嘴型和声音对不上的尴尬情况。

Wan-Streamer v0.2彻底改变了这种架构,它将用户的文本、音频、视频输入,与AI智能体的输出全部映射到同一条因果时间线上,不再需要等待一整段对话完成再进行处理。模型引入了流式单元的概念,每经过约160ms就会完成一次完整的交互闭环:

  • 感知当前160ms内的用户音视频输入
  • 更新共享的交互上下文与状态
  • 生成同步的语音和视频潜变量
  • 解码并输出上一单元的音视频响应

这意味着AI不需要等你说完整句话再开始思考,而是在你说话的过程中就能同步完成感知、理解、生成和解码的全流程,这种原生流式的建模方式,是实现极低延迟和全双工交互的核心基础。

从近景特写到完整场景:画质的跃升

Wan-Streamer v0.1版本已经验证了端到端原生流式音视频对话的可行性,但受限于192×336的分辨率,只能呈现近景特写,主要聚焦在面部和嘴型上,AI看起来更像一个“悬浮的头部”。

v0.2版本将输出分辨率大幅提升至640×368,这不仅仅是像素数量的增加,更是应用场景的质变。在新的画面中,你可以清晰看到AI的视线方向、身体姿态、自然的手势动作,甚至可以看到它面前的桌面和周围的房间布局,让虚拟交互的真实感大大增强。

快慢分工的双通路架构:兼顾画质与延迟

分辨率的提升意味着视频潜变量生成的计算量大幅增加,如果将这些计算任务放在原有的低延迟通路中,200ms的模型侧延迟底线必然会被突破。Wan-Streamer v0.2通过将模型拆分为两条并行通路,在物理硬件层面实现了解耦,完美解决了这个矛盾。

思考者:单卡快车道

Thinker模块部署在单张GPU上,负责所有对延迟敏感的任务:包括流式音视频感知、语言与状态更新、构建K/V缓存以保留上下文,以及音频解码。它就像对话中的“大脑”,可以快速听懂你的话语、记住交流上下文,并在极短时间内组织出回应语言,保证200ms的超低模型内部延迟。

执行者:多卡Ulysses并行集群

640×368的高分辨率视频生成需要极大的计算量,Performer模块被扩展为多GPU的Ulysses式上下文并行集群,专门承担这部分重载计算。系统会将长视频序列切分给多张显卡分工合作、并行去噪,而由于音频潜变量序列较短,切分反而会增加通信开销,因此音频生成不会进行序列切分,直接完成计算。

更关键的设计在于时序调度:单卡Thinker的工作窗口与多卡Performer的计算窗口是完全重叠的。当Performer集群在后台处理当前帧的高清视频潜变量时,Thinker已经在处理下一帧的用户输入,并解码上一帧的音频。通过这种“快慢分工、时序重叠”的架构,v0.2将额外的视觉生成成本从延迟敏感路径中剥离,在包含350ms双向网络预算的情况下,总远程交互延迟依然保持在约550ms。

Wan-Streamer v0.2 延迟保持部署拓扑时序图

万物皆可对话:想象力就是边界

只要能用自然语言描述,Wan-Streamer就能在虚拟世界里把对应的角色实时呈现出来,和你面对面交流。没有预设剧本,没有固定角色库,你的想象力就是唯一的应用边界。

你可以和秦始皇聊一聊统一六国的历史,听李白即兴吟诵新作,让蒙娜丽莎开口讲述她的故事,和清明上河图里的路人聊聊宋朝的市井生活,甚至可以问问你家的虚拟猫主子整天都在想些什么……

基于这种高度自由的角色生成能力,Wan-Streamer v0.2的典型应用场景包括:

  • 视频通话式AI助手:打开摄像头即可实现面对面交流,适用于口语陪练、面试模拟、心理咨询等需要“在场感”的场景
  • 场景化陪伴与教育:AI老师可以通过画面观察学生的表情,判断其理解程度并调整教学节奏;AI助手也可以在厨房里实时指导做菜的步骤和注意事项
  • 沉浸式游戏NPC:游戏中的角色可以拥有真实的表情、肢体语言和实时反应,与玩家进行真正的“面对面”对话,打破传统游戏NPC的预设台词限制
  • 无障碍交互:为听障用户实时生成带有精确唇语和手势的视频回应;为视障用户实时描述摄像头捕捉到的周围环境,帮助他们更好地感知外部世界

让AI能够自然地参与实时对话,需要它真正理解用户的话语、读懂表情,并在几百毫秒内给出综合反应。Wan-Streamer v0.2是在这条道路上的一次重要探索:通过原生流式架构与分布式推理拓扑,在单一模型的交互循环中同时完成理解与生成,让AI的沟通方式进一步逼近真人。

这是一条长期的研究路线,团队将持续迭代Wan-Streamer,敬请期待更多的突破。

项目与论文地址

官方项目地址:https://wan-streamer.com/

相关论文:

以上内容不代表本平台立场,仅供读者参考