文章摘要
近期,原生音视频全双工大模型SeedRealtime全量上线部署。它打破音视频交互技术瓶颈,将多类信息统一到端到端模型,实现感知、理解等同步进行。该模型具备音视频联合理解、主动交互等能力,在复杂环境中也能把握对话轮次。目前已实现技术规模化落地,未来团队将在延迟、感知决策等多方向持续突破。

近期,一款原生音视频全双工大模型正式推出,该模型通过统一架构原生融合音频、视频与文本,实现了边看、边听、边说的实时多模态交互体验,目前已完成全量上线部署。

作为迈向全模态交互的关键一步,这款名为SeedRealtime的模型,打破了此前音视频交互领域的技术瓶颈。在此之前,音视频实时交互长期存在两大痛点:一是级联系统依赖语音识别、视觉理解、文本生成等多个独立模块串联,延迟层层叠加,信息在传输和转换中不断损耗;二是多数端到端模型虽优化了流畅度,但仍依赖外置的语音活动检测模块判断对话轮次,本质上仍属于一问一答的半双工交互模式,无法实现真正的实时同步交互。

SeedRealtime的核心突破,在于将声音、画面、时序信息与交互表达统一到同一个端到端模型中。它不再遵循“先听完、再看完、最后作答”的线性流程,而是在连续的音视频数据流上,让感知、理解、决策与表达同步进行,让用户听到的内容和看到的画面能够共同参与每一次实时判断。

要实现这样的交互,首先需要解决对话节奏的判断难题。语音对话天然带有停顿,可以借此判断接话时机,但视频流始终处于持续变化的状态,模型需要在不断理解画面内容的同时,避免被背景噪声干扰,持续判断当前应该关注的对象、发言者身份,以及是否需要主动回应。而更深层的挑战,则在于音视频的联合建模与时序对齐——当用户说出“这个怎么弄”时,模型需要结合当前画面、用户手势、视线方向和历史动作,准确判断“这个”具体指代的对象;遇到同音词或模糊语音时,也需要借助视觉场景完成歧义消解。只有将声音、画面与时序信息统一建模,才能真正让所见、所闻与所说形成闭环,让模型不再被动等待用户提问,而是能够持续理解场景变化,在合适的时机主动发起交互。

音视频联合理解:实现所见所闻的闭环对齐

SeedRealtime的音视频联合理解能力,能够在多人、嘈杂的真实开放环境中,完成画面、声音与时序信息的精准对齐。在一场好友聚餐的场景中,当用户逐一介绍在场友人时,模型可以根据每个人的外形特征,将名字和本人精准对应——认出浅色头发的参与者、戴眼镜的友人,还能主动和被提及的对象打招呼;在后续的交谈中,模型可以始终将每个人的声音和身份绑定,准确分辨每一句话的发言者。当大家围绕旅行计划展开讨论时,模型可以听懂每个人的需求,比如有人想海边拍照逛海洋馆、有人怕热怕累、有人对海鲜过敏,并综合所有人的需求给出兼顾各方的旅行方案,整个认人、辨声、理解需求的过程都在同一场实时对话中完成。

在涉外餐饮场景中,当外籍食客面对中文菜单无从下手时,模型可以直接通过画面识别菜品,用外语进行推荐,还能结合文化背景解释菜品背后的故事,比如说明“鱼香肉丝”中没有鱼肉的原因,以及皮蛋的制作工艺。当服务员上菜时随口说“这道菜很下饭”,模型可以结合眼前的菜品,准确理解这句话的含义并翻译成外语传递给食客,实现视觉信息与语音信息在同一模型内的直接对齐,真正做到眼前有什么,就能回答什么。

主动交互能力:从被动响应到主动协作

传统的AI交互大多需要用户主动发起提问,而SeedRealtime具备持续的环境感知与主动表达能力,可以根据实时画面的变化自主判断是否需要介入交互,无需每次都等待用户开口。

比如在博物馆逛展时,用户提前告知“看到错金银铜虎噬鹿屏座就提醒我”,模型可以在镜头移动的过程中持续留意画面,当扫过这件展品时主动出声提醒。随后,模型还可以结合画面细节,讲解馆内的其他镇馆之宝,比如错金银四龙四凤铜方案座、长信宫灯等,同时介绍铸造、错金银、焊接等相关工艺,将用户的需求保存在上下文记忆中,在目标出现时精准提醒,充分体现了持续视觉感知与主动介入的能力。

在操作复杂设备的场景中,模型同样可以基于视觉状态变化提供实时反馈。比如当用户将整粒咖啡豆直接倒入萃取手柄时,模型可以快速指出操作误区,提醒用户需要先将咖啡豆磨成细粉;在萃取完成后,模型可以通过分析杯中油脂的成色和液量,主动给出调整建议,比如“下次萃取时间可以缩短2-3秒”,无需用户逐步提问,就能基于实际场景给出针对性的指导。

在学术研读场景中,当用户需要查阅相关论文时,模型可以结合网络结构图讲解技术原理;当用户要求“帮我盯着,翻到训练参数那部分提醒我”时,模型可以在快速翻页的过程中持续捕捉画面内容,准确识别出目标段落并主动叫停,随后报出关键的训练配置,展现了在连续画面流中识别目标并主动协作的能力。

流畅交互节奏:在复杂环境中精准把握轮次

对话轮次的判断是实时交互的关键,SeedRealtime不再依赖外置的语音活动检测规则,而是基于多模态信息进行持续决策,确保在该接话时不迟疑,该沉默时不打断,在复杂环境中也能保持自然的交流节奏。

在人流密集、环境嘈杂的公共场景,同伴闲聊时随口提到的无关内容不会触发模型回复;当用户正式询问相关信息时,即便信息已经从画面中移出,模型仍可以结合此前的场景信息,给出准确的答复并提供额外的实用信息。随后在二人边走边聊的过程中,模型可以持续关注眼前的画面,当看到相关标识时自然接话,提供针对性的指引,让嘈杂的环境不再成为干扰,闲谈中的关键信息也能被妥善留存,在需要时快速调用。

在家庭场景中,当模型需要协助孩子学习时,即便背景中有其他无关的对话声音,模型也不会被带偏,始终跟随用户的操作进行实时指导,真正做到该出声时不迟疑,受干扰时不跑偏。

根据端到端人工评测结果,与传统级联模型相比,SeedRealtime的音视频对话节奏问题减少了一半。模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等常见的交互卡壳现象显著减少,单次对话能够完整、顺畅交流的概率也有明显提升。

目前,SeedRealtime已完成全量上线部署,在行业内率先实现了音视频全双工技术的规模化落地,用户可以通过相关应用体验该项功能。

未来发展方向

尽管SeedRealtime已经实现了音视频全双工交互的规模化落地,但现实环境中的音视频交流依然充满挑战:背景嘈杂、人声重叠、画面持续变化,用户也会随时停顿、补充或打断对话。针对这些真实场景中的痛点,团队未来将在多个方向持续突破:

  • 更低的延迟与更自然的节奏:持续压缩“听到—理解—回应”的端到端时延,让打断、抢话、附和与停顿等真实对话中的微妙节奏被自然还原,不只是追求更快的响应速度,而是实现恰到好处的交互节奏。
  • 更主动的感知与决策:基于对画面与声音的持续理解,主动判断何时提醒、何时补充、何时递上用户正需要的信息,让模型不仅能“该说话时说话”,也能“该出手时出手”,提供更具前瞻性的协助。
  • 更稳健的多人复杂场景:在嘈杂环境、多人同框与多方对话中,稳定识别“谁在说话、在看什么、该回应谁”,将该项技术的应用场景拓展到更多真实的生活与工作场景中。
  • 从“能对话”到“能行动”:打通工具调用与现实世界的连接,让模型不仅能进行交流与观察,更能协助用户完成查询、预订与任务办理,将实时多模态理解转化为具体的实际行动。

团队希望,未来的AI交互不再局限于固定轮次的问答模式,而是能够在连续变化的真实场景中理解上下文、敏锐把握交互时机,并在最合适的时刻为用户提供精准的帮助。

以上内容不代表本平台立场,仅供读者参考