文章摘要
近日,联合团队推出4B参数多模态大模型VideoChat3。它围绕“全面、高效、开源”优化,提出I3D - ViT、自适应帧分辨率机制,构建三套定制数据集,采用渐进式训练。评测显示其在多任务中表现出色,长视频场景效率高,是视频理解新范式但仍有提升空间。

视频作为记录物理世界的核心数据载体,也是AI连接数字与现实世界的关键入口。当前的视频智能系统早已不满足于“看懂一段短片”,而是需要具备看清细微动作、处理小时级长程信息、应对实时视频流的能力;不仅要回答“发生了什么”,还要精准定位证据出现的位置,判断何时应该给出回应。

但随着视频时长增加,海量视觉Token会快速推高训练与推理成本,如何用一个高效模型同时覆盖短视频、长视频与在线流式视频的理解需求,成为行业亟待解决的问题。

近日,由多所高校与实验室组成的联合团队推出了VideoChat3——一款面向通用视频理解的4B参数多模态大模型。这款模型围绕“全面、高效、开源”三大核心目标,从视觉编码器架构、流式感知机制与训练数据体系三个维度进行了系统性优化。

实测数据显示,VideoChat3在时序感知、长视频理解、视频推理、时序定位与在线流式理解等多个任务上都取得了极具竞争力的表现,尤其在长视频推理场景中,显著降低了视觉Token数量与计算成本。更重要的是,团队实现了全栈开源,包括训练数据、代码与模型权重全部开放,旨在推动视频理解大模型开源生态的建设。

从逐帧编码到原生时空建模

目前多数视频多模态模型仍沿用图像理解的处理逻辑:先对视频进行稀疏采样,将每一帧作为独立图像编码,再将大量视觉Token输入大语言模型完成推理。这种方案实现简单,但存在明显局限:稀疏采样可能丢失短时动作与细微变化,而相邻帧间的大量重复信息又会大幅增加语言模型的上下文长度与计算负担。

为解决这一问题,VideoChat3提出了Inflated 3D Vision Transformer(I3D-ViT),将时序建模前移至视觉编码阶段,让视觉编码器具备原生时空建模能力。其核心思路是将连续帧划分为短时片段,在片段内部进行联合时空注意力建模,再沿时间维度进行池化。这样一来,相邻帧间的运动线索与冗余信息可以在进入大语言模型前完成整合,无需等到语言模型阶段再处理大量重复的逐帧表征。

在默认配置下,I3D-ViT可实现约16倍的时空压缩。这里的“压缩”并非简单丢帧:模型先在片段内部建立时空关联,再对融合了局部运动信息的特征进行时间池化,目标是在有限的上下文预算下保留更密集的视频证据。

动态视觉预算:让模型“按需专注”

传统离线视频问答通常默认模型已完整观看整个视频,但真实的视频流不会等待模型准备就绪。面对行车记录仪、持续监控画面或第一视角记录视频,模型需要一边接收新内容,一边判断是否已收集到足够的证据。如果每个时刻都以高分辨率处理,不仅成本高昂,也完全没有必要。

为此,VideoChat3设计了自适应帧分辨率机制,通过三种状态组织流式感知过程:

  • </Silence>:当前窗口未发现与问题相关的证据,模型保持静默,以低成本继续观察;

  • </Standby>:已捕捉到潜在线索,但证据尚不充分,模型暂不回答,并提升下一窗口的视觉分辨率;

  • </Response>:证据已足够充分,模型生成回答,随后回到低成本监测状态。

这种机制形成了由模型状态驱动的闭环:常规片段采用低分辨率预算编码,当检测到潜在线索后,下一窗口自动提升至高分辨率观察。模型由此可以将更多视觉计算资源分配给真正影响回答的关键片段,而非对整段视频平均分配资源。

消融实验进一步验证,这一设计的优势并非单纯来自“使用更多像素”。在OVO-Timing基准测试中,自适应策略的平均F1得分为35.5,高于固定低分辨率方案的33.5与固定高分辨率方案的30.5;其视觉预算仅为始终使用高分辨率方案的30.2%。这说明在合适的时机提升感知精度,比全程维持高分辨率更加高效。

定制数据集:覆盖全场景训练需求

模型架构决定了处理视频的方式,而训练数据则决定了模型能掌握的能力边界。除了社区现有开源数据外,VideoChat3团队构建了三套高质量定制数据集,分别针对细粒度视频理解、长视频理解与流式视频理解进行优化:

VideoChat3-Academic2M:将稀疏标注转化为完整证据回答

该数据集包含约227万条来自公开学术数据集的视频描述与问答样本。原始学术数据通常有明确的任务定义与可靠标注,但答案往往只是选项字母、单个短语或简短事实。团队在不改变原始语义标签的前提下,将这些稀疏答案改写为包含可观察证据与时间线索的自然语言回答,并增加了一致性验证与错误过滤流程,降低改写过程中引入无依据细节的风险。这种处理既保留了原始标注的语义可靠性,又为模型提供了更充分的视觉证据与时序监督,有助于提升视频理解、证据定位与回答生成能力。

VideoChat3-LV116K:为长视频建立可核查的事件账本

该数据集包含约11.62万条长视频数据。长视频的难点并非仅仅是帧数更多,而是关键证据可能稀疏分布在数分钟甚至更长的时间范围内。团队先过滤低质量、重复或语义贫乏的视频,再结合镜头边界与时长约束进行分段;随后生成并核验片段级描述,最终将带时间戳的局部证据组合为完整视频标注,用于时序定位、长视频问答与摘要等任务。这一流程相当于为长视频建立了一份可核查的“事件账本”,再据此构建需要跨片段聚合与推理的训练样本,减少直接对整段长视频生成标注时可能出现的遗漏与噪声。

VideoChat3-OL617K:将离线问答转化为流式训练信号

该数据集包含61.72万条在线流式样本。团队首先定位回答问题所需的关键视觉片段,通过裁剪片段复核证据是否充分,再将视频转换为由多个窗口与状态Token交错组成的因果序列:无关窗口标记为</Silence>,出现线索的窗口标记为</Standby>,证据完整后标记为</Response>并生成最终答案。这种设计将传统“看完再答”的离线问答数据,转化为“持续观察、积累证据、适时回答”的训练信号,为模型学习主动响应提供了明确的监督。加入VideoChat3-OL617K后,消融实验中的OVO-Timing平均F1从4.0提升至35.5,同时多项离线视频问答指标基本保持稳定。

渐进式四阶段训练:逐步构建全能力

VideoChat3采用渐进式四阶段训练流程,逐步构建完整的视频理解能力:

  1. 视频视觉编码器预训练:以图像预训练的MoonViT为基础初始化I3D-ViT,确保视觉表征能够被语言模型有效接收;

  2. 视频-语言对齐:进一步建立紧凑视频Token与语言空间之间的对应关系;

  3. 视频指令微调:在多类图像与视频描述、问答数据上训练,让模型具备通用指令遵循能力;

  4. 长视频与流式指令微调:重点训练长程检索、时序定位、证据聚合、状态判断与主动响应能力。

这种渐进式训练策略让视觉表征、跨模态对齐、通用理解与复杂时序交互能力逐步衔接,降低了多目标同时优化的难度。整个训练过程仅使用了25M条训练样本,便在多类视频理解任务上取得了极具竞争力的表现,展现出极高的数据利用效率。

全维度评测:兼顾离线与在线能力

团队从通用离线视频理解与在线视频理解两个维度进行了系统评测:

在通用离线视频理解评测中,VideoChat3-4B展现出全面的能力,在时序感知、长视频理解、复杂视频推理与时序定位等多个维度都取得了领先表现。与同规模的开源模型Qwen3-VL-4B相比,VideoChat3在19项可直接对比的指标中有18项实现了提升。其在长视频理解与时序定位任务上的优势尤为突出:在Video-MME基准上取得70.1分;在TimeLens的三个评测分项中全面领先同规模开源模型,甚至超过了GPT-5等闭源模型。

在在线视频理解评测中,VideoChat3在六项感知与记忆汇总指标中的四项取得最佳结果,展现出优秀的流式输入处理能力:其ODVBench得分为72.3,StreamingBench指标为83.0,River平均得分为42.8。同时,模型真正实现了主动响应视频内容,在强调响应时机的OVO-Timing基准上,平均F1达到35.5,优于带有额外2B模块的专用模型Em-Garde。在ProactiveVQA的多个子集上,VideoChat3也相较Qwen3-VL-4B实现了性能提升。

整体来看,与Qwen3VL-4B、Molmo2-4B等此前的开源模型相比,VideoChat3不仅实现了性能提升,更真正将离线通用能力与在线处理能力合二为一,成为兼顾多场景的视频理解“多面手”。

长视频场景下的效率优势

随着视频长度增加,前置压缩的价值愈发明显:I3D-ViT在视觉编码阶段进行显式时空建模,实现了更高的视觉Token压缩比。虽然视觉编码器本身的耗时略高于逐帧编码方案,但可以大幅减少需要输入语言模型的视觉Token数量。由于语言模型的长序列计算成本增长极快,这种“视觉端多做一些、语言端少处理一些”的权衡,会随着输入视频变长与后续语言模型尺寸增大而愈发明显。

在NVIDIA H200、Hugging Face Pipeline与FlashAttention-2的测试环境下:

  • 输入512帧时,VideoChat3的总延迟为3.596秒,Qwen3-VL为3.838秒;

  • 输入1024帧时,两者总延迟分别为8.099秒与12.251秒;

  • 输入2048帧时,VideoChat3将总延迟从44.449秒降至20.412秒,将FLOPs从15.150×10¹⁵降至5.738×10¹⁵,同时将显存占用从106.913 GB降至80.775 GB。

VideoChat3:全面、高效、开源的视频理解新范式

全面,体现在其对多类视频任务的统一覆盖。VideoChat3不仅能够识别细粒度动作、理解长视频和定位事件发生区间,还能够持续感知视频流,并判断何时保持静默、何时作出回应。围绕这些能力,团队从模型架构、训练数据和训练策略三个层面进行协同设计,使通用视频理解、长程时序推理与在线主动响应能够在同一模型中兼顾。

高效,是VideoChat3在模型设计上的核心目标。I3D-ViT将时空建模与冗余压缩前移至视觉编码阶段,自适应分辨率机制则根据事件重要性动态调整感知预算,使模型能够以更少的视觉Token处理长视频与流式输入,在保持理解能力的同时降低计算开销。在模型推理高效之外,VideoChat3整体的训练过程也体现出了高效的数据利用效率。

开源,则是VideoChat3区别于许多视频多模态模型的重要特征。团队全面开放模型权重、代码、数据,为研究者复现、分析和开展后续研究提供了较为完整的基础。

总体而言,VideoChat3以4B参数规模,在效率、能力覆盖与开放性之间取得了良好平衡。当然,面向更强、更可靠的通用视频智能助手,其在复杂时序推理、主动响应精度和真实场景部署效率等方面仍有进一步提升空间。VideoChat3提供的并非这一问题的最终答案,而是一个高效、全面且可复现的开放起点。

以上内容不代表本平台立场,仅供读者参考