VLX-VR登顶MINERVA 打破长视频推理时长诅咒

如果给模型一段90分钟的游戏解说视频,再提问主播介绍的第二位宗师段位玩家的头像框图案是什么,这个任务看似简单,但模型需要从近一小时的内容里定位几秒的线索,记住人物出现顺序,找到对应片段后识别细节。VLX-VR最终给出的答案是鲨鱼牙齿,这类跨时段的视频推理任务,已经超出了传统视觉语言模型的能力边界。
传统的视觉语言模型更擅长理解短视频内容,回答视频中当下发生的事件,但当视频时长扩展到几十分钟甚至数小时后,模型需要面对的不再是更多的画面,而是一条持续展开的完整时间线。VLX系列此前已经推出了Flow、Seek、Go三款模型,分别覆盖持续感知、精准定位与行动决策等能力,而最新发布的VLX-VR,则进一步将视觉推理能力扩展到动态长视频场景,支持跨时段的复杂推理任务。
在谷歌DeepMind推出的MINERVA视频推理基准测试中,VLX-VR以78.8%的视频问答准确率登顶,超越了Gemini 3.5、GPT-4.1等一众国际旗舰模型,刷新了当前公开评测的最高成绩。
更值得关注的是,VLX-VR打破了行业普遍存在的“视频越长准确率越低”的规律。当视频长度增加时,多数模型的表现会出现明显下滑,但VLX-VR在15分钟以上的长视频中,推理表现反而超过了短视频场景。
长视频理解的难点并非简单增加输入长度,MINERVA基准包含超过1000道问题、200多段视频,时长从不足2分钟覆盖到1.5小时以上,场景涵盖体育、短片、教学等多个领域。与传统视频问答只关注单帧内容识别不同,MINERVA中的问题需要模型结合多个时间片段的信息完成判断——比如一个人物此前出现的动作,可能在数十分钟后才成为回答当前问题的关键证据。传统处理长视频的方法通常需要将视频切分为多个短片段分别处理,但这种方式容易割裂原本连续的时间上下文,模型还需要额外重建片段间的关联。而VLX-VR无需人工切片,可以原生支持小时级超长视频的端到端推理,直接面向完整视频进行理解,有助于保留连续的时间上下文,让模型沿着事件发展过程完成完整推理。
长视频场景中普遍存在注意力稀释问题:视频越长,进入模型上下文的信息越多,关键线索之间的距离也越远。长视频真正考验的,不是模型能看到更多内容,而是能否记住真正有价值的信息。MINERVA恰好将这种长视频推理挑战推向了极限,在该基准测试中,人类的平均准确率达到92.54%,而MINERVA原论文报告的最佳模型Gemini 2.5 Pro Thinking仅为66.20%。VLX-VR的分时长测试结果显示,其准确率并未随视频时长增加而下降:在5分钟以下的短视频中,VLX-VR以76.70%的准确率高于Gemini 2.5 Pro Thinking的68.87%;进入15分钟以上的长视频区间,Gemini 2.5 Pro Thinking的准确率降至57.97%,GPT-4.1更是降至47.25%,而VLX-VR的准确率反而提升至80.92%,领先幅度从短视频的约7.8个百分点扩大到近23个百分点。按三档准确率计算,VLX-VR的跨时长准确率方差仅为2.97,对应标准差约1.72个百分点,视频从短到长,准确率始终保持稳定。
在复杂视频推理中,仅有正确答案并不足以证明模型真正理解了视频。模型是否找到了关键片段、识别了对应对象、建立了前后事件的关联,都会影响回答的可靠性。为了解决这一问题,MINERVA为每道题提供了人工标注的推理轨迹,记录了解答过程中的关键时间点、动作、对象和推理步骤,让模型的输出过程可以被回溯分析。平均每条推理轨迹约92个词,其中99.6%包含时间戳,平均标注约4个时间点。在VLX-VR回答正确的样本中,模型推理与人工参考轨迹的一致性高达96.2%,这表明VLX-VR不仅在最终答案准确率上表现突出,其推理过程也与人类思考路径高度一致。这种可追溯能力在机器人、智能终端或视频分析等真实应用场景中尤为重要,当模型出现判断偏差时,开发者可以定位问题来自时间定位、视觉理解还是后续推理过程,而非只能面对一个无法解释的结果。
除了整体推理表现外,VLX-VR在多个关键能力维度上同样保持领先:阅读理解准确率达到90.76%,模型可以读取字幕、标识、说明文字等视频内文本并用于后续判断;情境感知准确率达到90.32%,能够理解当前场景、人物行为和环境状态;时间推理准确率达到85.95%,可以梳理事件顺序和跨时段关联;数值推理准确率达到85.71%,可以处理视频中的数量关系和计算任务。这些能力共同组成了完整的视频推理链:找到关键事件、连接时间线、完成最终判断。
在真实视频场景中,VLX-VR还需要面对更加复杂的未知任务。比如在一个场景为篮球馆的视频中,人物却做出了足球踢球、顶球的反常动作,模型需要主动发现异常行为并定位对应时间点。在这一测试中,Gemini-3.1-pro将视频误判为倒放,随后围绕错误假设展开分析,而VLX-VR则准确识别出5个反常动作并给出了对应时间点。除了开放场景理解,VLX-VR还需要处理持续状态变化带来的时间推理挑战,比如在一段棋局视频中,模型需要找到首次将军发生的位置,追踪后续棋局变化,判断终局前白方还进行了多少次移动。这类任务的关键并非识别某一个瞬间,而是持续维护事件状态,理解不同时间点之间的关联。从MINERVA基准到真实开放视频场景,VLX-VR展现出了对复杂长视频任务的持续理解能力。
2025年2月,相关团队开源VLM-R1,首次将R1式强化学习推理框架引入视觉领域,而VLX-VR则将这套视觉推理能力扩展到了动态长视频场景。与静态图像相比,视频多了一个至关重要的维度——时间,事件如何发生、状态如何变化,只有放到连续过程中才能看清。智能终端始终面对变化中的环境,对物理AI来说,理解眼前这一刻,也意味着知道此前发生过什么,以及这些信息会如何影响当前判断。VLX系列围绕物理世界理解形成了完整的能力分工:VLX-Flow负责持续感知与实时响应,VLX-Seek负责精准理解目标位置与空间关系,VLX-Go将视觉理解进一步连接到行动,而VLX-VR则可以看完整段视频,并在更长时间尺度上完成深度推理。随着这些能力在端侧持续衔接,机器人、智能眼镜和巡检设备看到的,将不再只是眼前的单帧画面,而是一段能够被持续理解的完整世界。

