SemVID:对象-动作-场景语义角色助力视频时序定位

长视频理解已经成为多模态大模型的核心能力之一,用户不再满足于了解视频中包含的内容,而是希望能精准获取事件的发生时间与边界,这类任务被称为视频时序定位(VTG)。但随着视频长度增加,视觉token的数量会大幅提升,推理成本也随之水涨船高,因此剪枝部分视觉token成为降低开销的直接思路。
传统的token剪枝方法大多面向视频问答任务,这类任务只需要少量关键帧即可回答问题,比如“视频里有什么”“人物在做什么”。但VTG的目标完全不同:它需要确定事件的起止时间,模型不仅要识别相关对象,还要捕捉动作前后的状态变化。如果仅保留最显著的几个画面,模型可以确认事件存在,却无法准确判断时间边界。
针对这一痛点,研究团队提出了SemVID,这是一个无需额外训练的token剪枝框架,其核心思路与传统剪枝方法截然不同——VTG的剪枝不是简单删除“不重要画面”,而是要保住一条支撑时间定位的证据链。
在VTG任务中,事件并非由单帧或少数几帧决定,而是由一系列连续的状态变化共同定义。事件边界附近的token负责标记变化的起点和终点,中间的token则负责连接前后的状态。如果这些中间节点被误剪,证据链就会断裂,模型虽然能识别部分相关元素,却无法形成连贯的推理路径,最终导致时间定位精度下降。
SemVID设定了两个面向VTG的剪枝目标:一是保留与查询语义高度相关的token,尤其是事件边界附近的关键证据;二是保留跨帧的连接性,让证据能够沿时间轴传播,避免变成孤立的碎片。
整个框架分为两个阶段,无需重新训练模型主干,仅在推理阶段完成token选择。第一步是为每一帧分配合理的token预算:如果平均分配预算,会浪费在无关片段上;如果仅根据查询相关度分配,预算又会集中在少数高相关帧,导致中间帧被剪空,时间链路断裂。因此SemVID同时考虑了查询相关度和帧间特征变化两个信号,既覆盖包含目标事件的相关帧,也保留靠近动作转折和事件边界的变化帧,确保预算分配涵盖完整的时间轴和证据链。
第二步是在每帧内部选择具体的token,SemVID显式区分了三类不同语义角色的token:
- Object token:保留与查询相关的对象证据,负责回答“发生了什么”。为避免重复选择同一物体附近的区域导致预算被相似局部占满,方法使用了最大边界冗余策略,让选出的token既相关又互补,覆盖更完整的对象证据。
- Motion token:保留动作转折相关的特征,负责回答“什么时候发生变化”。该类token通过相邻帧的局部特征变化筛选得到,并结合查询相关度过滤掉无关的背景运动,它们并非普通的运动区域,而是连接事件前后状态的关键中继节点。
- Context token:保留场景锚点信息,负责回答“证据发生在什么环境中”。在极端剪枝场景下,仅保留对象局部会让视频变成碎片化的证据,少量的场景锚点可以维持场景的连续性,帮助模型将对象和动作放回正确的语境中。
研究团队在两个公开数据集上,使用两款主流多模态大模型进行了评测,验证了SemVID在强压缩下依然能保持VTG所需的边界定位能力。实验结果显示,在相同的token预算下,SemVID在核心性能指标上整体优于现有剪枝方法;尤其是在低token保留率的场景下,其他方法往往出现明显的性能下降,而SemVID仍能稳定保持较高的定位精度。这说明SemVID的优势并非单纯减少token数量,而是将有限的token分配到真正影响时间定位的关键位置。
其中三个核心指标分别为:定位精度衡量最终的定位效果,关键证据保留率衡量核心信息是否被留存,跨帧连接性衡量证据能否沿时间轴连贯传播。进一步的消融实验验证了三类token的作用:移除对象相关token会导致定位精度和证据保留率下降,说明查询相关的对象证据是定位的基础;移除动作转折token会让定位精度和跨帧连接性下降最明显,证明动作变化token是连接事件前后状态的关键中继;移除场景锚点token也会导致跨帧连接性下降,说明少量场景信息能够帮助维持时间连续性,避免证据碎片化。
通过对比不同剪枝方法的注意力分布可以发现,相比其他现有方法,SemVID即使在仅保留极小比例token的极低预算下,依然能稳定聚焦在动作发生前后的语义相关区域,比如人物手部、交互物体以及动作发生的位置。
SemVID带来的核心启发是,VTG的剪枝不能只保留“看起来相关”的画面,而是要保留能够支撑边界定位的完整证据链。通过区分对象、动作转折和场景锚点三类语义token,SemVID在无需额外训练的前提下,能够将有限的token精准分配到关键位置,实现更稳定的长视频时序定位。当然该方法仍有改进空间,当前的动作相关token主要依赖帧间特征变化来刻画运动,在镜头移动、背景剧烈变化或存在较多遮挡的场景中,仍可能受到干扰。

