RefCaptioner:多参考图视频描述与参考图精准绑定

在多模态大模型快速发展的当下,视频理解与多参考图结合的应用场景日益增多,如何实现视频描述文本与参考图的精准端到端绑定,成为了当前研究的热点与难点。
传统的视频描述任务仅要求生成忠实于视频内容的文本,但在多参考图的场景下,这一范式存在明显不足。当前的多模态大模型虽然能够完成简单的视频主体与参考图主体的对应,但当参考图数量增多时,模型的对应能力会大幅下降。一方面,多参考图中可能混入外观相似的干扰项,现有模型要么过度自信地全部引用,要么过于保守地遗漏有效信息;另一方面,很多模型无法正确将同一主体的不同视角、不同姿态的参考图归为同一实体,而是错误地拆分为多个不同对象。这使得视频描述的任务从“生成一段准确的文本”,转变为“在生成描述的同时建立可靠的视频对象与参考图的对应关系”。
针对这些核心问题,研究团队提出了RefCaptioner模型。该模型以Qwen3-VL-8B-Instruct为基座,在训练过程中兼顾了参考图识别能力的提升和基础视频描述能力的保留。在监督微调阶段,团队采用了1:1的混合采样策略,将多参考图训练数据和通用视频描述训练数据进行均衡采样。其中多参考图训练数据包含人工核验的图像标签描述,用于教授模型参考图选择和局部绑定能力;通用视频描述训练数据则用于保留模型的事实性表达、内容覆盖度和细节描述能力,避免模型退化为只会生硬添加参考图标签的系统。
仅靠监督微调,模型虽然能够学会输出格式,但难以在复杂样本中同时兼顾事实描述、参考图召回和错误抑制。因此团队设计了双层自适应奖励函数HCD-GRPO,将奖励拆分为两个互补的分支:一个分支用于检查描述的忠实性和完整性,另一个分支用于验证参考图的选择和绑定正确性,并对可观测的错误进行折扣处理。
-
事实描述奖励:先移除回答中的图像标签,再从主体、外观、动作、背景、镜头和风格六个维度检查关键事实是否覆盖,并借助视频问答库识别事实错误。
-
正确绑定覆盖奖励:只有被正确选择且放置在对应局部短语后的参考图,才能贡献正向的覆盖信号,单纯增加标签数量不会获得额外收益。
-
Distractor-Aware Evidence Suppression(DAES):训练样本会在正常参考图中随机插入无关干扰图片,模型无法提前知晓哪些是干扰项,一旦模型引用了视频中没有对应内容的图片,就会受到额外的惩罚。
-
Cross-Reference Semantic Coherence(CRSC):对于同一实体的多张不同视角参考图,评估器会从回答中抽取“事件—实体—参考图组”的关系,检查这些图片是否被正确聚合到同一局部描述中,避免被错误拆分。
通过这样的奖励函数设计,模型无法通过“多贴图像标签”来提升覆盖率,也不能通过“少贴标签”来规避错误,而是会在有效绑定的基础上,提升对干扰图的识别能力和同一主体多参考图的归组能力。
MRVBench评测基准
现有的视频描述基准通常仅评估文本是否覆盖视频内容,无法判断模型是否正确选择了参考图、标签是否对应到了正确的短语,以及是否误用了干扰图片。为了解决这一问题,研究团队构建了MRVBench评测基准,采用统一的协议同时评估视频的事实性和多参考图的 grounding 能力。
MRVBench的训练语料包含20000个视频和171354张参考图,公开的测试集包含462个与训练语料完全隔离的视频,其中185个为AIGC生成视频,277个为真实视频,共配备了3831张候选参考图。单个样本最多包含22张参考图,约60%的样本存在多图对应同一主体或视觉单元的复杂映射,约40%的样本包含人为注入的干扰图。此外,评测库还包含5846个视频关键事实和2172个短答案问题,覆盖主体、外观、动作、背景、镜头和风格六个维度。
MRVBench将评测拆分为五个方面:视频事实覆盖与正确性、参考图选择、局部短语绑定、干扰图鲁棒性,以及同一主体多参考图的一致性。所有模型都会接收相同的视频、任务指令和有序参考图,评分依赖冻结的关键事实、问答库和结构化标注,从而将“文本流畅性”和“图文对应准确性”区分开来进行评估。
实验结果与分析
研究团队将RefCaptioner与多款7B到38B参数的开源模型进行对比,同时加入Gemini-3.1-Pro和GPT-5.4作为闭源参考。8B参数的RefCaptioner在所有多参考图grounding指标上都取得了开源模型中的最佳表现,综合结果接近Gemini-3.1-Pro,并且优于GPT-5.4。
在最核心的reference grounding任务上,RefCaptioner同时保持了较高的选图精度、召回率和局部绑定质量,在干扰图排除和多视角主体归组方面明显优于其他开源模型。值得注意的是,多参考图的训练并没有牺牲模型的普通视频描述能力,在细粒度视频描述评测基准VDC Bench上,RefCaptioner在短描述、背景、主体和细节等多个维度都取得了最高准确率;在VCapsBench评测基准上,其描述覆盖度和一致性也超过了Qwen3-VL-8B基座模型,说明模型并没有退化为只会插入图像标签的系统。
消融实验结果显示,监督微调阶段能够显著提升主体参考图的召回率,但会暂时影响视频问答的表现;加入完整的HCD-GRPO奖励函数后,模型的事实描述能力得到恢复,干扰图排除能力和主体一致性也进一步提升。三个奖励组件分别对应事实性保障、错误引用抑制和跨参考图一致性,三者的作用相互补充,共同提升模型的综合性能。
为了观察模型在面对复杂参考图池时的稳定性,研究团队按照参考图的数量将样本划分为2-4、5-8、9-12和13+四个组别,将参考图召回率、局部绑定准确率和干扰图排除率相乘,得到一个对短板敏感的鲁棒性分数。实验结果显示,RefCaptioner在四个组别中都保持领先,即使在最困难的13+参考图场景下,其性能也优于GPT-5.4。
人工评测与下游应用
为了验证grounding caption的下游应用价值,研究团队使用“模型生成的描述+该描述实际引用的参考图”来重建原视频。他们基于开源视频生成模型Wan2.1-VACE-14B进行视频生成,生成过程中保持参数不变,仅替换不同模型生成的描述和参考图集合。随后邀请三位多模态专家采用成对Good/Same/Bad(GSB)协议,对RefCaptioner和各基线模型生成的重建视频进行匿名比较:Good表示RefCaptioner生成的结果更符合源视频,Bad表示基线模型的结果更好,Same表示两者效果相当。
评测结果显示,RefCaptioner在所有成对比较中获得的Good比例都高于Bad比例,在与开源模型对比时优势尤为明显。这一评测结果说明,RefCaptioner生成的描述和参考图组合能够保留更多源视频中的主体、外观、动作和场景信息,其端到端的效用优于其他模型。
总结
总的来说,RefCaptioner并没有简单地在普通视频描述文本后追加图片引用,而是让模型在生成描述的同时解决三个核心问题:哪些参考图真正与视频内容相关、每张参考图对应哪个局部视觉事实,以及相似但无关的图片应该如何排除。随着多参考图视频生成和编辑技术的发展,多参考图grounding将成为连接参考图和视频语义的关键接口。RefCaptioner为多参考图视频理解提供了有效的算法方案,而MRVBench则为多参考图视频caption的准确性评估提供了标准化的评测基准,二者共同为更准确、更可控的多参考图视频理解奠定了基础。

