CoinVE-Edit:组合指令视频编辑性能标杆 开源数据集已发布

近期,视频智能创作领域推出了一套完整的组合指令视频编辑开源工具链,包括20万组样本的高质量数据集、22B参数的专业大模型以及标准化评测基准,可一次性完成多种复杂的视频编辑任务。
相关团队开源了CoinVE-200K组合指令视频编辑数据集、CoinVE-Edit 22B参数组合编辑模型以及CoinVE-Bench专业评测集,全方位覆盖了组合式视频编辑从数据训练、模型开发到性能评估的全流程。
行业现状与核心痛点
当前主流的视频编辑技术大多聚焦于单指令场景,仅能完成单一的编辑操作,针对多指令、多区域的组合式视频编辑缺乏系统的研究与落地方案。行业在该领域主要面临三大核心难题:
- 现有指令式视频编辑数据集大多聚焦于单一指令编辑操作,且普遍存在分辨率较低、视频帧数较少、编辑质量有限等问题,缺乏支撑组合式视频编辑训练的高质量数据。
- 组合指令视频编辑要求模型联合理解多条编辑指令,准确识别各指令对应的时空编辑区域,精确执行不同编辑操作,并在多处修改的同时保持无关内容不被破坏。
- 当前主流视频编辑评测基准主要面向单一编辑任务或整体质量评估,缺乏针对多指令、多区域、多操作组合编辑能力的系统性评测。
CoinVE-200K:高质量组合指令数据集
针对数据集不足的痛点,团队推出了CoinVE-200K组合指令视频编辑数据集,总计包含20万组高质量的视频编辑样本对。所有样本的视频分辨率均为1080p,单条视频最长可达201帧。每个编辑样本包含2到5个原子编辑操作,覆盖人物、物体、背景等多种目标主体,支持添加、移除、修改、风格化等四类核心编辑类型。与同类开源数据集相比,CoinVE-200K在分辨率、最大视频帧数以及平均编辑指令数三项关键指标上均表现更优。
该数据集的构建依托于一套严谨的数据生产与过滤流程:首先对源视频进行视觉内容分析,识别出前景人物、显著物体以及背景等可编辑区域;随后基于预定义的编辑分类体系,组合多个原子操作生成复合编辑指令,并根据指令生成编辑后的视频,保证空间合理性和时间连贯性;最后通过二次质量过滤策略,从指令遵循度、视觉质量、时间一致性以及未编辑区域一致性四个维度对样本进行筛选,确保数据集的整体质量。
CoinVE-Edit:多意图视频编辑大模型
针对组合编辑的技术难点,团队同步推出了CoinVE-Edit,一款参数规模达22B的组合式视频编辑大模型,该模型基于Wan2.1-T2V-14B与Qwen3-VL-8B-Instruct构建,可在单条视频上同时执行多种编辑任务。
该模型的核心创新点包括三个方面:
- 引入基于Qwen的多模态大模型,同时处理源视频内容与多条编辑指令,提取面向组合编辑的高层语义表示,实现多编辑意图的联合理解,而非孤立执行单条指令。
- 设计了Feature Connector模块,将多模态大模型输出的隐藏特征转换为编辑感知Tokens,包括与指令相关的可学习Tokens与视觉Tokens,为视频生成网络提供精准的语义条件。
- 通过Mask-based Conditioning机制预测时空编辑区域的掩码,生成不同的控制信号,实现不同编辑指令与对应视频区域的精准绑定,保证多区域编辑的同时,保留未修改内容的完整性与视频的时间一致性。
CoinVE-Bench:专业评测基准
为了解决组合编辑的评测难题,团队构建了CoinVE-Bench专业评测基准,包含361个高质量测试样本。每个测试样例包含2到5条编辑指令,围绕添加物体、删除物体、替换物体、替换背景、局部物体风格化、局部背景风格化六种原子编辑操作构建。
评测体系分为两大互补维度:一是基于多模态大模型的Checklist评测,主要评估指令遵循的组合正确性,涵盖编辑准确性、物理自然度与语义保持度三个核心维度;二是基于专用评估器的质量评测,从美学质量、技术质量、综合质量与时间稳定性四个维度评估编辑视频的感知保真度。整套评测体系覆盖4个核心维度与11个细粒度指标,为组合指令视频编辑模型的性能评估提供了统一且全面的框架。
模型性能实测对比
在CoinVE-Bench评测集上的实测结果显示,CoinVE-Edit模型在11个细粒度指标中有6个超过了当前主流的闭源视频编辑模型Seedance 2.0与Kling O3。尤其是在编辑准确性维度,模型在指令遵循、编辑范围准确性与编辑持续性三个子指标上均实现了领先,充分体现了其在复杂组合指令理解、局部区域精准编辑以及跨帧一致性保持方面的优势。
通过具体的编辑案例对比可以更直观地看到模型的性能差异:以“移除碗中的黄色玉米粒”这一编辑指令为例,Seedance 2.0与Kling O3均未能完成有效移除,其中Kling O3仅改变了玉米粒的颜色而未执行删除操作,甚至错误地移除了右上角的紫色玻璃杯;而CoinVE-Edit则精准遵循了所有编辑要求,仅对目标区域进行修改,同时保持了其他区域的完整性,在物理合理性上也表现更稳定,避免了不必要的内容错误。
数据集下载与使用指南
CoinVE-200K数据集包含20万组编辑样本与近118万个视频文件,总容量约2.8TB,以tar分片形式发布,包含源视频、编辑后视频、合并掩码、单指令掩码以及元数据文件。用户可通过以下方式获取与使用该数据集:
全量下载
download --dataset SandFox/CoinVE-200K --local-dir ./CoinVE-200K
按需下载(推荐先拉元数据试跑)
# 只下载元数据
download --dataset SandFox/CoinVE-200K \
metadata_coinve200k.jsonl --local-dir ./CoinVE-200K
# 按分片下载源视频
download --dataset SandFox/CoinVE-200K \
src_videos/src_video_000.tar src_videos/src_video_001.tar \
--local-dir ./CoinVE-200K
解压tar分片
cd CoinVE-200K
for tar in src_videos/*.tar; do tar -xf "$tar" -C src_videos/; done
for tar in tgt_videos/*.tar; do tar -xf "$tar" -C tgt_videos/; done
for tar in combined_masks/*.tar; do tar -xf "$tar" -C combined_masks/; done
for tar in instruction_masks/*.tar; do tar -xf "$tar" -C instruction_masks/; done
加载元数据
import json
with open("CoinVE-200K/metadata_coinve200k.jsonl", "r") as f:
samples = [json.loads(line) for line in f]
print(f"Total samples: {len(samples)}")
print(f"First sample instructions: {samples[0]['instruction']}")
每条JSON记录包含源视频路径、编辑后视频路径、2–5条编辑指令instruction、对应的操作类型instruction_operation(Replace / Add / Remove / Background Change等)、目标类型instruction_object(subject / object / background)、每条指令的空间掩码视频instruction_mask_video_paths,以及聚合掩码combined_mask_video_path,可直接用于监督组合指令编辑训练。

