RefVideo-6M: A Reliable Reference-Based Dataset for Instructional Video Editing

📅 2026-08-26
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
为解决现有视频编辑数据集存在目标视频质量低及缺乏视觉参考的问题,通过构建包含500万视频样本、100万图像样本及600万视觉参考的RefVideo-6M数据集,并基于此训练了Ref-MoT模型以提高编辑质量与可控性。
📝 Abstract
Recent advances in video editing have been largely driven by large-scale instruction-based datasets. However, existing datasets still suffer from two critical limitations. First, target videos are commonly produced by automatic editing models, which may introduce visible artifacts and unreliable supervision signals. Second, most public datasets rely primarily on textual instructions, while lacking visual references that are crucial for precise, identity-preserving, and controllable editing. To address these limitations, we introduce RefVideo-6M, a large-scale reference-guided editing dataset containing 5 million video editing samples and 1 million image editing samples. To ensure reliable supervision, our dataset uses a construction pipeline that treats artifact-free real videos as editing targets and generates quality-filtered input conditions with multiple editing experts. In addition, it provides approximately 6 million visual references, covering diverse reference types and editing scenarios, thereby enabling models to learn fine-grained visual correspondence beyond text-only instructions. Based on RefVideo-6M, we further train a reference-guided video editing model, Ref-MoT, to evaluate the effectiveness and scalability of the proposed dataset. Extensive experiments demonstrate that RefVideo-6M provides substantially more reliable supervision than existing datasets and enables the training of powerful editing models with improved visual quality, controllability, and reference consistency. The open-source dataset is available at https://huggingface.co/datasets/RefVideo6M/RefVideo6M.
Problem

Research questions and friction points this paper is trying to address.

video editing
instruction-based datasets
artifacts
visual references
Innovation

Methods, ideas, or system contributions that make the work stand out.

reference-based dataset
instructional video editing
visual references
reliable supervision
quality-filtered
🔎 Similar Papers
💼 Related Jobs
No related jobs found.
Bojia Zi
Bojia Zi
The Chinese University of Hong Kong
AGI
Xiaoyan Yang
Xiaoyan Yang
Advanced Digital Sciences Center
databasedeep learningtext mining
Y
Yu Zhou
Institute of Artificial Intelligence, China Telecom (TeleAI); Sun Yat-sen University
R
Ruijie Sun
Institute of Artificial Intelligence, China Telecom (TeleAI); Fudan University
L
Lihan Zhang
Institute of Artificial Intelligence, China Telecom (TeleAI); Tsinghua University
Bin Liang
Bin Liang
The Chinese University of Hong Kong
NLPdata miningmachine learningtext mining
K
Kam-Fai Wong
The Chinese University of Hong Kong (CUHK)
Haibin Huang
Haibin Huang
Principal Research Scientist at TeleAI
Computer GraphicsComputer VisionGeometric Modeling3D Deep Learning
C
Chi Zhang
Institute of Artificial Intelligence, China Telecom (TeleAI)
X
Xuelong Li
Institute of Artificial Intelligence, China Telecom (TeleAI)