CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

📅 2026-08-18
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
为解决视频编辑中多编辑意图联合理解和执行的问题,研究引入了CoinVE-200K数据集及CoinVE-Edit模型,支持复杂指令引导下的高质量视频编辑。
📝 Abstract
The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully executed within the same video. To address this issue, we introduce CoinVE-200K, a large-scale, high-quality dataset for Compositional Instruction-Guided Video Editing. CoinVE-200K contains 1080p video-editing pairs of up to 201 frames, covering diverse compositional scenarios where each sample involves 2 to 5 atomic editing operations. The instructions target humans, objects, and backgrounds, and cover edit types such as addition, removal, modification, and stylization. All samples are built through a carefully designed generation and filtering pipeline to ensure instruction faithfulness, visual quality, temporal consistency, and compositional diversity. We also introduce CoinVE-Bench, a benchmark for compositional-instruction video editing across diverse subjects, operation types, and instruction complexities. Furthermore, we present CoinVE-Edit, a 22B compositional video editing model built upon Wan2.1-T2V-14B and Qwen3-VL-8B-Instruct. CoinVE-Edit disentangles region-aware attention for different editing instructions, enabling precise multi-region editing while preserving irrelevant content and temporal coherence. Experiments on CoinVE-Bench show that CoinVE-Edit achieves strong performance in instruction following, compositional editing accuracy, visual quality, and temporal consistency.
Problem

Research questions and friction points this paper is trying to address.

compositional instruction-guided video editing
multiple editing intents
video editing datasets
Innovation

Methods, ideas, or system contributions that make the work stand out.

Compositional Instruction-Guided Video Editing
Region-Aware Attention
Temporal Consistency
🔎 Similar Papers
Fuchen Long
Fuchen Long
University of Science and Technology of China
Video Analysis
C
Cong Wang
Smart Creation Platform Department, Online Video BU, Tencent
Z
Zitao Gao
Smart Creation Platform Department, Online Video BU, Tencent
W
Wenhao Zhong
Smart Creation Platform Department, Online Video BU, Tencent
Y
Yu Cheng
Smart Creation Platform Department, Online Video BU, Tencent
Xiaolu Hou
Xiaolu Hou
Faculty of Informatics and Information Technologies, Slovak University of Technology, Slovakia
Cryptography Hardware SecurityAI Security
Y
Yan Li
Smart Creation Platform Department, Online Video BU, Tencent
Xiao Cao
Xiao Cao
Electrical and computing engineering, Virginia Tech
power electronicspackagingthermal managementthemo-mechanical
X
Xinlong Sun
Smart Creation Platform Department, Online Video BU, Tencent
X
Xi Chen
Smart Creation Platform Department, Online Video BU, Tencent
Y
Yu Liu
Smart Creation Platform Department, Online Video BU, Tencent