Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation

📅 2026-09-10
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
本文介绍Vidu S2系统,通过实时交互式数字角色模型和视频编辑模型解决实时生成及编辑720p视频的问题,支持动态参考更新与多种编辑功能。
📝 Abstract
We present Vidu S2, which comprises Vidu S2-Avatar, a real-time interactive digital-character model, and Vidu S2-Editing, a real-time video editing model. Moreover, we explore the feasibility of real-time spatial video generation for both Vidu S2-Avatar and Vidu S2-Editing. Compared with Vidu S1, Vidu S2-Avatar supports real-time 720p video generation, generation with dynamic references that can be updated at any moment, and stronger instruction following, such as dancing. Vidu S2-Editing supports editing a video stream in real time, including style rendering, clothing replacement, character replacement, and background replacement. Experiments show that Vidu S2 outperforms all baselines. A playable online demo is available at https://vidu.com/vidu-stream.
Problem

Research questions and friction points this paper is trying to address.

real-time
interactive
editable
spatial video generation
video editing
Innovation

Methods, ideas, or system contributions that make the work stand out.

real-time interactive
editable video generation
spatial video generation
dynamic references
🔎 Similar Papers
No similar papers found.
Jintao Zhang
Jintao Zhang
Tsinghua University
Efficient MLMlsysSystem for AIMachine LearningDataBase
Kai Jiang
Kai Jiang
School of Mathematics and Computational Science
Quasiperiodic SystemsApplied Mathematics & Computational Mathematics
J
Jintao Chen
Tsinghua University, Shengshu Technology
Xu Wang
Xu Wang
Tsinghua University
Computer networkwireless networkAIoT
D
Deyuan Liu
Tsinghua University, Shengshu Technology
J
Jungang Li
Tsinghua University, Shengshu Technology
D
Dechuang Chen
Tsinghua University, Shengshu Technology
M
Ming Lin
Tsinghua University, Shengshu Technology
J
Jingjiang Zhou
Tsinghua University, Shengshu Technology
H
Haopeng Jin
Tsinghua University, Shengshu Technology
Qi Jia
Qi Jia
Dalian University of Technology
Computer Vision,Image Processing
Xiaohang Wang
Xiaohang Wang
Zhejiang University
networks-on-chipenergy efficiencymany-corenetworked complex systemintelligent algorithms
Y
Yaole Wang
Tsinghua University, Shengshu Technology
Z
Zhanqiang Zhang
Tsinghua University, Shengshu Technology
R
Ran Li
Tsinghua University, Shengshu Technology
Z
Zhengkun Huang
Tsinghua University, Shengshu Technology
S
Shuyue Xiong
Tsinghua University, Shengshu Technology
Yuji Wang
Yuji Wang
Tsinghua University
CVMultimodalSegmentationMLLM
Z
Zikun Dai
Tsinghua University, Shengshu Technology
H
Hui He
Tsinghua University, Shengshu Technology
Y
Yang Luo
Tsinghua University, Shengshu Technology
Mang Ning
Mang Ning
PhD candidate, Utrecht University
deep learninggenerative models
Weiqi Feng
Weiqi Feng
Harvard University
Network and SystemsMachine Learning Systems
C
Chengyang Ye
Tsinghua University, Shengshu Technology
X
Xinyue Lin
Tsinghua University, Shengshu Technology