AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

📅 2026-08-18
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
为解决扩散变换模型中因均匀上采样导致的冗余计算和细节一致性问题,提出AViTS框架,通过自适应时空令牌选择减少高分辨率计算并提高效率。
📝 Abstract
Diffusion Transformers (DiTs) achieve high-quality generation but are costly due to iterative sampling. Dynamic-resolution sampling reduces early-stage cost by denoising at low resolution; however, uniformly upsampling all latent tokens at resolution transitions incurs redundant computation and may degrade fine-detail consistency. Existing partial upsampling strategies typically rely on local latent structure cues or single-step statistics, making it difficult to jointly capture token-text semantic relevance and token-wise representation dynamics across diffusion steps. We propose AViTS, an adaptive spatiotemporal token selection framework for dynamic-resolution DiTs. AViTS models spatial importance via latent-text attention and temporal importance via token-level feature variation across diffusion timesteps, and fuses them to enable spatiotemporal importance-aware selective upsampling: it prioritizes resolution refinement for critical tokens while deferring less important ones, thereby reducing redundant high-resolution computation and improving the quality-efficiency trade-off. AViTS achieves up to 6.34x on FLUX and nearly 9x FLOPs reduction on Qwen-Image-Edit and FLUX.1-Kontext-dev, orthogonal to distillation, quantization, and feature caching, and reaching 14.76x with distilled models. Code: https://github.com/QHR69/AViTS
Problem

Research questions and friction points this paper is trying to address.

Diffusion Transformers
Dynamic-resolution Sampling
Spatiotemporal Token Selection
Redundant Computation
Fine-detail Consistency
Innovation

Methods, ideas, or system contributions that make the work stand out.

Adaptive Spatiotemporal Token Selection
Dynamic-Resolution Generation
Diffusion Transformers
Latent-Text Attention
Token-Level Feature Variation
H
Haoran Qin
Shanghai Jiao Tong University, China; Shandong University, China
Z
Zhengan Yan
Shanghai Jiao Tong University, China
S
Shikang Zheng
Shanghai Jiao Tong University, China
X
Xiaobing Tu
Terminal Intelligent Computing Division, Alibaba Cloud, China
J
Jiacheng Liu
Shanghai Jiao Tong University, China
Yuqi Lin
Yuqi Lin
Zhejiang University
Computer VisionMultimodal Foundation Model
Chang Zou
Chang Zou
Intern at EPIC Lab, Shanghai Jiao Tong University
Generative modelsImages and Videos generation
J
JinShan Liu
Xi’an Jiaotong University, China
P
Peiliang Cai
Shanghai Jiao Tong University, China
Xiantao Zhang
Xiantao Zhang
Beihang University
Large Language ModelsNatural Language ProcessingArtificial IntelligenceData Curation
J
Jinkui Ren
Terminal Intelligent Computing Division, Alibaba Cloud, China
Linfeng Zhang
Linfeng Zhang
DP Technology; AI for Science Institute
AI for Sciencemulti-scale modelingmolecular simulationdrug/materials design