DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

📅 2026-08-30
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
本文提出DriftingVLA模型,通过单次前向传播生成完整动作块,利用每维时间漂移方法解决传统多步细化导致的延迟问题。
📝 Abstract
Conventional flow-based vision-language-action (VLA) models support expressive continuous action generation but rely on multi-step refinement to produce each action chunk, increasing latency in online robot control. To address this issue, we introduce DriftingVLA, a native one-step VLA that generates a complete action chunk with a single action-expert forward pass. Rather than learning a flow field that requires iterative integration at inference, DriftingVLA uses a distribution-drifting objective to learn a direct noise-to-action-chunk mapping for one-step deployment. Since robot action dimensions carry distinct control semantics and distributional characteristics, we further introduce Per-Dimension Temporal Drifting (PDTD). PDTD treats the complete temporal trajectory of each action dimension as a separate drifting unit, enabling finer-grained modeling and shaping of dimension-specific action distributions. This per-dimension decomposition applies only to the training objective; the shared VLA model still generates the complete action chunk jointly, thereby preserving cross-dimensional dependencies. DriftingVLA achieves 98.32% success on LIBERO, 81.09% on RoboTwin 2.0, and 77.67% across six real-world single- and dual-arm tasks, outperforming the evaluated multi-step flow policy and one-step VLA baselines. Native one-step deployment also delivers a 3.36-fold speedup in action-chunk generation, eliminating iterative refinement without sacrificing control performance.
Problem

Research questions and friction points this paper is trying to address.

Vision-Language-Action
One-Step Generation
Temporal Drifting
Robot Control
Latency
Innovation

Methods, ideas, or system contributions that make the work stand out.

Native One-Step Generation
Per-Dimension Temporal Drifting
Distribution-Drifting Objective
🔎 Similar Papers
2024-03-04Computer Vision and Pattern RecognitionCitations: 3
💼 Related Jobs
No related jobs found.
Y
Yuxuan Gao
University of Science and Technology of China, Hefei 230026, China
S
Shiqi Zhang
University of Science and Technology of China, Hefei 230026, China
Y
Yedong Shen
University of Science and Technology of China, Hefei 230026, China
Y
Yifan Duan
LYNSENSE, Shanghai, China
Wenhao Yu
Wenhao Yu
University of Science and Technology of China
RoboticsEmbodied AIPhysical AI
Xin Zhang
Xin Zhang
University of Science and Technology of China
S
Siyuan Cao
University of Science and Technology of China, Hefei 230026, China
Jiajun Deng
Jiajun Deng
The Chinese University of Hong Kong
Speech Signal ProcessingSpeech Laguage Modeling
Yanyong Zhang
Yanyong Zhang
University of Science and Technology of China ; Rutgers University (Adjunct Visiting Professor)
SensingCyber-Physical SystemsMulti-Modal PerceptionEfficient AI Systems