PVI: Plug-in Visual Injection for Vision-Language-Action Models
Existing vision-language-action models struggle with multi-stage manipulation tasks due to their reliance on semantically abstracted pretrained vision models, which often neglect geometric details and lack explicit temporal modeling. To address this, this work proposes a lightweight, encoder-agnostic, plug-and-play module that injects video-level visual representations—such as those from V-JEPA2 or DINOv2—into flow-matching action experts via a zero-initialized residual path. This enables single-stage fine-tuning without modifying the backbone architecture. The approach provides the first empirical validation that video-level features significantly outperform static image features in long-horizon manipulation tasks. Consistent performance gains are demonstrated on both simulated and real-world dual-arm cloth-folding benchmarks, with particularly pronounced improvements in multi-stage scenarios requiring state tracking.