Multimodal Scenario Similarity Search for Autonomous Driving
This work addresses the absence of efficient multimodal scene similarity retrieval methods in large-scale autonomous driving datasets that jointly account for visual appearance and dynamic behavior. The authors propose a unified multimodal retrieval framework that, for the first time, systematically integrates explicit trajectory matching (Exo-Trajectory) with Transformer-based trajectory representations (ScenarioFormer), alongside vision embeddings trained via contrastive learning. Experimental results demonstrate that trajectory-based representations excel in dynamic scenarios such as cut-ins and turns, while visual methods are better suited for appearance-dominated scenes. Crucially, multimodal fusion substantially enhances overall retrieval performance, revealing the complementary nature of appearance and motion features in assessing scene similarity.