OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

📅 2026-08-24
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
研究提出OptiSight框架,结合语义理解和几何控制解决室内自主导航问题,通过视觉-语言模型和几何伺服实现高效导航。
📝 Abstract
Autonomous indoor navigation requires both semantic understanding and precise geometric control. We propose OptiSight, a hybrid framework that combines Vision-Language Model reasoning with deterministic visual servoing through a finite-state Chain-of-Thought architecture. Grounded-SAM localizes open-vocabulary targets, while camera projection geometry converts visual observations into navigation commands without requiring dense mapping. The VLM is queried only at key decision points, reducing computational overhead while geometric control handles continuous navigation. Experiments in AI Habitat demonstrate reliable zero-shot navigation across diverse indoor scenarios, including obstacle avoidance and semantic ambiguity, while operating within an 8~GB VRAM budget. The source code is available at https://github.com/avanalperen/OptiSight-Python-Multimodal-CoT-for-Visual-Reasoning.
Problem

Research questions and friction points this paper is trying to address.

autonomous indoor navigation
semantic understanding
geometric control
Innovation

Methods, ideas, or system contributions that make the work stand out.

Vision-Language Model
visual servoing
Chain-of-Thought
Grounded-SAM
camera projection geometry
💼 Related Jobs
No related jobs found.
A
Alperen Avan
Institut de Robòtica i Informàtica Industrial (CSIC-UPC)
Jordi Sanchez-Riera
Jordi Sanchez-Riera
Institut de Robòtica i Informàtica Industrial