Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs
This study addresses the performance degradation of multilingual multimodal large language models in non-English visual reasoning by identifying the "Ghost Anchor" phenomenon, which induces modality asynchrony. To mitigate this, we propose ANCHOR, a framework employing an active visual anchoring mechanism that accelerates early visual semantic generation to effectively rectify cross-modal alignment discrepancies. Integrating mechanistic intervention analysis with specialized training strategies, our approach significantly outperforms existing baselines across multiple benchmarks. It achieves robust reasoning in both zero-shot and fine-tuning scenarios for non-English languages, establishing a novel paradigm for enhancing the cross-cultural generalization capabilities of multilingual MLLMs.