🤖 AI Summary
To address critical challenges in multilingual image captioning—including semantic inconsistency across non-English languages, data scarcity, and weak cross-lingual reasoning—this paper systematically evaluates the generalization capability of attention-based Transformer models. Methodologically, it integrates multi-head self-attention, cross-modal alignment, and zero-shot/few-shot transfer learning, jointly leveraging multilingual BERT and XLM-R for language-agnostic visual–textual encoding. The work introduces two key contributions: (1) the first unified cross-lingual image captioning benchmark, and (2) a language-agnostic attention interpretability framework for probing cross-lingual alignment. Extensive experiments across 12 languages and 5 datasets demonstrate an average BLEU-4 improvement of 9.2%, with non-English captions achieving 87% fluency relative to native speakers. The approach significantly enhances cross-lingual consistency and model robustness.