Diagnosing Generalization Failures in Fine-Tuned LLMs: A Cross-Architectural Study on Phishing Detection
This work addresses the challenge of diagnosing generalization failures in fine-tuned large language models (LLMs) for high-stakes tasks such as phishing detection. We propose a multi-layer diagnostic framework that integrates SHAP value analysis with mechanistic interpretability techniques to conduct a cross-architecture investigation of generalization behavior across diverse datasets, focusing on prominent models including Llama 3.1, Gemma 2, and Mistral. Our study uncovers a synergistic interaction between model architecture and data diversity, identifies architecture-dependent failure modes, and establishes a reproducible diagnostic paradigm. Experimental results demonstrate that Gemma 2 9B achieves an F1 score above 91% under data diversity, while Llama 3.1 8B exhibits significant performance degradation due to insufficient fusion capabilities; in contrast, Mistral displays robust generalization across varying training paradigms.