Shallow Robustness, Deep Vulnerabilities: Multi-Turn Evaluation of Medical LLMs
Existing medical large language models (LLMs) lack systematic robustness evaluation in multi-turn clinical dialogues; conventional single-turn benchmarks fail to capture real-world challenges such as contradictory inputs, misleading contextual cues, and authoritative bias. Method: We propose MedQA-Followup—a novel framework that formally defines and distinguishes shallow versus deep robustness in multi-turn medical question answering, introducing the “indirect–direct intervention” analytical axis. Leveraging MedQA, we construct a controllable multi-turn test suite simulating realistic clinical consultation disruptions. Contribution/Results: Experiments on five state-of-the-art medical LLMs reveal a dramatic accuracy drop—from 91.2% in single-turn settings to as low as 13.5% in multi-turn scenarios—with indirect contextual interference proving more detrimental than direct prompt manipulation. These findings expose structural fragility in sequential clinical interaction, offering critical risk awareness for clinical deployment and establishing a new evaluation paradigm for dialogue robustness in medical AI.