M2G-Eval: Enhancing and Evaluating Multi-granularity Multilingual Code Generation
Existing code LLM evaluation benchmarks suffer from coarse-grained assessment and limited language coverage, failing to capture fine-grained cross-lingual capability disparities. To address this, we propose M2G-Eval-Coder—the first code generation evaluation framework supporting four granularities (class, function, code block, and line) across 18 programming languages, comprising over 17K training tasks and 1,286 contamination-controlled, human-annotated test samples. We introduce a novel multi-granularity + multilingual co-evaluation paradigm, systematically benchmarking 30 models. Our analysis reveals an ascending difficulty trend from line- to class-level generation, distinct performance patterns between full- and partial-language-support models, and measurable cross-lingual conceptual transferability; we further confirm strong cross-lingual performance correlation. Leveraging supervised fine-tuning (SFT) and GRPO optimization, our approach achieves significant gains over baselines across all granularities.