From Density to Biopsy Decisions and Malignancy Prediction: A Benchmark Study of Multimodal Large Language Models Against Radiologists in Digital and Contrast-Enhanced Mammography
研究对比了四种多模态大型语言模型与放射科医生在乳腺密度评估、BI-RADS评估、活检候选确定及恶性概率估计上的表现,发现放射科医生在分类任务上更优,但某些模型在连续恶性概率估计中接近人类水平。