Semantic Analysis of SNOMED CT Concept Co-occurrences in Clinical Documentation using MIMIC-IV
Clinical unstructured text contains rich semantic information, yet mining relationships among medical concepts remains limited by the disconnection between co-occurrence statistics and semantic representations. Method: Leveraging SNOMED CT–annotated clinical notes from MIMIC-IV, we systematically analyze the correlation between concept co-occurrence patterns (quantified via normalized pointwise mutual information, NPMI) and semantic similarity derived from pretrained embeddings (ClinicalBERT/BioBERT), revealing only weak correlation—indicating that co-occurrence fails to capture implicit clinical associations. We thus propose a dual-perspective framework integrating co-occurrence and embedding signals: (i) interpretable clinical topics are generated via embedding-based clustering; (ii) clinically meaningful concept pairs—absent in explicit co-occurrence—are identified using embedding proximity. Contribution/Results: The framework significantly improves downstream diagnostic prediction and prognostic modeling (e.g., mortality, readmission). It enhances phenotyping accuracy and annotation completeness, establishing a novel paradigm for clinical decision support.