Scholar
Yong Man Ro
Google Scholar ID: IPzfF7cAAAAJ
Professor of Electrical Engineering, KAIST, ICT Endowed Chair Professor
Multimodal learning
Vision Language integration
Image processing and Computer vision
Follow
Homepage
↗
Google Scholar
↗
Citations & Impact
All-time
Citations
6,408
H-index
38
i10-index
153
Publications
20
Co-authors
31
list available
Contact
No contact links provided.
Publications
16 items
Noise Adaptive Streaming Audio-Visual Speech Token Enhancement for Robust Full-Duplex Spoken Dialogue Models
2026
Cited
0
From Coordinates to Candidate Regions: Temporal Change Localization via Region Selection in Remote Sensing Multimodal LLMs
2026
Cited
0
PRISM: Predictive Recomposition via Semantic Latent Decomposition for View-invariant Video Representation Learning
2026
Cited
0
Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding
2026
Cited
0
Diffusion Large Language Models for Visual Speech Recognition
2026
Cited
0
Robust Grounding with MLLMs against Occlusion and Small Objects via Language-guided Semantic Cues
2026
Cited
0
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
2026
Cited
0
Recursive Think-Answer Process for LLMs and VLMs
2026
Cited
0
Load more
Resume (English only)
Co-authors
31 total
Co-author 1
Konstantinos N Plataniotis
Professor, ECE Department, University of Toronto
Hak Gu Kim
Assistant Professor of GSAIM, Chung-Ang University
Wesley De Neve
Associate Professor at Ghent University (Belgium) & Ghent University Global Campus (Korea)
Truong, Cong Thang
The University of Aizu
Co-author 6
Minsu Kim
Google DeepMind
Seong Tae Kim
Assistant Professor of Computer Science, Kyung Hee University