SGPDFuse: Semantically-Guided Physics-Disentanglement General Multi-Modal Image Fusion

📅 2026-08-29
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
本文提出SGPDFuse方法,通过语义-物理参数桥和语义对齐机制解决多模态图像融合中区分本质内容与物理退化的问题。
📝 Abstract
Multimodal image fusion (MMIF) aims to integrate complementary sensor data into a single representation that preserves intrinsic scene reality while eliminating environmental interferences. Most existing approaches rely on blind feature aggregation, which excels at signal accumulation but fails to distinguish essential content from physical degradations. We propose SGPDFuse, which bridges this gap by mapping inputs into a physics-disentangled structural representation via a Semantic-Physical Parametric Bridge (SPPB) built on pretrained vision foundation models, utilizing the Intrinsic-Variation principle to decouple invariant scene attributes from transient environmental factors. To guide this decomposition, we introduce a Semantic Alignment mechanism: we explicitly anchor the fused representation to salient semantic features in the same foundation model feature space via cosine similarity to preserve critical targets, while enforcing physical texture fidelity through Gram-matrix regularization to strictly eliminate unnatural artifacts. Extensive experiments demonstrate that SGPDFuse achieves state-of-the-art performance across infrared-visible, multi-focus, and multi-exposure benchmarks using a single architecture.
Problem

Research questions and friction points this paper is trying to address.

Multimodal Image Fusion
Feature Aggregation
Physical Degradations
Innovation

Methods, ideas, or system contributions that make the work stand out.

Semantic-Physical Parametric Bridge
Intrinsic-Variation principle
Semantic Alignment
Gram-matrix regularization
H
Haozhen Wei
Dalian University of Technology
C
Chengjun Jiang
Dalian University of Technology
Y
Yutong Guo
Dalian University of Technology
X
Xinrui Ju
City University of Hong Kong
X
Xingyuan Li
Zhejiang University
X
Xiang Chen
Zhejiang University
Jinyuan Liu
Jinyuan Liu
Dalian University of Technology
image processingdeep learningimage fusion