RouteGraph-Mona: Confusion-Aware Routing Fine-Tuning for Mineral Image Classification

📅 2026-09-02
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
为解决矿物图像分类中类内差异大和类间相似度高的问题,提出RouteGraph-Mona方法,通过自适应路由选择与基于混淆加权的正则化来优化模型。
📝 Abstract
Mineral image classification is important for geological exploration and resource development, but it remains challenging due to substantial intra-class variations in appearance and high inter-class visual similarity. Multi-cognitive Visual Adapter (Mona) is a vision-oriented parameter-efficient adapter that adapts pre-trained visual models by tuning only a few parameters. However, Mona statically aggregates responses from multiple scales, limiting its ability to accommodate sample-specific scale preferences and model confusion among visually similar mineral categories. To address this issue, we propose \textbf{RouteGraph-Mona}, a lightweight route-space regularization method built on Mona. Specifically, we replace Mona's static multi-scale aggregation with sample-adaptive routing. The resulting branch-selection behavior defines a compact routing space that captures each image's scale preferences. We then regularize the resulting routing signatures with class-wise route anchors and confusion-weighted margins. The route anchors encourage class-consistent routing patterns, while the margins promote greater separation between visually similar categories in the routing space. Experiments on three public mineral image datasets with two visual backbones show that RouteGraph-Mona consistently outperforms Mona in mean accuracy and remains competitive with representative fine-tuning methods and mineral image classification baselines.
Problem

Research questions and friction points this paper is trying to address.

Mineral Image Classification
Intra-class Variations
Inter-class Similarity
Parameter-efficient Adapter
Innovation

Methods, ideas, or system contributions that make the work stand out.

sample-adaptive routing
route-space regularization
confusion-weighted margins
🔎 Similar Papers
No similar papers found.
Jierui Li
Jierui Li
University of Texas at Austin
Natural Language Processing
Z
Zhiyuan Qi
Tsinghua University, Beijing, China
Hao Zhu
Hao Zhu
Xidian University
Deep learningRemote sensingMultimodal Joint Learning
Yufan Liu
Yufan Liu
Institute of Automation, Chinese Academy of Sciences
Image/video processingKnowledge DistillationSaliency detectionModel compressionVideo coding
J
Jixian Liu
Xidian University, Xi’an, China
S
Shaojie Jiang
Xidian University, Xi’an, China
J
Jianda Wang
Xidian University, Xi’an, China
Y
Yaqi Liu
Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China
Xiaotong Li
Xiaotong Li
Peking University
Multimodal LLMFoundation ModelTransfer Learning
W
Wei Wang
Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China