GRACE: Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration for Educational Visual Question Answering

๐Ÿ“… 2026-08-19
๐Ÿ“ˆ Citations: 0
โœจ Influential: 0
๐Ÿ“„ PDF
๐Ÿค– AI Summary
ๆœฌๆ–‡ๆๅ‡บGRACEๆก†ๆžถ๏ผŒ้€š่ฟ‡้€‚้…ๅ™จ็ป„ๅˆๅ’Œ่ฏๆฎๆ„Ÿ็Ÿฅๆ กๅ‡†่งฃๅ†ณๆ•™่‚ฒ่ง†่ง‰้—ฎ็ญ”ไธญ็š„้—ฎ้ข˜๏ผŒๆ้ซ˜ไบ†ๆจกๅž‹ๅœจๅคšๆจกๆ€ๆƒ…ๅขƒไธ‹็š„ๅ‡†็กฎ็އใ€‚
๐Ÿ“ Abstract
Educational visual question answering, or VQA, requires models to solve curriculum-oriented multiple-choice questions using both language and visual evidence. Compared with conventional open-ended VQA, educational examples often include structured assessment metadata, diagrams or image contexts, and semantically close answer options, creating strong opportunities for question-option shortcuts. We develop and evaluate a parameter-efficient adaptation framework for a frozen multimodal large language model in this setting. We introduce GRACE, Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration, a framework that uses the pedagogical state of each question to specialize lightweight language and vision adaptation. The state combines inference-visible subject, grouped skill, grade, visual-context, question-intent, and option-structure cues. GRACE uses factor-specific prompts and lightweight visual adapters, then applies evidence-aware option calibration to score all candidates under a shared multimodal context. On ScienceQA, GRACE improves a shared-adapter baseline from 90.5 percent to 93.1 percent overall accuracy and from 88.7 percent to 91.2 percent on image-context questions. Removing pedagogical composition, option calibration, or the visual adapter reduces overall accuracy by 1.4, 1.0, and 1.5 points, respectively. These controlled results show that structured educational state is an effective routing signal for parameter-efficient multimodal adaptation.
Problem

Research questions and friction points this paper is trying to address.

Educational Visual Question Answering
Multimodal Large Language Model
Parameter-efficient Adaptation
Structured Assessment Metadata
Visual Evidence
Innovation

Methods, ideas, or system contributions that make the work stand out.

Grounded Reasoning
Adapter Composition
Evidence-Aware Calibration
Educational Visual Question Answering
Parameter-Efficient Adaptation
๐Ÿ”Ž Similar Papers
No similar papers found.
๐Ÿ’ผ Related Jobs
No related jobs found.
X
Xinjin Li
Columbia University, New York, NY, USA
Y
Yudi Xia
Independent Researcher
X
Xi Zhao
Columbia University, New York, NY, USA
Y
Yiliu Xu
Carnegie Mellon University, Pittsburgh, PA, USA
Yining Liu
Yining Liu
Wenzhou University of Technology
VANET AuthenticationPrivacy-preserving data aggregationTrajectory privacy
C
Cheng Lu
Stevens Institute of Technology, Hoboken, NJ, USA
Y
Yujian Long
Georgetown University, Washington, DC, USA
Yu Ma
Yu Ma
Indiana University
Computer Science
Jinghan Cao
Jinghan Cao
San Francisco State University
Deep LearningLarge Language ModelCloud Software Computating
L
Liang Fan
Loughborough University, Loughborough, UK
Y
Yeyun Xu
Texas A&M University, College Station, TX, USA