Frontiers in FinTech: Multimodal Foundation Models for Financial Reporting and Decision Science

📅 2026-08-23
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
研究通过FinVision系统,利用多模态大语言模型处理异构财务数据,提高估值准确性和决策效率。
📝 Abstract
Heterogeneous financial data spanning PDF reports, Excel statements, chart images, and scanned policy documents challenge accounting information systems (AIS). This study introduces FinVision, a multimodal large language model (MLLM) system integrating vision-language models with domain-specific financial reasoning. Three innovations: (1) multimodal document intelligence with an automated cross-modal consistency validator mirroring audit evidence corroboration; (2) domain-adaptive two-stage training mastering valuation methodologies (DCF, P/E, P/B, P/S); and (3) a natural-language decision pipeline integrating modern portfolio theory, real-time risk monitoring, and multi-turn dialogue. Validation on 200 listed companies shows a 19 percent reduction in valuation error, and a user study with 48 professionals shows a 51 percent reduction in task completion time. Implications for audit automation, financial reporting quality, and democratized expert-level analysis are discussed.
Problem

Research questions and friction points this paper is trying to address.

heterogeneous financial data
accounting information systems
multimodal document intelligence
Innovation

Methods, ideas, or system contributions that make the work stand out.

multimodal document intelligence
cross-modal consistency validator
domain-adaptive two-stage training
natural-language decision pipeline
🔎 Similar Papers
No similar papers found.
Y
Yulu Huang
School of Accounting, Jiangxi University of Finance and Economics
N
Niannian Yu
School of Accounting, Jiangxi University of Finance and Economics
Y
Yaxin Yang
School of Accounting, Jiangxi University of Finance and Economics
Yong Huang
Yong Huang
The Hong Kong University of Science and Technology
OrganocatalysisAsymmetric CatalysisN-Heterocyclic CarbeneMedicinal Chemistry