Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Movva, Prahitha, Marupaka, Naga Harshita |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enginuity: Building an Open Multi-Domain Dataset of Complex Engineering Diagrams
di: Seefried, Ethan, et al.
Pubblicazione: (2026)
di: Seefried, Ethan, et al.
Pubblicazione: (2026)
Reasoning Riddles: How Explainability Reveals Cognitive Limits in Vision-Language Models
di: Movva, Prahitha
Pubblicazione: (2025)
di: Movva, Prahitha
Pubblicazione: (2025)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
di: Xue, Junxiao, et al.
Pubblicazione: (2024)
di: Xue, Junxiao, et al.
Pubblicazione: (2024)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2024)
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2024)
Visually Interpretable Subtask Reasoning for Visual Question Answering
di: Cheng, Yu, et al.
Pubblicazione: (2025)
di: Cheng, Yu, et al.
Pubblicazione: (2025)
Multimodal Rationales for Explainable Visual Question Answering
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
Elevating Visual Question Answering through Implicitly Learned Reasoning Pathways in LVLMs
di: Jing, Liu, et al.
Pubblicazione: (2025)
di: Jing, Liu, et al.
Pubblicazione: (2025)
Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
di: Kapuriya, Janak, et al.
Pubblicazione: (2025)
di: Kapuriya, Janak, et al.
Pubblicazione: (2025)
Geospatial Chain of Thought Reasoning for Enhanced Visual Question Answering on Satellite Imagery
di: Shanker, Shambhavi, et al.
Pubblicazione: (2025)
di: Shanker, Shambhavi, et al.
Pubblicazione: (2025)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
di: Xu, Quanxing, et al.
Pubblicazione: (2026)
di: Xu, Quanxing, et al.
Pubblicazione: (2026)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
di: Choi, Changin, et al.
Pubblicazione: (2025)
di: Choi, Changin, et al.
Pubblicazione: (2025)
MapVerse: A Benchmark for Geospatial Question Answering on Diverse Real-World Maps
di: Bhat, Sharat, et al.
Pubblicazione: (2026)
di: Bhat, Sharat, et al.
Pubblicazione: (2026)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
di: Chen, Peiyuan, et al.
Pubblicazione: (2024)
di: Chen, Peiyuan, et al.
Pubblicazione: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
di: Lee, Dosung, et al.
Pubblicazione: (2025)
di: Lee, Dosung, et al.
Pubblicazione: (2025)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
di: Özdemir, Övgü, et al.
Pubblicazione: (2024)
di: Özdemir, Övgü, et al.
Pubblicazione: (2024)
VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
di: Li, Yuyi, et al.
Pubblicazione: (2025)
di: Li, Yuyi, et al.
Pubblicazione: (2025)
SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLM
di: Qiu, Jielin, et al.
Pubblicazione: (2024)
di: Qiu, Jielin, et al.
Pubblicazione: (2024)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
di: Pramanick, Shraman, et al.
Pubblicazione: (2024)
di: Pramanick, Shraman, et al.
Pubblicazione: (2024)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
di: Lee, Jusung, et al.
Pubblicazione: (2024)
di: Lee, Jusung, et al.
Pubblicazione: (2024)
VProChart: Answering Chart Question through Visual Perception Alignment Agent and Programmatic Solution Reasoning
di: Huang, Muye, et al.
Pubblicazione: (2024)
di: Huang, Muye, et al.
Pubblicazione: (2024)
Multimodal Integration of Human-Like Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
di: Lassoued, Aymen, et al.
Pubblicazione: (2026)
di: Lassoued, Aymen, et al.
Pubblicazione: (2026)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024)
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024)
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
di: Wang, Yuduo, et al.
Pubblicazione: (2023)
di: Wang, Yuduo, et al.
Pubblicazione: (2023)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
di: Tran, Duong T., et al.
Pubblicazione: (2025)
di: Tran, Duong T., et al.
Pubblicazione: (2025)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
di: Su, Tongkun, et al.
Pubblicazione: (2024)
di: Su, Tongkun, et al.
Pubblicazione: (2024)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
di: Chahe, Amirhosein, et al.
Pubblicazione: (2025)
di: Chahe, Amirhosein, et al.
Pubblicazione: (2025)
MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
di: Song, Seokwon, et al.
Pubblicazione: (2025)
di: Song, Seokwon, et al.
Pubblicazione: (2025)
RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads
di: Iyer, Vijayasri, et al.
Pubblicazione: (2026)
di: Iyer, Vijayasri, et al.
Pubblicazione: (2026)
Targeted Visual Prompting for Medical Visual Question Answering
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
di: Kim, Hongyeob, et al.
Pubblicazione: (2025)
di: Kim, Hongyeob, et al.
Pubblicazione: (2025)
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
di: Wang, Zeqing, et al.
Pubblicazione: (2023)
di: Wang, Zeqing, et al.
Pubblicazione: (2023)
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
di: Shah, Monika, et al.
Pubblicazione: (2025)
di: Shah, Monika, et al.
Pubblicazione: (2025)
Questioning the Stability of Visual Question Answering
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
di: Zhang, Jiarui, et al.
Pubblicazione: (2023)
di: Zhang, Jiarui, et al.
Pubblicazione: (2023)
Combining Knowledge Graph and LLMs for Enhanced Zero-shot Visual Question Answering
di: Tao, Qian, et al.
Pubblicazione: (2025)
di: Tao, Qian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Enginuity: Building an Open Multi-Domain Dataset of Complex Engineering Diagrams
di: Seefried, Ethan, et al.
Pubblicazione: (2026) -
Reasoning Riddles: How Explainability Reveals Cognitive Limits in Vision-Language Models
di: Movva, Prahitha
Pubblicazione: (2025) -
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
di: Xue, Junxiao, et al.
Pubblicazione: (2024) -
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
di: Peng, Jingwei, et al.
Pubblicazione: (2025) -
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2024)