Elevating Visual Question Answering through Implicitly Learned Reasoning Pathways in LVLMs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jing, Liu, Rahman, Amirul |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Dynamic Cross-Modal Alignment for Robust Semantic Location Prediction
von: Jing, Liu, et al.
Veröffentlicht: (2024)
von: Jing, Liu, et al.
Veröffentlicht: (2024)
MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models
von: Rahman, Amirul, et al.
Veröffentlicht: (2025)
von: Rahman, Amirul, et al.
Veröffentlicht: (2025)
Visually Interpretable Subtask Reasoning for Visual Question Answering
von: Cheng, Yu, et al.
Veröffentlicht: (2025)
von: Cheng, Yu, et al.
Veröffentlicht: (2025)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
von: Movva, Prahitha, et al.
Veröffentlicht: (2025)
von: Movva, Prahitha, et al.
Veröffentlicht: (2025)
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
von: Wen, Zhihao, et al.
Veröffentlicht: (2025)
von: Wen, Zhihao, et al.
Veröffentlicht: (2025)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
von: Sun, Zhichao, et al.
Veröffentlicht: (2026)
von: Sun, Zhichao, et al.
Veröffentlicht: (2026)
VProChart: Answering Chart Question through Visual Perception Alignment Agent and Programmatic Solution Reasoning
von: Huang, Muye, et al.
Veröffentlicht: (2024)
von: Huang, Muye, et al.
Veröffentlicht: (2024)
Looking Beyond Visible Cues: Implicit Video Question Answering via Dual-Clue Reasoning
von: Chen, Tieyuan, et al.
Veröffentlicht: (2025)
von: Chen, Tieyuan, et al.
Veröffentlicht: (2025)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
von: Hao, Dongze, et al.
Veröffentlicht: (2024)
von: Hao, Dongze, et al.
Veröffentlicht: (2024)
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
von: Lassoued, Aymen, et al.
Veröffentlicht: (2026)
von: Lassoued, Aymen, et al.
Veröffentlicht: (2026)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
von: Lim, Su Hyeon, et al.
Veröffentlicht: (2024)
von: Lim, Su Hyeon, et al.
Veröffentlicht: (2024)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
von: Peng, Jingwei, et al.
Veröffentlicht: (2025)
von: Peng, Jingwei, et al.
Veröffentlicht: (2025)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
von: Xi, Suyang, et al.
Veröffentlicht: (2026)
von: Xi, Suyang, et al.
Veröffentlicht: (2026)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
von: Tran, Duong T., et al.
Veröffentlicht: (2025)
von: Tran, Duong T., et al.
Veröffentlicht: (2025)
Geospatial Chain of Thought Reasoning for Enhanced Visual Question Answering on Satellite Imagery
von: Shanker, Shambhavi, et al.
Veröffentlicht: (2025)
von: Shanker, Shambhavi, et al.
Veröffentlicht: (2025)
EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning
von: Li, Zhihao, et al.
Veröffentlicht: (2024)
von: Li, Zhihao, et al.
Veröffentlicht: (2024)
Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering
von: Li, Qiming, et al.
Veröffentlicht: (2025)
von: Li, Qiming, et al.
Veröffentlicht: (2025)
Selectively Answering Visual Questions
von: Eisenschlos, Julian Martin, et al.
Veröffentlicht: (2024)
von: Eisenschlos, Julian Martin, et al.
Veröffentlicht: (2024)
QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning
von: Xu, Quanxing, et al.
Veröffentlicht: (2025)
von: Xu, Quanxing, et al.
Veröffentlicht: (2025)
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
von: Zhang, Yongchang, et al.
Veröffentlicht: (2026)
von: Zhang, Yongchang, et al.
Veröffentlicht: (2026)
Targeted Visual Prompting for Medical Visual Question Answering
von: Tascon-Morales, Sergio, et al.
Veröffentlicht: (2024)
von: Tascon-Morales, Sergio, et al.
Veröffentlicht: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
von: Ishmam, Md Farhan, et al.
Veröffentlicht: (2024)
von: Ishmam, Md Farhan, et al.
Veröffentlicht: (2024)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
von: Ishihara, Keishi, et al.
Veröffentlicht: (2025)
von: Ishihara, Keishi, et al.
Veröffentlicht: (2025)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
von: Kim, Hongyeob, et al.
Veröffentlicht: (2025)
von: Kim, Hongyeob, et al.
Veröffentlicht: (2025)
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
von: Wang, Zeqing, et al.
Veröffentlicht: (2023)
von: Wang, Zeqing, et al.
Veröffentlicht: (2023)
Questioning the Stability of Visual Question Answering
von: Rosenfeld, Amir, et al.
Veröffentlicht: (2025)
von: Rosenfeld, Amir, et al.
Veröffentlicht: (2025)
ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla
von: Barua, Deeparghya Dutta, et al.
Veröffentlicht: (2024)
von: Barua, Deeparghya Dutta, et al.
Veröffentlicht: (2024)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
von: Özdemir, Övgü, et al.
Veröffentlicht: (2024)
von: Özdemir, Övgü, et al.
Veröffentlicht: (2024)
Evaluating Variance in Visual Question Answering Benchmarks
von: SR, Nikitha
Veröffentlicht: (2025)
von: SR, Nikitha
Veröffentlicht: (2025)
Multimodal Rationales for Explainable Visual Question Answering
von: Li, Kun, et al.
Veröffentlicht: (2024)
von: Li, Kun, et al.
Veröffentlicht: (2024)
Prompt-based Personalized Federated Learning for Medical Visual Question Answering
von: Zhu, He, et al.
Veröffentlicht: (2024)
von: Zhu, He, et al.
Veröffentlicht: (2024)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
von: Liu, Huabin, et al.
Veröffentlicht: (2025)
von: Liu, Huabin, et al.
Veröffentlicht: (2025)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
von: Tang, Jingqun, et al.
Veröffentlicht: (2024)
von: Tang, Jingqun, et al.
Veröffentlicht: (2024)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
von: Romero, David, et al.
Veröffentlicht: (2024)
von: Romero, David, et al.
Veröffentlicht: (2024)
See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering
von: Wang, Junjie, et al.
Veröffentlicht: (2025)
von: Wang, Junjie, et al.
Veröffentlicht: (2025)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
von: Pham, Tan-Hanh, et al.
Veröffentlicht: (2024)
von: Pham, Tan-Hanh, et al.
Veröffentlicht: (2024)
Latent Implicit Visual Reasoning
von: Li, Kelvin, et al.
Veröffentlicht: (2025)
von: Li, Kelvin, et al.
Veröffentlicht: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
von: Choi, Changin, et al.
Veröffentlicht: (2025)
von: Choi, Changin, et al.
Veröffentlicht: (2025)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
von: Jain, Riddhi, et al.
Veröffentlicht: (2025)
von: Jain, Riddhi, et al.
Veröffentlicht: (2025)
Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering
von: Chen, Zhuohong, et al.
Veröffentlicht: (2026)
von: Chen, Zhuohong, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Dynamic Cross-Modal Alignment for Robust Semantic Location Prediction
von: Jing, Liu, et al.
Veröffentlicht: (2024) -
MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models
von: Rahman, Amirul, et al.
Veröffentlicht: (2025) -
Visually Interpretable Subtask Reasoning for Visual Question Answering
von: Cheng, Yu, et al.
Veröffentlicht: (2025) -
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
von: Movva, Prahitha, et al.
Veröffentlicht: (2025) -
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
von: Wen, Zhihao, et al.
Veröffentlicht: (2025)