ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Lassoued, Aymen, Souibgui, Mohamed Ali, Kessentini, Yousri |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CSSL-MHTR: Continual Self-Supervised Learning for Scalable Multi-script Handwritten Text Recognition
di: Dhiaf, Marwa, et al.
Pubblicazione: (2023)
di: Dhiaf, Marwa, et al.
Pubblicazione: (2023)
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
di: Souibgui, Mohamed Ali, et al.
Pubblicazione: (2025)
di: Souibgui, Mohamed Ali, et al.
Pubblicazione: (2025)
Privacy-Aware Document Visual Question Answering
di: Tito, Rubèn, et al.
Pubblicazione: (2023)
di: Tito, Rubèn, et al.
Pubblicazione: (2023)
Visually Interpretable Subtask Reasoning for Visual Question Answering
di: Cheng, Yu, et al.
Pubblicazione: (2025)
di: Cheng, Yu, et al.
Pubblicazione: (2025)
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
di: Wang, Zeqing, et al.
Pubblicazione: (2023)
di: Wang, Zeqing, et al.
Pubblicazione: (2023)
VProChart: Answering Chart Question through Visual Perception Alignment Agent and Programmatic Solution Reasoning
di: Huang, Muye, et al.
Pubblicazione: (2024)
di: Huang, Muye, et al.
Pubblicazione: (2024)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024)
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024)
Machine Unlearning for Document Classification
di: Kang, Lei, et al.
Pubblicazione: (2024)
di: Kang, Lei, et al.
Pubblicazione: (2024)
AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering
di: Li, Zongmin, et al.
Pubblicazione: (2026)
di: Li, Zongmin, et al.
Pubblicazione: (2026)
Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions
di: Indrehus, Kjetil, et al.
Pubblicazione: (2026)
di: Indrehus, Kjetil, et al.
Pubblicazione: (2026)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
di: Xu, Tao
Pubblicazione: (2026)
di: Xu, Tao
Pubblicazione: (2026)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
di: Tran, Duong T., et al.
Pubblicazione: (2025)
di: Tran, Duong T., et al.
Pubblicazione: (2025)
Geospatial Chain of Thought Reasoning for Enhanced Visual Question Answering on Satellite Imagery
di: Shanker, Shambhavi, et al.
Pubblicazione: (2025)
di: Shanker, Shambhavi, et al.
Pubblicazione: (2025)
Elevating Visual Question Answering through Implicitly Learned Reasoning Pathways in LVLMs
di: Jing, Liu, et al.
Pubblicazione: (2025)
di: Jing, Liu, et al.
Pubblicazione: (2025)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
di: Movva, Prahitha, et al.
Pubblicazione: (2025)
di: Movva, Prahitha, et al.
Pubblicazione: (2025)
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
di: Wang, Zining, et al.
Pubblicazione: (2025)
di: Wang, Zining, et al.
Pubblicazione: (2025)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
Targeted Visual Prompting for Medical Visual Question Answering
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
di: Kim, Hongyeob, et al.
Pubblicazione: (2025)
di: Kim, Hongyeob, et al.
Pubblicazione: (2025)
Multi-Page Document Visual Question Answering using Self-Attention Scoring Mechanism
di: Kang, Lei, et al.
Pubblicazione: (2024)
di: Kang, Lei, et al.
Pubblicazione: (2024)
Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering
di: Pintore, Marco, et al.
Pubblicazione: (2025)
di: Pintore, Marco, et al.
Pubblicazione: (2025)
Questioning the Stability of Visual Question Answering
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
di: Xi, Suyang, et al.
Pubblicazione: (2026)
di: Xi, Suyang, et al.
Pubblicazione: (2026)
Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering
di: Chen, Zhuohong, et al.
Pubblicazione: (2026)
di: Chen, Zhuohong, et al.
Pubblicazione: (2026)
Multimodal Rationales for Explainable Visual Question Answering
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
Evaluating Variance in Visual Question Answering Benchmarks
di: SR, Nikitha
Pubblicazione: (2025)
di: SR, Nikitha
Pubblicazione: (2025)
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
di: Tang, Changli, et al.
Pubblicazione: (2026)
di: Tang, Changli, et al.
Pubblicazione: (2026)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
di: Romero, David, et al.
Pubblicazione: (2024)
di: Romero, David, et al.
Pubblicazione: (2024)
See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering
di: Wang, Junjie, et al.
Pubblicazione: (2025)
di: Wang, Junjie, et al.
Pubblicazione: (2025)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2024)
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2024)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
di: Choi, Changin, et al.
Pubblicazione: (2025)
di: Choi, Changin, et al.
Pubblicazione: (2025)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
di: Jain, Riddhi, et al.
Pubblicazione: (2025)
di: Jain, Riddhi, et al.
Pubblicazione: (2025)
Leveraging Contrastive Learning for a Similarity-Guided Tampered Document Data Generation Pipeline
di: Dhouib, Mohamed, et al.
Pubblicazione: (2026)
di: Dhouib, Mohamed, et al.
Pubblicazione: (2026)
PACT: Pruning and Clustering-Based Token Reduction for Faster Visual Language Models
di: Dhouib, Mohamed, et al.
Pubblicazione: (2025)
di: Dhouib, Mohamed, et al.
Pubblicazione: (2025)
Detecting and Understanding Hateful Contents in Memes Through Captioning and Visual Question-Answering
di: Anaissi, Ali, et al.
Pubblicazione: (2025)
di: Anaissi, Ali, et al.
Pubblicazione: (2025)
DriveLM: Driving with Graph Visual Question Answering
di: Sima, Chonghao, et al.
Pubblicazione: (2023)
di: Sima, Chonghao, et al.
Pubblicazione: (2023)
Object Retrieval for Visual Question Answering with Outside Knowledge
di: Kan, Shichao, et al.
Pubblicazione: (2024)
di: Kan, Shichao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CSSL-MHTR: Continual Self-Supervised Learning for Scalable Multi-script Handwritten Text Recognition
di: Dhiaf, Marwa, et al.
Pubblicazione: (2023) -
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
di: Souibgui, Mohamed Ali, et al.
Pubblicazione: (2025) -
Privacy-Aware Document Visual Question Answering
di: Tito, Rubèn, et al.
Pubblicazione: (2023) -
Visually Interpretable Subtask Reasoning for Visual Question Answering
di: Cheng, Yu, et al.
Pubblicazione: (2025) -
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
di: Wang, Zeqing, et al.
Pubblicazione: (2023)