Guardado en:
| Autores principales: | Lassoued, Aymen, Souibgui, Mohamed Ali, Kessentini, Yousri |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.02438 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CSSL-MHTR: Continual Self-Supervised Learning for Scalable Multi-script Handwritten Text Recognition
por: Dhiaf, Marwa, et al.
Publicado: (2023)
por: Dhiaf, Marwa, et al.
Publicado: (2023)
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
por: Souibgui, Mohamed Ali, et al.
Publicado: (2025)
por: Souibgui, Mohamed Ali, et al.
Publicado: (2025)
Privacy-Aware Document Visual Question Answering
por: Tito, Rubèn, et al.
Publicado: (2023)
por: Tito, Rubèn, et al.
Publicado: (2023)
Visually Interpretable Subtask Reasoning for Visual Question Answering
por: Cheng, Yu, et al.
Publicado: (2025)
por: Cheng, Yu, et al.
Publicado: (2025)
Machine Unlearning for Document Classification
por: Kang, Lei, et al.
Publicado: (2024)
por: Kang, Lei, et al.
Publicado: (2024)
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
por: Wang, Zeqing, et al.
Publicado: (2023)
por: Wang, Zeqing, et al.
Publicado: (2023)
VProChart: Answering Chart Question through Visual Perception Alignment Agent and Programmatic Solution Reasoning
por: Huang, Muye, et al.
Publicado: (2024)
por: Huang, Muye, et al.
Publicado: (2024)
Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions
por: Indrehus, Kjetil, et al.
Publicado: (2026)
por: Indrehus, Kjetil, et al.
Publicado: (2026)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
por: Xu, Tao
Publicado: (2026)
por: Xu, Tao
Publicado: (2026)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
por: Lim, Su Hyeon, et al.
Publicado: (2024)
por: Lim, Su Hyeon, et al.
Publicado: (2024)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
por: Peng, Jingwei, et al.
Publicado: (2025)
por: Peng, Jingwei, et al.
Publicado: (2025)
AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering
por: Li, Zongmin, et al.
Publicado: (2026)
por: Li, Zongmin, et al.
Publicado: (2026)
Selectively Answering Visual Questions
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
Geospatial Chain of Thought Reasoning for Enhanced Visual Question Answering on Satellite Imagery
por: Shanker, Shambhavi, et al.
Publicado: (2025)
por: Shanker, Shambhavi, et al.
Publicado: (2025)
Elevating Visual Question Answering through Implicitly Learned Reasoning Pathways in LVLMs
por: Jing, Liu, et al.
Publicado: (2025)
por: Jing, Liu, et al.
Publicado: (2025)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
por: Movva, Prahitha, et al.
Publicado: (2025)
por: Movva, Prahitha, et al.
Publicado: (2025)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
por: Tran, Duong T., et al.
Publicado: (2025)
por: Tran, Duong T., et al.
Publicado: (2025)
Questioning the Stability of Visual Question Answering
por: Rosenfeld, Amir, et al.
Publicado: (2025)
por: Rosenfeld, Amir, et al.
Publicado: (2025)
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
por: Wang, Zining, et al.
Publicado: (2025)
por: Wang, Zining, et al.
Publicado: (2025)
One missing piece in Vision and Language: A Survey on Comics Understanding
por: Vivoli, Emanuele, et al.
Publicado: (2024)
por: Vivoli, Emanuele, et al.
Publicado: (2024)
PACT: Pruning and Clustering-Based Token Reduction for Faster Visual Language Models
por: Dhouib, Mohamed, et al.
Publicado: (2025)
por: Dhouib, Mohamed, et al.
Publicado: (2025)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
por: Xi, Suyang, et al.
Publicado: (2026)
por: Xi, Suyang, et al.
Publicado: (2026)
Targeted Visual Prompting for Medical Visual Question Answering
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
Leveraging Contrastive Learning for a Similarity-Guided Tampered Document Data Generation Pipeline
por: Dhouib, Mohamed, et al.
Publicado: (2026)
por: Dhouib, Mohamed, et al.
Publicado: (2026)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
por: Kim, Hongyeob, et al.
Publicado: (2025)
por: Kim, Hongyeob, et al.
Publicado: (2025)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
por: Ishihara, Keishi, et al.
Publicado: (2025)
por: Ishihara, Keishi, et al.
Publicado: (2025)
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
por: Tang, Changli, et al.
Publicado: (2026)
por: Tang, Changli, et al.
Publicado: (2026)
Multi-Page Document Visual Question Answering using Self-Attention Scoring Mechanism
por: Kang, Lei, et al.
Publicado: (2024)
por: Kang, Lei, et al.
Publicado: (2024)
Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering
por: Pintore, Marco, et al.
Publicado: (2025)
por: Pintore, Marco, et al.
Publicado: (2025)
ComicsPAP: understanding comic strips by picking the correct panel
por: Vivoli, Emanuele, et al.
Publicado: (2025)
por: Vivoli, Emanuele, et al.
Publicado: (2025)
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
Evaluating Variance in Visual Question Answering Benchmarks
por: SR, Nikitha
Publicado: (2025)
por: SR, Nikitha
Publicado: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
por: Choi, Changin, et al.
Publicado: (2025)
por: Choi, Changin, et al.
Publicado: (2025)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
por: Jain, Riddhi, et al.
Publicado: (2025)
por: Jain, Riddhi, et al.
Publicado: (2025)
Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering
por: Chen, Zhuohong, et al.
Publicado: (2026)
por: Chen, Zhuohong, et al.
Publicado: (2026)
Detecting and Understanding Hateful Contents in Memes Through Captioning and Visual Question-Answering
por: Anaissi, Ali, et al.
Publicado: (2025)
por: Anaissi, Ali, et al.
Publicado: (2025)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
por: Romero, David, et al.
Publicado: (2024)
por: Romero, David, et al.
Publicado: (2024)
See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering
por: Wang, Junjie, et al.
Publicado: (2025)
por: Wang, Junjie, et al.
Publicado: (2025)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
por: Pham, Tan-Hanh, et al.
Publicado: (2024)
por: Pham, Tan-Hanh, et al.
Publicado: (2024)
Ejemplares similares
-
CSSL-MHTR: Continual Self-Supervised Learning for Scalable Multi-script Handwritten Text Recognition
por: Dhiaf, Marwa, et al.
Publicado: (2023) -
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
por: Souibgui, Mohamed Ali, et al.
Publicado: (2025) -
Privacy-Aware Document Visual Question Answering
por: Tito, Rubèn, et al.
Publicado: (2023) -
Visually Interpretable Subtask Reasoning for Visual Question Answering
por: Cheng, Yu, et al.
Publicado: (2025) -
Machine Unlearning for Document Classification
por: Kang, Lei, et al.
Publicado: (2024)