PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Ding, Yihao, Ren, Kaixuan, Huang, Jiabin, Luo, Siwen, Han, Soyeon Caren |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodal Commonsense Knowledge Distillation for Visual Question Answering
por: Yang, Shuo, et al.
Publicado: (2024)
por: Yang, Shuo, et al.
Publicado: (2024)
Deep Learning based Visually Rich Document Content Understanding: A Survey
por: Ding, Yihao, et al.
Publicado: (2024)
por: Ding, Yihao, et al.
Publicado: (2024)
MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering
por: Yang, Shuo, et al.
Publicado: (2025)
por: Yang, Shuo, et al.
Publicado: (2025)
MSG-Chart: Multimodal Scene Graph for ChartQA
por: Dai, Yue, et al.
Publicado: (2024)
por: Dai, Yue, et al.
Publicado: (2024)
3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding
por: Ding, Yihao, et al.
Publicado: (2024)
por: Ding, Yihao, et al.
Publicado: (2024)
Graph-Based Multimodal Contrastive Learning for Chart Question Answering
por: Dai, Yue, et al.
Publicado: (2025)
por: Dai, Yue, et al.
Publicado: (2025)
SynJAC: Synthetic-data-driven Joint-granular Adaptation and Calibration for Domain Specific Scanned Document Key Information Extraction
por: Ding, Yihao, et al.
Publicado: (2024)
por: Ding, Yihao, et al.
Publicado: (2024)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
por: Shaaban, Mai A., et al.
Publicado: (2025)
por: Shaaban, Mai A., et al.
Publicado: (2025)
PDF Retrieval Augmented Question Answering
por: Hoang, Thi Thu Uyen, et al.
Publicado: (2025)
por: Hoang, Thi Thu Uyen, et al.
Publicado: (2025)
VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding
por: Ding, Yihao, et al.
Publicado: (2025)
por: Ding, Yihao, et al.
Publicado: (2025)
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
por: Xie, Xudong, et al.
Publicado: (2024)
por: Xie, Xudong, et al.
Publicado: (2024)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
por: Sood, Ekta, et al.
Publicado: (2021)
por: Sood, Ekta, et al.
Publicado: (2021)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
por: Dong, Kuicai, et al.
Publicado: (2025)
por: Dong, Kuicai, et al.
Publicado: (2025)
Multimodal Integration of Human-Like Attention in Visual Question Answering
por: Sood, Ekta, et al.
Publicado: (2021)
por: Sood, Ekta, et al.
Publicado: (2021)
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
por: Inadumi, Shun, et al.
Publicado: (2024)
por: Inadumi, Shun, et al.
Publicado: (2024)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
por: Su, Tongkun, et al.
Publicado: (2024)
por: Su, Tongkun, et al.
Publicado: (2024)
Selectively Answering Visual Questions
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking
por: Ahmed, Rafid, et al.
Publicado: (2026)
por: Ahmed, Rafid, et al.
Publicado: (2026)
ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla
por: Barua, Deeparghya Dutta, et al.
Publicado: (2024)
por: Barua, Deeparghya Dutta, et al.
Publicado: (2024)
Lightweight and Production-Ready PDF Visual Element Parsing
por: Liu, Meizhu, et al.
Publicado: (2026)
por: Liu, Meizhu, et al.
Publicado: (2026)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
por: Pramanick, Shraman, et al.
Publicado: (2024)
por: Pramanick, Shraman, et al.
Publicado: (2024)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
por: Zhang, Jiarui, et al.
Publicado: (2023)
por: Zhang, Jiarui, et al.
Publicado: (2023)
3M-Health: Multimodal Multi-Teacher Knowledge Distillation for Mental Health Detection
por: Cabral, Rina Carines, et al.
Publicado: (2024)
por: Cabral, Rina Carines, et al.
Publicado: (2024)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
por: Kim, Jongha, et al.
Publicado: (2026)
por: Kim, Jongha, et al.
Publicado: (2026)
Harnessing PDF Data for Improving Japanese Large Multimodal Models
por: Baek, Jeonghun, et al.
Publicado: (2025)
por: Baek, Jeonghun, et al.
Publicado: (2025)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
por: Chen, Peiyuan, et al.
Publicado: (2024)
por: Chen, Peiyuan, et al.
Publicado: (2024)
AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning
por: Zhang, Peifeng, et al.
Publicado: (2026)
por: Zhang, Peifeng, et al.
Publicado: (2026)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
por: Ma, Ziyu, et al.
Publicado: (2024)
por: Ma, Ziyu, et al.
Publicado: (2024)
Location-Aware Pretraining for Medical Difference Visual Question Answering
por: Musinguzi, Denis, et al.
Publicado: (2026)
por: Musinguzi, Denis, et al.
Publicado: (2026)
Graph Neural Networks for Text Classification: A Survey
por: Wang, Kunze, et al.
Publicado: (2023)
por: Wang, Kunze, et al.
Publicado: (2023)
BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence
por: Xiang, Biao, et al.
Publicado: (2026)
por: Xiang, Biao, et al.
Publicado: (2026)
SynDoc: A Hybrid Discriminative-Generative Framework for Enhancing Synthetic Domain-Adaptive Document Key Information Extraction
por: Ding, Yihao, et al.
Publicado: (2025)
por: Ding, Yihao, et al.
Publicado: (2025)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
por: Long, Xinwei, et al.
Publicado: (2025)
por: Long, Xinwei, et al.
Publicado: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
por: Cocchi, Federico, et al.
Publicado: (2024)
por: Cocchi, Federico, et al.
Publicado: (2024)
SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling
por: Wang, Eileen, et al.
Publicado: (2024)
por: Wang, Eileen, et al.
Publicado: (2024)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
por: Kuang, Jiayi, et al.
Publicado: (2024)
por: Kuang, Jiayi, et al.
Publicado: (2024)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
por: Lim, Qi Zhi, et al.
Publicado: (2025)
por: Lim, Qi Zhi, et al.
Publicado: (2025)
CommVQA: Situating Visual Question Answering in Communicative Contexts
por: Naik, Nandita Shankar, et al.
Publicado: (2024)
por: Naik, Nandita Shankar, et al.
Publicado: (2024)
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
por: Nguyen, Ngoc Son, et al.
Publicado: (2024)
por: Nguyen, Ngoc Son, et al.
Publicado: (2024)
Exploring Diverse Methods in Visual Question Answering
por: Li, Panfeng, et al.
Publicado: (2024)
por: Li, Panfeng, et al.
Publicado: (2024)
Ejemplares similares
-
Multimodal Commonsense Knowledge Distillation for Visual Question Answering
por: Yang, Shuo, et al.
Publicado: (2024) -
Deep Learning based Visually Rich Document Content Understanding: A Survey
por: Ding, Yihao, et al.
Publicado: (2024) -
MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering
por: Yang, Shuo, et al.
Publicado: (2025) -
MSG-Chart: Multimodal Scene Graph for ChartQA
por: Dai, Yue, et al.
Publicado: (2024) -
3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding
por: Ding, Yihao, et al.
Publicado: (2024)